Como primer autor del manuscrito, voy a responder algunas preguntas y aclarar malentendidos. Los lanzamientos que parecen tener pocas rotaciones en su mayoría fueron grabados con una webcam de 30 FPS, por lo que a menudo la rotación de la moneda era mucho más rápida que el sensor y parecía no girar; el video servía para verificar si se habían recolectado datos y para auditar los resultados.
No construimos una máquina lanzadora, porque este estudio trata sobre lanzamientos de moneda hechos por personas, y Diaconis, Holmes y Montgomery (DHM, 2007) teorizaron que las imperfecciones del lanzamiento humano generan un sesgo hacia la misma cara. Si construyéramos una máquina, se perdería el propósito mismo del experimento.
Tampoco es acertada la crítica de que hubo demasiados autores y se desperdició dinero público. El experimento se hizo en tiempo libre y no hubo financiamiento de investigación, así que tampoco hubo dinero desperdiciado. También cuesta entender por qué debería molestar tanto haber dado coautoría a los estudiantes que contribuyeron lanzando monedas todo el día; sin ellos el experimento habría sido imposible.
No todo el mundo lanza una moneda de manera perfecta, y algunas personas son mucho más torpes. A los participantes se les indicó que la lanzaran como lo harían al decidir una apuesta, y que la moneda diera al menos una vuelta. En la mayoría, el sesgo disminuyó con el tiempo, lo que sugiere que con la práctica lanzaban mejor y el sesgo se reducía; esto también debilita la teoría de que aprendieron deliberadamente a introducir sesgo.
Personalmente lancé más de 20.000 veces, pero no tengo la menor idea de cómo generar el sesgo. También hicimos varias veces análisis de sensibilidad excluyendo valores atípicos; el efecto se redujo un poco, pero todavía había suficiente evidencia que respaldaba a DHM. Si desconfían de los antecedentes estadísticos, pueden reanalizarlo ustedes mismos con los datos y scripts de limpieza en OSF: https://osf.io/mhvp7/
No tengo objeciones al análisis, y coincido en que los resultados respaldan fuertemente el modelo D-H-M: es decir, que hay un ligero sesgo en el lanzamiento de monedas y que su causa es la precesión. Sin embargo, alrededor de un tercio de los voluntarios tuvo poco o ningún sesgo, probablemente porque lanzaban la moneda de extremo a extremo sin precesión; y otro tercio aproximadamente parece haber tenido mucha precesión y sesgo.
El artículo concluye que el lanzamiento de monedas tiene de forma inherente un sesgo pequeño pero significativo, pero al ver la tabla 2 parece igualmente válida la conclusión de que algunas personas lanzan sin sesgo y otras no. En particular, esperaría que si a los participantes con valores atípicos grandes se les explicara la precesión y se les pidiera reducirla deliberadamente, el sesgo disminuiría o desaparecería.
También existe un enfoque que intenta analizar datos de lanzamientos de monedas mediante sonido en lugar de una webcam de baja tasa de cuadros. El sonido normalmente se graba con una frecuencia de muestreo mucho más alta, suficiente como para “oír” la rotación de la moneda: https://cs.stanford.edu/~kach/can-one-hear-the-fate-of-a-coi...
Me pregunto si para lanzadores menos hábiles podría operar una curva algo parecida a la ley de Benford. Si asumimos que da al menos una vuelta, 1,0 rotaciones cae con la cara inicial, 1,5 rotaciones cae con la cara opuesta, 2,0 rotaciones vuelve a caer con la cara inicial, y así sucesivamente.
La NFL todavía lanza monedas de forma profesional. Me pregunto si habrá video de cada lanzamiento con mejor calidad que una webcam, y algún bookmaker en algún lugar seguramente estaría bastante interesado en posibles sesgos.
Aquí hay un video que presenta bien el paper: https://www.youtube.com/watch?v=-QjgvbvFoQA
La idea central es que el efecto proviene de la precesión. Es decir, la moneda no se voltea de manera completamente vertical, sino que gira con un ligero bamboleo y momento angular, mostrando una cara durante más tiempo que la otra.
El impacto sobre la equidad varía según la técnica: con una buena técnica, la probabilidad de la misma cara fue de alrededor de p_same = 0.508, y un participante del estudio mostró 0.6 en una muestra grande, algo extremadamente improbable si los lanzamientos fueran puramente justos. Como ejemplo extremo, el video muestra a un mago usando la precesión para hacer un truco que parece un volteo, pero en realidad la cara no cambia: la moneda rota dentro de su propio plano y se bambolea un poco.
Este video también explica bastante bien cómo funciona la prueba de hipótesis.
Aquí sería bueno usar estadística bayesiana. Aunque el presentador dice que no sabe mucho de estadística.
El artículo parece tener un tamaño de muestra grande, pero en realidad solo hubo 48 evaluadores/lanzadores. En algunos videos se ven lanzamientos muy bajos y con pocas rotaciones, digamos de apenas 1 o 2 vueltas, y probablemente repitieron eso miles de veces de la misma manera.
Por eso, el tamaño de muestra real del estudio se acerca más a N=48, y las personas que no lanzan bien —es decir, quienes hacen lanzamientos de poca rotación, poca altura y pocos giros— podrían influir de forma desproporcionada en los resultados.
Los antecedentes de los autores tampoco parecen estar especialmente centrados en estadística. De los 48 autores, todos salvo 3 lanzaron monedas, así que algunos quizá eran más sujetos de prueba que autores. Me parece que ser sujeto de tu propio estudio también podría introducir sesgos.
Si uno intenta demostrarse a sí mismo que cierto factor hace que la moneda caiga de un lado, sobre todo si la lanza bajo y despacio, podría terminar aprendiendo esa técnica. Viendo los resultados del estudio, parece que algunos lanzadores la dominaron bastante bien. Si los autores hubieran estado convencidos de que una moneda justa cae del lado contrario al inicial e hicieran el mismo estudio, creo que también podrían haber producido datos y un artículo que lo demostraran.
Si hablamos de “evaluadores que no lanzan bien”, entonces en los lanzamientos de moneda antes de los partidos deportivos también debería haber equipos de árbitros capacitados que determinen su validez. Para mantener la integridad de esta disciplina cuando se emitan nuevas monedas y se propongan distintos estilos de lanzamiento, harían falta organizaciones locales, nacionales e internacionales y sistemas de formación de árbitros, y habría que restringir la membresía a integrantes de la Ancient Order of Coin Flippers.
Creo que ese es el punto clave. Muestra que los resultados salen sesgados porque la gente normalmente no lanza bien.
La verdadera lección quizá sea que, si uno tiene suficiente habilidad o entrena durante bastante tiempo, puede manipular las probabilidades de forma bastante significativa sin que nadie se dé cuenta.
Este artículo verificó experimentalmente un modelo estadístico propuesto por un artículo anterior. El experimento coincidió exactamente con lo que predecía ese modelo, y la razón de que no sea 50/50 es la precesión de la moneda.
En la práctica, parece más sólido abordarlo con errores estándar agrupados. La intuición básica es similar, pero el tamaño de muestra existe por persona, y las observaciones no son independientes lanzamiento por lanzamiento, sino que la independencia se da entre personas. https://en.m.wikipedia.org/wiki/Clustered_standard_errors
No me sorprende que haya algún efecto, pero sospeché que quizá no habían usado lanzamientos de moneda legítimos. Parece que mucha gente no sabe lanzar bien una moneda, y al ver el video, al menos los lanzamientos de Bartos parecen confirmar esa sospecha: https://osf.io/6a5hy/
Tiene muy pocas rotaciones y pasa muy poco tiempo en el aire. Si fuera un asunto que valiera la pena decidir con un lanzamiento de moneda, no aceptaría ese método.
Eso casi no es un lanzamiento de moneda, sino más bien arrojarla apenas hacia arriba. Ver eso me hace sentir que se cae la credibilidad de todo el estudio y de los autores.
Claro que podría haber algún efecto, pero quienes no vean los videos van a imaginar una escena totalmente distinta. Si no me hubieran dicho que los mirara, creo que yo tampoco los habría revisado. Es difícil creer que los autores no sepan lo engañoso que puede ser presentar esto así, y mi intuición es que un lanzamiento de moneda bien hecho no mostraría las mismas características.
Al principio yo tenía la misma objeción. Pero si la mayoría de la gente realmente lanza la moneda así, entonces la medición es válida. Porque la conclusión trata de lo que hace la gente común, no de un lanzamiento mecánico de moneda perfecto. Si no, caemos en la falacia de “no hay verdadero lanzamiento de moneda”.
Me da la impresión de que la ciencia, como todo lo demás, en realidad es un espectro. Depende de qué tan fanático seas al hacer las pruebas.
Podrías lanzar la moneda durante años con una máquina automatizada tantas veces como sea posible, variar la fuerza y el ángulo de lanzamiento, detectar desgaste submilimétrico en la superficie de la moneda y probar todos los estilos y tamaños existentes, todos los niveles de desgaste, todas las posiciones y ángulos, y todas las combinaciones de composición de la atmósfera terrestre, y aun así me preguntaría qué significan realmente esos resultados. En la práctica serían más una lista de eventos exactos que una “conclusión”, y en el futuro seguiríamos describiendo ese acto en términos de probabilidades de resultado.
Este artículo también ganó este año un Ig Nobel Prize.
“Probabilidad: un equipo de 50 investigadores que realizó 350,757 experimentos para demostrar que, al lanzar una moneda, es ligeramente más probable que caiga del mismo lado con el que empezó”.
Fuente: https://en.wikipedia.org/wiki/List_of_Ig_Nobel_Prize_winners...
Entre los ganadores de este año también hay uno de botánica. Jacob White y Felipe Yamashita descubrieron que una planta imita la forma de las hojas de plantas de plástico cercanas y concluyeron que la “visión vegetal” es plausible, pero eso no encaja del todo con la imagen que tengo del Ig Nobel Prize.
Esto es algo conocido entre magos desde hace décadas. No creo que un solo mago haya lanzado la moneda 350 mil veces, pero cuando era niño yo mismo la lancé unas 2,500 veces para probar ese efecto.
Si 30 magos hubieran combinado sus datos, habría sido posible un metaanálisis de este tamaño, y el experimento se habría hecho hace más o menos un siglo.
No está totalmente relacionado, pero hace tiempo descubrí que, al menos con una moneda australiana de 20 centavos, es bastante fácil hacer trampa en un lanzamiento de moneda. Después de lanzarla y atraparla con la mano, al pasarla al dorso de la otra mano puedes sentir al tacto qué lado está arriba y voltearla si quieres.
En nuestra moneda, la cara con el rostro de la reina tiene una zona amplia y lisa, así que se distingue bastante del reverso rugoso con el ornitorrinco y el patrón de agua. Si vas a decidir algo importante con una moneda, debes asegurarte de que caiga directamente al suelo.
Lo que aprendí de este hilo es que el problema de un lanzamiento de moneda justo no es si es realmente justo, sino qué cuenta como un lanzamiento de moneda bien hecho. Y el problema es quién lo decide.
Si la mayoría de la gente no lanza así, ¿deberíamos diseñar una máquina para lanzar monedas? ¿Deberíamos controlar también otros factores? ¿O el hecho de que lo haga una persona, con sus imperfecciones incluidas, es algo esencial para los conceptos de lanzamiento de moneda, estadística y aleatoriedad?
Cuando tenía unos seis o siete años, aprendí un truco para lanzar monedas de un barbero en la tienda de mi abuelo. Desde entonces, siempre podía lanzar una moneda y determinar el resultado. En realidad, la clave es simplemente ser consistente en la forma de lanzarla y atraparla.
Si puedes hacerlo lanzándola rápido y con la moneda girando rápidamente en el aire, es bastante impresionante.
Ese artículo, de hecho, se cita tanto en este artículo como en el video. Diaconis presentó un modelo en el que la preferencia por la “misma cara” era de alrededor del 51%, y creo que dijo que, tras lanzar la moneda 2,500 veces él mismo, se necesitarían unos 250,000 lanzamientos para obtener significancia de 3 sigma. Así que este estudio lo probó empíricamente, y el equipo de investigación lanzó la moneda 350,000 veces, llegando prácticamente a esa cifra.
1 comentarios
Opiniones de Hacker News
Como primer autor del manuscrito, voy a responder algunas preguntas y aclarar malentendidos. Los lanzamientos que parecen tener pocas rotaciones en su mayoría fueron grabados con una webcam de 30 FPS, por lo que a menudo la rotación de la moneda era mucho más rápida que el sensor y parecía no girar; el video servía para verificar si se habían recolectado datos y para auditar los resultados.
No construimos una máquina lanzadora, porque este estudio trata sobre lanzamientos de moneda hechos por personas, y Diaconis, Holmes y Montgomery (DHM, 2007) teorizaron que las imperfecciones del lanzamiento humano generan un sesgo hacia la misma cara. Si construyéramos una máquina, se perdería el propósito mismo del experimento.
Tampoco es acertada la crítica de que hubo demasiados autores y se desperdició dinero público. El experimento se hizo en tiempo libre y no hubo financiamiento de investigación, así que tampoco hubo dinero desperdiciado. También cuesta entender por qué debería molestar tanto haber dado coautoría a los estudiantes que contribuyeron lanzando monedas todo el día; sin ellos el experimento habría sido imposible.
No todo el mundo lanza una moneda de manera perfecta, y algunas personas son mucho más torpes. A los participantes se les indicó que la lanzaran como lo harían al decidir una apuesta, y que la moneda diera al menos una vuelta. En la mayoría, el sesgo disminuyó con el tiempo, lo que sugiere que con la práctica lanzaban mejor y el sesgo se reducía; esto también debilita la teoría de que aprendieron deliberadamente a introducir sesgo.
Personalmente lancé más de 20.000 veces, pero no tengo la menor idea de cómo generar el sesgo. También hicimos varias veces análisis de sensibilidad excluyendo valores atípicos; el efecto se redujo un poco, pero todavía había suficiente evidencia que respaldaba a DHM. Si desconfían de los antecedentes estadísticos, pueden reanalizarlo ustedes mismos con los datos y scripts de limpieza en OSF: https://osf.io/mhvp7/
El artículo concluye que el lanzamiento de monedas tiene de forma inherente un sesgo pequeño pero significativo, pero al ver la tabla 2 parece igualmente válida la conclusión de que algunas personas lanzan sin sesgo y otras no. En particular, esperaría que si a los participantes con valores atípicos grandes se les explicara la precesión y se les pidiera reducirla deliberadamente, el sesgo disminuiría o desaparecería.
Aquí hay un video que presenta bien el paper: https://www.youtube.com/watch?v=-QjgvbvFoQA
La idea central es que el efecto proviene de la precesión. Es decir, la moneda no se voltea de manera completamente vertical, sino que gira con un ligero bamboleo y momento angular, mostrando una cara durante más tiempo que la otra.
El impacto sobre la equidad varía según la técnica: con una buena técnica, la probabilidad de la misma cara fue de alrededor de p_same = 0.508, y un participante del estudio mostró 0.6 en una muestra grande, algo extremadamente improbable si los lanzamientos fueran puramente justos. Como ejemplo extremo, el video muestra a un mago usando la precesión para hacer un truco que parece un volteo, pero en realidad la cara no cambia: la moneda rota dentro de su propio plano y se bambolea un poco.
Este video también explica bastante bien cómo funciona la prueba de hipótesis.
El artículo parece tener un tamaño de muestra grande, pero en realidad solo hubo 48 evaluadores/lanzadores. En algunos videos se ven lanzamientos muy bajos y con pocas rotaciones, digamos de apenas 1 o 2 vueltas, y probablemente repitieron eso miles de veces de la misma manera.
Por eso, el tamaño de muestra real del estudio se acerca más a N=48, y las personas que no lanzan bien —es decir, quienes hacen lanzamientos de poca rotación, poca altura y pocos giros— podrían influir de forma desproporcionada en los resultados.
Los antecedentes de los autores tampoco parecen estar especialmente centrados en estadística. De los 48 autores, todos salvo 3 lanzaron monedas, así que algunos quizá eran más sujetos de prueba que autores. Me parece que ser sujeto de tu propio estudio también podría introducir sesgos.
Si uno intenta demostrarse a sí mismo que cierto factor hace que la moneda caiga de un lado, sobre todo si la lanza bajo y despacio, podría terminar aprendiendo esa técnica. Viendo los resultados del estudio, parece que algunos lanzadores la dominaron bastante bien. Si los autores hubieran estado convencidos de que una moneda justa cae del lado contrario al inicial e hicieran el mismo estudio, creo que también podrían haber producido datos y un artículo que lo demostraran.
https://en.m.wikipedia.org/wiki/Clustered_standard_errors
No me sorprende que haya algún efecto, pero sospeché que quizá no habían usado lanzamientos de moneda legítimos. Parece que mucha gente no sabe lanzar bien una moneda, y al ver el video, al menos los lanzamientos de Bartos parecen confirmar esa sospecha: https://osf.io/6a5hy/
Tiene muy pocas rotaciones y pasa muy poco tiempo en el aire. Si fuera un asunto que valiera la pena decidir con un lanzamiento de moneda, no aceptaría ese método.
Claro que podría haber algún efecto, pero quienes no vean los videos van a imaginar una escena totalmente distinta. Si no me hubieran dicho que los mirara, creo que yo tampoco los habría revisado. Es difícil creer que los autores no sepan lo engañoso que puede ser presentar esto así, y mi intuición es que un lanzamiento de moneda bien hecho no mostraría las mismas características.
Podrías lanzar la moneda durante años con una máquina automatizada tantas veces como sea posible, variar la fuerza y el ángulo de lanzamiento, detectar desgaste submilimétrico en la superficie de la moneda y probar todos los estilos y tamaños existentes, todos los niveles de desgaste, todas las posiciones y ángulos, y todas las combinaciones de composición de la atmósfera terrestre, y aun así me preguntaría qué significan realmente esos resultados. En la práctica serían más una lista de eventos exactos que una “conclusión”, y en el futuro seguiríamos describiendo ese acto en términos de probabilidades de resultado.
Este artículo también ganó este año un Ig Nobel Prize.
“Probabilidad: un equipo de 50 investigadores que realizó 350,757 experimentos para demostrar que, al lanzar una moneda, es ligeramente más probable que caiga del mismo lado con el que empezó”.
Fuente: https://en.wikipedia.org/wiki/List_of_Ig_Nobel_Prize_winners...
Esto es algo conocido entre magos desde hace décadas. No creo que un solo mago haya lanzado la moneda 350 mil veces, pero cuando era niño yo mismo la lancé unas 2,500 veces para probar ese efecto.
Si 30 magos hubieran combinado sus datos, habría sido posible un metaanálisis de este tamaño, y el experimento se habría hecho hace más o menos un siglo.
No está totalmente relacionado, pero hace tiempo descubrí que, al menos con una moneda australiana de 20 centavos, es bastante fácil hacer trampa en un lanzamiento de moneda. Después de lanzarla y atraparla con la mano, al pasarla al dorso de la otra mano puedes sentir al tacto qué lado está arriba y voltearla si quieres.
En nuestra moneda, la cara con el rostro de la reina tiene una zona amplia y lisa, así que se distingue bastante del reverso rugoso con el ornitorrinco y el patrón de agua. Si vas a decidir algo importante con una moneda, debes asegurarte de que caiga directamente al suelo.
Lo que aprendí de este hilo es que el problema de un lanzamiento de moneda justo no es si es realmente justo, sino qué cuenta como un lanzamiento de moneda bien hecho. Y el problema es quién lo decide.
Si la mayoría de la gente no lanza así, ¿deberíamos diseñar una máquina para lanzar monedas? ¿Deberíamos controlar también otros factores? ¿O el hecho de que lo haga una persona, con sus imperfecciones incluidas, es algo esencial para los conceptos de lanzamiento de moneda, estadística y aleatoriedad?
Cuando tenía unos seis o siete años, aprendí un truco para lanzar monedas de un barbero en la tienda de mi abuelo. Desde entonces, siempre podía lanzar una moneda y determinar el resultado. En realidad, la clave es simplemente ser consistente en la forma de lanzarla y atraparla.
Como referencia, también hay un artículo de 2007 que propone una explicación física.
[1] https://www.stat.berkeley.edu/~aldous/157/Papers/diaconis_co...