- En Next Card Bet, donde se sigue continuamente la distribución de colores de un mazo de 52 cartas, la estrategia Kelly, a diferencia de su naturaleza usualmente de alta varianza, siempre termina un capital inicial de $1 en aproximadamente $9.08
- La regla de apuesta es simple: si las cartas rojas restantes
ry las negras restantesbson iguales, no se apuesta; si queda más de un color, se apuesta|r - b| / (r + b)del capital actual a ese color - Incluso al ejecutar 10,000 mazos barajados en Python, el capital final se mantiene en el rango de
9.081329549427776a9.081329549427803, produciendo una ganancia mayor que la estrategia de duplicar apostando solo a la última carta, pero sin variación - La demostración construye un portafolio que distribuye uniformemente el capital inicial entre los
(52 choose 26) = 495,918,532,948,104arreglos posibles de rojo/negro, y solo una subestrategia que coincide con el mazo real se duplica 52 veces seguidas - Como el cambio total de capital de este portafolio coincide con el patrón conservador de la estrategia Kelly, una estrategia Kelly que normalmente podría perder dinero se convierte en este juego en una estrategia de varianza 0
Reglas e intuición de Next Card Bet
- La Kelly bet allocation strategy es una forma de decidir la fracción a apostar en situaciones de juego aprovechando información o sesgos
- La estrategia Kelly usualmente se conoce como una estrategia agresiva y de alta varianza, y apostar más que la fracción Kelly puede aumentar el riesgo de ruina
- En “Next Card Bet” del libro Mathematical Puzzles de Peter Winkler, esta estrategia funciona sin riesgo y con varianza 0
- El juego comienza con un mazo estándar de 52 cartas
- Hay 26 cartas rojas y 26 cartas negras
- El mazo se baraja y luego se revela una carta a la vez, sin volver a meter las cartas reveladas
- El jugador puede apostar cualquier fracción de su capital actual a que la siguiente carta será roja o negra
- El pago es 1:1 y el capital inicial es $1
- Si se cuentan las cartas ya reveladas, se puede saber cuántas cartas de cada color quedan en el mazo no visible
- Si no se apuesta hasta la última carta, entonces se puede saber con certeza el color de la carta restante
- Esta estrategia simple permite duplicar el capital de forma segura apostando todo a la última carta
Fracción de apuesta Kelly
- La estrategia Kelly elige la apuesta que maximiza el valor esperado del logaritmo del capital final
- Si el número de cartas rojas restantes es
ry el de negrasb, yr > b, entonces la probabilidad de que salga una roja esr / (r + b) - El logaritmo esperado del capital se maximiza según la siguiente expresión
P[draw red] * log(1 + bet_fraction) + P[draw black] * log(1 - bet_fraction)
- En el punto donde la derivada de esta expresión es 0, la fracción óptima resulta ser
(r - b) / (r + b) - La estrategia completa solo asume riesgo en proporción a la diferencia entre los dos colores restantes
- Si
r = b, no se apuesta - Si
r > b, se apuesta la fracción|r - b| / (r + b)del capital actual a “red” - Si
b > r, se apuesta la fracción|r - b| / (r + b)del capital actual a “black”
- Si
Resultados de la simulación en Python
- El ejemplo en Python ejecuta la estrategia Kelly con la función
run_bets(is_red)stakecomienza en 1.0- En cada carta se actualiza el número de cartas rojas y negras restantes
- Se apuesta a color con más cartas restantes una fracción
abs(n_red_remaining - n_black_remaining) / (n_red_remaining + n_black_remaining) - Si se acierta la carta, esa cantidad apostada regresa duplicada; si no, se pierde
- El generador aleatorio usa
np.random.default_rng(2024) - Al generar 10,000 mazos con 26 cartas rojas entre 52, los resultados se concentran prácticamente en el mismo valor
- Mínimo:
9.081329549427776 - Máximo:
9.081329549427803
- Mínimo:
- La diferencia entre resultados fue menor que
1e-8, y en todas las ejecuciones la ganancia fue de aproximadamente 9.08 veces el capital inicial - Una ganancia de 9.08 veces es mucho mayor que la estrategia segura de duplicar apostando solo a la última carta
Demostración del portafolio que produce varianza 0
- El número de arreglos posibles de cartas rojas y negras es
(52 choose 26) = 495,918,532,948,104 - Se usa el resultado estándar de que, en un mazo bien barajado, todos esos arreglos rojo/negro aparecen con la misma probabilidad
- La estrategia de portafolio toma cada arreglo posible de rojo/negro como una subestrategia distinta
- A cada subestrategia se le asigna
1 / (52 choose 26)del capital inicial - Las subestrategias administran solo su propio dinero y no lo redistribuyen entre sí
- Cada subestrategia asume que su arreglo asignado es el mazo real y apuesta todo al color correspondiente en cada carta
- A cada subestrategia se le asigna
- Todas las subestrategias que no coinciden con el mazo real terminan quebrando en algún momento al apostar todo a una carta incorrecta
- Solo una subestrategia, la que coincide exactamente con el mazo real, acierta las 52 cartas y termina multiplicándose por
2^52 - Por eso, el rendimiento final del portafolio completo siempre toma el mismo valor sin importar el orden de las cartas
$1 / (52 choose 26) * 2^52- Aproximadamente $9.08
Equivalencia entre el portafolio y la estrategia Kelly
- En el portafolio, las subestrategias que aún no han quebrado predicen si la siguiente carta será roja o negra
- Cuando quedan
rcartas rojas ybcartas negras, la proporción de predicciones de las subestrategias sigue la proporción de colores restantes - Cuando se revela la siguiente carta, el grupo con la predicción equivocada quiebra y el grupo que acierta duplica su capital
- En ese momento, el cambio en el capital total del portafolio coincide exactamente con el patrón conservador de la estrategia Kelly que apuesta
|r - b| / (r + b)al color más abundante - La razón por la que la estrategia Kelly tiene varianza 0 es que se mueve exactamente igual que esta estrategia de portafolio, que ya tiene varianza 0 por sí misma
Qué la hace distinta de la estrategia Kelly habitual
- La estrategia Kelly normalmente maximiza la tasa esperada de crecimiento del logaritmo del capital evitando la ruina
- Pero fuera de eso, la estrategia Kelly usual no garantiza mucho más; de hecho, puede perder dinero y normalmente tiene alta varianza
- En este juego de cartas, incluso si ocurre una pérdida, la distribución de colores del mazo se vuelve más desequilibrada y las condiciones posteriores pasan a ser más favorables
- Si se apuesta una fracción suficientemente pequeña, el capital perdido en una apuesta errónea queda compensado después por la ventaja más grande que surge luego
- Esta estructura recuerda la etapa de exploración y explotación en problemas como los tests A/B
Material de referencia
- La demostración se basa en la solución de Winkler Mathematical Puzzles
- Esta demostración está relacionada con el estilo de Thomas Cover, quien más adelante creó la estrategia de inversión universal portfolio
- Demo y materiales fuente
- Kelly_cant_fail.ipynb: notebook del ejemplo del artículo
- card_count_fns.py: funciones para conteo de cartas y ejecución de apuestas
- dyn_prog.ipynb: notebook de programación dinámica para el caso de unidades de capital indivisibles
- Demonstrating Kelly Betting with Chips: explicación de la demostración usando fichas
1 comentarios
Comentarios de Hacker News
Para que esta estrategia siempre se sostenga, la apuesta debe poder dividirse infinitamente en partes cada vez más pequeñas.
Por ejemplo, si las 26 cartas rojas están concentradas en la parte superior del mazo, la apuesta inicial de $1.00 bajaría hasta 0.000000134 y luego volvería a subir hasta 9.08.
El valor esperado queda más o menos donde corresponde, pero la varianza crece rápidamente. Así que, además de este caso importante, en general es bastante inestable.
Se conoce una estrategia de programación dinámica que garantiza una ganancia de $8.08 con una apuesta de $1. Redondear de forma simple la estrategia de Kelly no produce ese resultado.
Si te pierdes uno, puedes perderte una racha rentable o un lanzamiento específico con una gran ganancia. Si graficas precio contra tiempo como un gráfico Renko, se ve parecido al gráfico de cualquier instrumento.
En el trading real de acciones/cripto/forex, esto significa que prácticamente tienes que hacer todas las operaciones; de lo contrario, el rendimiento de la estrategia cae. Así como en el experimento no cambias la moneda, en trading tampoco deberías cambiar de instrumento ni perder operaciones, y tendrías que sostenerlo durante mucho tiempo.
No hace falta decir que requiere una consistencia enorme, y cuando hay dinero en juego el estrés también aumenta. Repetirlo todos los días desgasta mental y físicamente, así que es difícil mantenerlo por mucho tiempo.
Una ramificación interesante sobre Kelly es la paradoja de Proebsting.
En teoría de la probabilidad, la paradoja de Proebsting es un argumento que parece mostrar que el criterio de Kelly puede llevar a la ruina. Matemáticamente se puede resolver, pero plantea cuestiones interesantes para la aplicación práctica de Kelly, sobre todo en inversión. Edward O. Thorp la discutió por primera vez en 2008, y lleva el nombre de su creador, Todd Proebsting.
https://en.wikipedia.org/wiki/Proebsting%27s_paradox
Es decir, Kelly funciona bien cuando conoces las probabilidades y esas probabilidades no cambian.
Si no conoces las probabilidades o pueden cambiar, el enfoque correcto probablemente tenga que ser más complejo que Kelly.
Es hermoso, pero el argumento de portafolio parece un rodeo innecesario. Se puede hacer una prueba de dos líneas por inducción.
Del mismo modo, al sacar negro y perder, el pago es X * (1-(r-b)/(r+b)) * 2^(r+b-1) / (r+b-1 choose r) = X * 2^(r+b) * b / ((r+b) * (r+b-1 choose r)) = X * 2^(r+b) / (r+b choose r). QED
Hay un juego de cartas muy parecido, mencionado en la pregunta #14 del libro de entrevistas de finanzas cuantitativas de Timothy Falcon, donde vas volteando cartas de un mazo y decides cuándo detenerte. El rojo cuenta como $1 y el negro como −$1.
Gwern lo explica y también escribió código para verificar la estrategia óptima de parada: https://gwern.net/problem-14
Cuando era adolescente, con conteo de cartas descubrí que, si adivinaba el color que quedaba en mayor cantidad en el mazo, siempre podía acertar más de la mitad de las veces
https://en.wikipedia.org/wiki/TRS-80_Model_100
Escribí una simulación en eso y nunca falló. Hace poco me volvió a venir a la mente y la corrí 30 millones de veces con un script de Python, y tampoco falló
Pensando en para qué podría usarlo, se me ocurrieron (i) apuestas, (ii) magia, pero ninguna de las dos opciones parecía muy prometedora
Como apuesta, podría poner $1000 contra $10 de la otra persona, pero no es un camino para ganar mucho, y si cometo un error o me hacen trampa podría perder bastante dinero. Pensándolo de nuevo, quizá sería mejor reformularlo como una apuesta acumulada (parlay)
Como magia, es demasiado lento. Se me ocurrió una frase tipo: “Los parapsicólogos no lograron demostrar de forma confiable la precognición con sus elegantes cartas Zener, ¡pero yo creé un protocolo que puede demostrarla todas las veces!”, pero decidí que no era lo bastante divertido. Pasar todo un mazo toma tiempo, tampoco parece un milagro, y para descartar la hipótesis nula con p=0.01 habría que hacerlo 7 veces seguidas. Tal vez alguien con mejor presencia escénica podría lograrlo, pero yo lo dejé
A veces lo planteo como acertijo, pidiendo que deduzcan el algoritmo, pero nadie lo ha resuelto. Yo tampoco lo resolví
https://en.m.wikipedia.org/wiki/Boyer%E2%80%93Moore_majority...
Aunque haya suficiente entropía, 30 millones de veces definitivamente no es suficiente
El criterio de Kelly es uno de mis conceptos favoritos de teoría de juegos, y se usa mucho en la gestión de bankroll de apostadores profesionales, en especial jugadores de póker
Es una buena forma de entender cómo administrar las finanzas y las apuestas para avanzar de manera constante evitando riesgos demasiado grandes o la quiebra, pero en ese ámbito se aplica mal con frecuencia. Kelly trata resultados binarios, y si se aplica a situaciones donde el resultado no es binario, según cómo se miren las matemáticas, pueden salir resultados que parecen casi correctos pero están un poco desviados
Como el póker se juega contra otros jugadores, la utilidad de una distribución específica de fichas parece que tendría que ser más compleja que simplemente la cantidad de fichas que uno tiene
No soy jugador de póker
El criterio de Kelly se generaliza bien a asignaciones continuas, simultáneas y complejas
Lo único que se necesita es una lista de acciones disponibles y la distribución de probabilidad conjunta de los resultados de riqueza después de cada acción. La acción puede ser una acción compuesta con resultados continuos
En el póker, ganar o perder no es binario: varía la cantidad que se gana o se pierde, así que se usa el valor esperado. Después de calcular un valor esperado aproximado, también se usa una calculadora de varianza, por ejemplo https://www.primedope.com/poker-variance-calculator/, para ver a largo plazo, durante cierta cantidad de manos, con qué frecuencia y cuánto es probable ganar
Parece que uno pasaría mucho tiempo sin ganar ni perder
Habría sido una mejor demo si lo hubiera reducido a números más manejables, por ejemplo un mazo de 2 negras y 2 rojas
En el turno 1, r = b, así que no se apuesta
En el turno 2, se apuesta 1/3 al color que no salió en el turno 1
En el turno 3, si fallaste en el turno 2, solo te quedan 2/3 de la apuesta inicial, pero como conoces el color de las siguientes dos cartas, duplicas el dinero cada vez y después del turno 3 quedas con 4/3 de la apuesta original. Si acertaste, tienes 4/3, pero queda una roja y una negra, así que en este turno no apuestas
En el turno 4, como sabes el color de la última carta, duplicas el dinero y quedas con 8/3 de la apuesta original
Y el ejercicio que se le deja al lector es demostrar la optimalidad; aunque es bastante straightforward, no creo que exista una demostración corta
Por eso, si se empieza con el ejemplo de 4 cartas y luego se muestran diagramas de árbol para los casos de 5 y 6 cartas, los números siguen siendo manejables y ayuda a construir la intuición para inducir el caso general
En la práctica, hay muchos factores que hacen que usar Kelly sea más difícil que en un ejemplo de juguete
¿Cuál es el tamaño del bankroll? ¿El efectivo disponible? ¿El patrimonio neto total? ¿El patrimonio neto líquido? ¿Los ingresos laborales futuros?
Según el tamaño del bankroll, entran varios factores. Por ejemplo, si el bankroll es de $100 y lo pierdes todo, normalmente no es grave. Pero si el bankroll es de $1 million, uno se vuelve mucho más reacio a exponerlo al riesgo
¿Cuál es el valor esperado? ¿Se conoce? ¿Es estable? ¿El juego es honesto?
Según las características estadísticas del valor esperado, hay que ajustar mucho el enfoque para el tamaño de las apuestas. En áreas donde el valor esperado solo se puede estimar y hay muchos tramposos, por ejemplo el póker, hay que decidir el tamaño de la apuesta bajo una gran incertidumbre
¿Qué montos de apuesta se pueden usar?
En la práctica no existe un rango continuo de montos de apuesta. Normalmente solo se permiten montos discretos, como de $5 a $500 en incrementos de $5 o $25. Si el bankroll baja demasiado, quedas fuera del juego; si sube demasiado, ya no puedes maximizar las ganancias
Al final, por estas complejidades, los apostadores profesionales suelen apostar con medio Kelly o un cuarto de Kelly
En trading están el spread y las comisiones, y en las mesas de casino está el rake
Es genial que el resultado no tenga varianza. Pero por eso mismo, dada la estructura especial de este problema, se siente como si tuviera que existir una estrategia con mayor rendimiento esperado
¿Alguien sabe si la estrategia de Kelly es óptima aquí?
Al principio pensé que estas estrategias eran muy distintas, pero no exactamente. La estrategia de Kelly también hace lo mismo cuando solo queda un color. La diferencia es que esta estrategia no hace nada antes de eso
Aun así, ambas se sienten como casos extremos. Apostar todo cuando solo queda un color es la única jugada correcta, así que al final la cuestión es qué hacer antes de eso. No hacer nada y Kelly parecen ser las únicas estrategias que se ven bien
Sin embargo, el argumento no fluía tan naturalmente como la prueba que muestra varianza 0, así que no lo incluí. Creo que el texto original también llamaba “estrategias puras” a las subestrategias dentro del portafolio, insinuando una prueba de teoría de juegos
Parece que este problema y su solución vienen de Thomas Cover
No recuerdo este ejemplo concreto, pero aprendí el criterio de Kelly en una clase que impartió Thomas Cover. Fue uno de mis profesores favoritos, y cualquier discusión con él era interesante y valiosa. RIP