2 puntos por GN⁺ 2025-02-25 | 1 comentarios | Compartir por WhatsApp
  • El cálculo estocástico aborda sistemas reales irregulares como el movimiento browniano, priorizando la intuición física y el proceso de derivación por encima del formalismo
  • La distribución binomial discreta y la caminata aleatoria simétrica, al aumentar el número de ensayos y aplicar escalamiento, conducen mediante el teorema central del límite a la distribución normal y a procesos estocásticos continuos
  • El movimiento browniano (W(t)) tiene incrementos independientes y (W(t)\sim N(0,t)); sus trayectorias son continuas, pero casi seguramente no son diferenciables en ningún punto
  • El cálculo de Itô agrega un término de segundo orden a la regla de la cadena común debido a las reglas (dW=\sqrt{dt}N(0,1)) y ((dW)^2\approx dt)
  • Las ecuaciones diferenciales estocásticas modelan conjuntamente tendencia y aleatoriedad mediante drift y diffusion; el enfoque de Stratonovich preserva la regla de la cadena común mediante evaluación en el punto medio y se usa en física, control, difusión biológica y simulación numérica

Problemas que aborda el cálculo estocástico

  • El cálculo estocástico es una herramienta que, con base en el movimiento browniano y el cálculo de Itô, permite tratar sistemas reales irregulares como modelos computables
  • Sus áreas de aplicación se extienden ampliamente a la física, las finanzas, la biología y el machine learning
    • Física: Einstein mostró la existencia de los átomos usando el hecho de que las fluctuaciones del movimiento browniano coincidían con las colisiones moleculares
    • Finanzas: modelos de valuación de opciones como la ecuación de Black-Scholes dependen de ecuaciones diferenciales estocásticas de la forma (dS=\mu Sdt+\sigma SdW)
    • Biología: las caminatas aleatorias modelan la difusión de especies o el disparo neuronal
    • Machine learning: Song et al. (2021) modelan la evolución del ruido en el tiempo mediante ecuaciones diferenciales estocásticas basadas en el cálculo de Itô y las usan en sentido inverso para generar nuevas muestras

De la distribución binomial al proceso estocástico continuo

  • El triángulo de Pascal cuenta la cantidad de caminos que van a la izquierda o a la derecha en cada paso, y la cantidad de formas de llegar a la posición (k) en la fila (n) es (\binom{n}{k}=\frac{n!}{k!(n-k)!})
  • En ensayos independientes, la probabilidad de tener (k) éxitos y (n-k) fracasos es la siguiente

[ P(k \text{ wins in } n \text{ trials})=\binom{n}{k}p^kq^{n-k} ]

  • La suposición de independencia es una condición fuerte, por lo que en la realidad, donde intervienen factores psicológicos o de momentum, como en rachas ganadoras deportivas o precios de acciones, el modelo puede volverse impreciso
  • Fenómenos que cambian continuamente, como el movimiento de caída, la difusión de gases, las fluctuaciones de precios de acciones o las colisiones moleculares en un líquido, son difíciles de tratar solo con puntos y sumas, y requieren intervalos e integrales

Caminatas aleatorias y teorema central del límite

  • En una caminata aleatoria simétrica con (p=0.5), el desplazamiento de un paso se define así

[ X(t)= \begin{cases} 1 & \text{with probability } \frac{1}{2}\ -1 & \text{with probability } \frac{1}{2} \end{cases} ]

  • Cada (X(t)) tiene media 0 y varianza 1, y se asume que los pasos en distintos tiempos son independientes
  • El desplazamiento total se expresa como la suma de variables aleatorias independientes

[ S(n)=X(1)+X(2)+\dots+X(n)=\sum_{t=1}^{n}X(t) ]

  • Según el teorema central del límite, la suma de variables aleatorias independientes e idénticamente distribuidas (X_1,\dots,X_n) se aproxima a una distribución normal cuando (n\to\infty)

[ X_1+\dots+X_n\sim N(n\mu,n\sigma^2) ]

  • En esta caminata aleatoria se cumple la siguiente relación

[ S(n)\sim N(0,n) ]

[ \lim_{n\to\infty}\frac{1}{\sqrt{n}}S(n)=N(0,1) ]

  • Por lo tanto, una “distribución binomial continua” conduce a la distribución normal

Definición del movimiento browniano

  • El movimiento de pequeñas partículas o polen sobre el agua observado por Robert Brown en la década de 1820 era muy irregular, y a pequeña escala los movimientos reales causados por fuerzas externas aparecían con tal sensibilidad que dominaban los movimientos previos
  • En un modelo matemático simplificado, los eventos en distintos tiempos se consideran independientes y, debido a la simetría de posición, se asume que la posición media de la partícula en el tiempo (t) está cerca del origen
  • Las propiedades que debe tener una caminata aleatoria continua son las siguientes
    • El punto inicial se fija en 0 por conveniencia matemática
    • No hay sesgo direccional, por lo que el desplazamiento esperado de cada paso y el desplazamiento esperado total son 0
    • Los desplazamientos en distintos intervalos de tiempo son independientes
    • La trayectoria es continua, sin saltos ni huecos
    • La distribución de la posición en un instante específico debe ser normal
  • El movimiento browniano suele denotarse como (B_t) y el proceso de Wiener como (W_t); aquí se usa (W(t)) para enfatizar la dependencia temporal
  • Sus principales propiedades son las siguientes

[ W(0)=0 \quad \text{almost surely} ]

[ W(t)\sim N(0,t) ]

[ \Delta W(s,t)\sim N(0,t-s) ]

  • Los incrementos (\Delta W(t_1,t_2)) y (\Delta W(t_2,t_3)) en intervalos distintos son independientes para (t_1<t_2\le t_3)
  • De aquí se sigue que (E[W(t)]=0) y (Var(W(t))=t)
  • La trayectoria muestral (t\mapsto W(t)) es casi seguramente uniformemente Hölder continua para todo exponente (\gamma<\frac12), pero no es Hölder continua en ningún punto para (\gamma\ge\frac12), y en particular no es diferenciable en ningún punto

Reglas clave del cálculo de Itô

  • El movimiento browniano es continuo, pero demasiado irregular para tener una derivada ordinaria
  • En un intervalo pequeño (dt), se cumple lo siguiente

[ \Delta W(t,t+dt)\sim N(0,dt)=\sqrt{dt}N(0,1) ]

[ \frac{\Delta W(t,t+dt)}{dt}=\frac{1}{\sqrt{dt}}N(0,1) ]

  • Cuando (dt\to0), (\frac{1}{\sqrt{dt}}) crece sin límite, por lo que no converge a una derivada finita
  • Kiyosi Itô creó en la década de 1940 el cálculo de Itô, adaptado a la aleatoriedad del movimiento browniano, y este se convirtió en la base del cálculo estocástico
  • (dW) y ((dW)^2)

    • El pequeño cambio del movimiento browniano se define así
    • [
    • dW:=W(t+dt)-W(t)
    • ]
    • [
    • dW=\sqrt{dt}N(0,1)
    • ]
    • A diferencia del (dx) determinista del cálculo ordinario, (dW) es aleatorio; su tamaño es proporcional a (\sqrt{dt}) y su signo depende de la distribución normal estándar
    • Su esperanza y varianza son las siguientes
    • [
    • E[dW]=0
    • ]
    • [
    • Var(dW)=E[(dW)^2]=dt
    • ]
    • La esperanza de ((dW)^2) es (dt), su varianza es (2dt^2), y cuando (dt\to0) la variabilidad se vuelve despreciable, por lo que en el cálculo de Itô se trata como ((dW)^2\approx dt)
    • En el cálculo ordinario, ((dx)^2) es tan pequeño que desaparece, pero en el cálculo estocástico ((dW)^2) está en la misma escala que (dt), por lo que las reglas de cálculo cambian
  • Integral de Itô

    • Así como la integral ordinaria (\int_a^b f(x)dx) se define como el límite de sumas de Riemann, para el movimiento browniano se considera (\int_0^t f(s)dW(s))
    • Para una partición (s_0,\dots,s_n), se aproxima con la siguiente suma
    • [
    • \int_0^t f(s)dW(s)\approx \sum_{i=0}^{n-1}f(s_i)\Delta W(s_i,s_{i+1})
    • ]
    • El resultado de esta integral es una variable aleatoria que refleja la aleatoriedad de (W(t))
    • Si (f(s_i)) se evalúa en el extremo izquierdo, solo usa información hasta el tiempo (s_i), por lo que tiene la propiedad non-anticipating de no mirar el futuro
  • Lema de Itô

    • La regla de la cadena del cálculo ordinario para (f(t,W(t))) es la siguiente
    • [
    • df=\frac{\partial f}{\partial t}dt+\frac{\partial f}{\partial W}dW
    • ]
    • Debido al carácter rugoso del movimiento browniano, el término de segundo orden en la expansión de Taylor no desaparece
    • [
    • df=\frac{\partial f}{\partial t}dt+\frac{\partial f}{\partial W}dW+\frac{1}{2}\frac{\partial^2 f}{\partial W^2}(dW)^2+\text{smaller terms}
    • ]
    • (dt^2) y (dt,dW) desaparecen, pero ((dW)^2\approx dt) permanece
    • Por lo tanto, el lema de Itô toma la siguiente forma
    • [
    • df=\frac{\partial f}{\partial t}dt+\frac{\partial f}{\partial W}dW+\frac{1}{2}\frac{\partial^2 f}{\partial W^2}dt
    • ]
    • El término adicional (\frac12\frac{\partial^2 f}{\partial W^2}dt) surge por el efecto de segundo orden del movimiento browniano
    • En el caso (f(W)=W^2), se calcula así
    • [
    • d(W^2)=2W,dW+dt
    • ]
    • [
    • W(t)^2=\int_0^t2W(s)dW(s)+t
    • ]
    • El término (t) coincide con (E[W(t)^2]=t), y el término integral es un componente aleatorio de media 0

Modelado con ecuaciones diferenciales estocásticas

  • Como el cálculo de Itô proporciona integración y regla de la cadena para el movimiento browniano, permite modelar sistemas con aleatoriedad y tendencia mediante ecuaciones diferenciales estocásticas (SDE)
  • Una SDE general es la siguiente

[ dX(t)=a(t,X(t))dt+b(t,X(t))dW(t) ]

  • El significado de cada término es el siguiente
    • (X(t)): cantidad que cambia con el tiempo
    • (a(t,X(t))dt): drift, la parte sistemática
    • (b(t,X(t))dW(t)): diffusion, perturbación aleatoria proveniente del movimiento browniano
  • La solución de una SDE no es una curva fija, sino una trayectoria aleatoria que cambia en cada ejecución, y se pueden analizar sus patrones estadísticos
  • Forma general del lema de Itô

    • Para (dX=b(t,X(t))dt+\sigma(t,X(t))dW), el lema de Itô de (f(t,X(t))) es el siguiente
    • [
    • df=(f_t+bf_X+\frac{1}{2}\sigma^2f_{XX})dt+\sigma f_XdW
    • ]
    • Se deriva considerando que (dX=O(dW)) y hasta (dX^2=O(dW^2))
  • Drift y diffusion

    • El drift (a(t,X)) determina la dirección promedio, y la diffusion (b(t,X)) determina la intensidad de las fluctuaciones aleatorias
    • Si (b=0), se convierte en una ecuación diferencial ordinaria; si (a=0), se convierte en un movimiento browniano escalado
    • Un caso simple puede escribirse así
    • [
    • dX(t)=\mu dt+\sigma dW(t)
    • ]
    • Si (X(0)=0), tiene la siguiente solución
    • [
    • X(t)=\mu t+\sigma W(t)
    • ]
    • Como (W(t)\sim N(0,t)), se obtiene la siguiente distribución
    • [
    • X(t)\sim N(\mu t,\sigma^2t)
    • ]
    • Es un proceso que drift de forma lineal en el tiempo y cuyo ruido se dispersa; es la forma básica de modelos como el de acciones con crecimiento constante y volatilidad
  • Movimiento browniano geométrico

    • En sistemas donde el cambio es proporcional al tamaño, se usa el movimiento browniano geométrico (GBM)
    • [
    • dS(t)=\mu S(t)dt+\sigma S(t)dW(t)
    • ]
    • (\mu S(t)) es el drift proporcional y (\sigma S(t)) es el ruido proporcional
    • (\frac{dS}{S}=\mu dt+\sigma dW) es un cambio relativo con tendencia y aleatoriedad
    • Si se define (f=\ln S) y se aplica el lema de Itô, se obtiene
    • [
    • d(\ln S)=\left(\mu-\frac12\sigma^2\right)dt+\sigma dW
    • ]
    • Al integrar, se obtiene la siguiente solución
    • [
    • S(t)=S(0)\exp\left(\left(\mu-\frac12\sigma^2\right)t+\sigma W(t)\right)
    • ]
    • La razón por la que el drift se ajusta en (-\frac12\sigma^2) es el efecto de segundo orden del ruido, y esta forma es la base del modelo financiero de Black-Scholes
    • Las soluciones analíticas como la del GBM son la excepción; la mayoría de las SDE requieren simulación numérica o análisis estadístico mediante ecuaciones como la de Fokker-Planck

Cálculo de Stratonovich

  • El lema de Itô incluye un término de segunda derivada, lo que puede volver engorrosos los cálculos
  • El cálculo de Stratonovich cambia el punto de evaluación de la integral estocástica para preservar la regla de la cadena del cálculo ordinario
  • La integral de Itô usa el extremo izquierdo de cada intervalo, mientras que la integral de Stratonovich usa la regla de evaluación en el punto medio
  • El punto de evaluación generalizado puede escribirse así

[ \int_0^T f(X(t))\diamond dW

\lim_{n\to\infty}\sum_{i=0}^{n-1} f(X(t_i)+\lambda\Delta X(t_i,t_{i+1})) \Delta W(t_i,t_{i+1}) ]

  • En el cálculo determinista, (O(dX^2)\to0), por lo que la elección del punto de evaluación no importa; en el cálculo estocástico, (O(dW^2)\to O(dt)), por lo que el punto de evaluación sí importa
  • Para preservar la regla de la cadena (df=f_X\circ dX), la comparación con la expansión de Taylor requiere (\lambda=\frac12)
  • Por lo tanto, la integral de Stratonovich se define así

[ \int_0^T f(X(t))\circ dW

\lim_{n\to\infty}\sum_{i=0}^{n-1} f\left(\frac{X(t_i)+X(t_{i+1})}{2}\right) \Delta W(t_i,t_{i+1}) ]

  • Conversión entre Itô y Stratonovich

    • Si se supone que el mismo proceso estocástico está dado en las dos formas siguientes
    • [
    • dX=adt+bdW=\tilde a dt+b\circ dW
    • ]
    • El término de drift tiene la siguiente relación
    • [
    • a=\tilde a+\frac12 b_Xb
    • ]
    • El coeficiente de difusión (b) es el mismo, pero la función de drift difiere entre las representaciones de Itô y Stratonovich

Contextos donde se usa el enfoque de Stratonovich

  • El cálculo de Stratonovich crea una integral estocástica distinta del método de extremo izquierdo de Itô mediante la regla de evaluación en el punto medio, y se ajusta a ciertos sistemas físicos o a simplificaciones de cálculo
  • En el ruido multiplicativo de la física, un oscilador amortiguado con ruido dependiente del estado puede escribirse así

[ dX=-kXdt+\sigma X\circ dW ]

  • Aplicando la regla de la cadena de Stratonovich a (f(X)=\ln X), se obtiene

[ d(\ln X)=-kdt+\sigma\circ dW ]

[ X(t)=X(0)e^{-kt+\sigma W(t)} ]

  • El teorema de Wong-Zakai afirma que, al llevar ruido real ligeramente suave al límite de ruido blanco, aparece una SDE de Stratonovich
  • En control estocástico, en sistemas como (dX=(aX+u)dt+\sigma X\circ dW), la regla de Stratonovich coincide con la intuición del control clásico y puede simplificar el diseño de la entrada de control (u(t))
  • En difusión biológica, en modelos con ruido dependiente de la posición como (\sigma(X)=\sqrt{2D(1+kX^2)}), Stratonovich refleja leyes físicas de conservación
  • En simulación numérica, Stratonovich encaja bien con el método del punto medio y puede usarse para reducir artefactos numéricos en modelos como la cinética de reacciones químicas
  • El criterio de elección depende del contexto
    • Stratonovich es adecuado para sistemas donde el ruido está vinculado con continuidad física o simetría
    • Itô domina en finanzas por su propiedad non-anticipating, que no usa información futura
    • Usando la fórmula de conversión (a=\tilde a+\frac12bb_X), se puede pasar de una representación a la otra

1 comentarios

 
GN⁺ 2025-02-25
Opiniones en Hacker News
  • Para lectores con conocimientos de matemáticas de nivel avanzado de licenciatura/posgrado, este material introductorio al cálculo estocástico resultó útil: https://almostsuremath.com/stochastic-calculus/

    • Es un buen recurso. Estudié este campo en el posgrado, y diría que este contenido es bastante difícil, al punto de abarcar desde nivel inicial hasta avanzado de doctorado
      Otro libro inspirador que se superpone mucho con temas relacionados es este: https://www.amazon.com/Stochastic-Integration-Differential-E...
  • Me pregunto si el cálculo estocástico es un campo en el que se necesita una computadora para simular muchos posibles desarrollos de eventos, o si, cuando se conoce la distribución de dW, los resultados finales importantes y las distribuciones de probabilidad pueden resolverse de una forma matemática más elegante
    El artículo fue excelente; ya había visto cálculo estocástico antes, pero esta fue la primera vez que sentí que realmente empezaba a entenderlo

    • Respondiendo más directamente a la pregunta, por lo general solo se pueden obtener respuestas analíticas para preguntas simples sobre distribuciones simples
      Si el problema es complejo, o la distribución es compleja, o ambas cosas, se necesitan métodos numéricos. Eso no significa necesariamente que haya que correr muchas simulaciones tipo Monte Carlo, aunque ese método también es razonable, si bien costoso
      Preguntas más directas sobre ciertas probabilidades pueden responderse sin Monte Carlo. La ecuación de Fokker-Planck es una ecuación diferencial parcial que puede resolverse con diversos métodos que no son Monte Carlo, y el cuasipotencial y la función conmutadora que aparecen en la simulación de eventos raros también pueden calcularse “directamente”. La dificultad central es que, al aplicar métodos numéricos estándar a estos objetos, aparece la maldición de la dimensionalidad. Calcularlos bien en alta dimensión, e incluso en dimensión infinita, es un área de investigación muy activa en matemática aplicada. Personalmente, salvo que las matemáticas se correspondan limpiamente con una aplicación física real, creo que estas cosas suelen ser más bien una pérdida de tiempo
    • Depende de lo que quieras calcular, pero en general la función de densidad de probabilidad en el tiempo t de la solución de una ecuación diferencial estocástica (SDE) satisface una ecuación diferencial parcial de primer orden en el tiempo y de segundo orden en el espacio
      Los físicos la llaman ecuación de Fokker-Planck; los matemáticos, ecuación forward de Kolmogorov. Salvo excepciones especiales, no hay una solución analítica exacta y se necesita una solución numérica. Sin embargo, en alta dimensión, resolver la ecuación diferencial parcial es muy costoso, así que resulta más barato resolver la SDE y hacer muestreo Monte Carlo
      También puede haber otros tipos de preguntas, como la solución cuando ocurre algún evento aleatorio, y aplica una lógica similar. Además, el cálculo estocástico es muy útil para tratar SDE, pero si te interesan otros tipos de procesos de Markov o procesos no markovianos, quizá necesites otras herramientas
      Como dicen otros comentarios, en casos especiales la propia SDE también puede tener solución exacta, pero en general no es así
      Esta explicación se limita a las SDE, que son ecuaciones diferenciales con ruido blanco gaussiano como término de forzamiento. En otros procesos estocásticos, como los procesos de salto de Markov, la forma de la ecuación de evolución de la distribución es distinta, aunque comparten algunos principios generales como la ecuación de Chapman-Kolmogorov
    • Algunas ecuaciones diferenciales estocásticas simples pueden tener soluciones explícitas analíticas, como integrales o ecuaciones diferenciales ordinarias simples. La ecuación clásica de Black-Scholes es un ejemplo
      Las ecuaciones más complejas normalmente no pueden resolverse así. Lo que suele buscarse es el valor esperado de una función del proceso estocástico en algún momento, y se puede demostrar que ese valor esperado sigue cierta ecuación diferencial parcial determinista. Después se resuelve con un solucionador numérico de ecuaciones diferenciales parciales
      Si la dimensión es alta o el proceso depende fuertemente de la trayectoria y no es markoviano, al final se termina usando simulación Monte Carlo, que en efecto simula “varios desarrollos posibles de eventos”
    • Antes estudié algo de simulación estocástica de reacciones químicas, y diría que la respuesta muchas veces es “sí”, pero no siempre
      Por ejemplo, una caminata aleatoria se vuelve una distribución normal, y también se sabe que su media y varianza tienden a infinito; así que entiendo que, solo con la entrada, se puede determinar la función de varianza en el tiempo, lo que conduce a una solución analítica elegante
      Pero en muchos casos no hay solución analítica y hay que ejecutar algoritmos estocásticos. En cinética química estocástica simple, el algoritmo de Gillespie es un ejemplo de eso
    • Depende de qué quieras saber. Si quieres obtener algunas trayectorias, necesitas simular ecuaciones diferenciales estocásticas
      Si solo quieres conocer las estadísticas de las trayectorias, en muchos casos puedes plantear y resolver la ecuación de Fokker-Planck, que es una ecuación diferencial parcial, para obtener la densidad de las trayectorias
  • El siguiente paso es Langevin Dynamics, donde el sistema tiene momento amortiguado y el ruido entra en el momento
    Esto también se usa en simulaciones de dinámica molecular y puede usarse en muestreo MCMC bayesiano
    Curiosamente, cuando veo que se menciona Langevin Dynamics en relación con la IA, muchas veces se omite el uso de momento, aunque en IA se usa ampliamente el descenso por gradiente con momento. Para hacerlo más confuso, la palabra “estocástico” también se usa para significar que en cada paso se aproxima el gradiente con una muestra de una parte de los datos. Si quieres, también puedes aplicar ambos tipos de aleatoriedad al mismo tiempo

    • La contraparte con momento de Langevin se conoce como underdamped Langevin, y si se optimiza lo suficiente el método de discretización, converge más rápido que Langevin estándar
      No sé exactamente por qué se usa menos en IA, pero parece que la no convexidad de las aplicaciones de IA causa problemas. Incluso en configuraciones log-cóncavas, el muestreo ya es un problema bastante difícil
  • Mi recurso favorito personal sobre cálculo estocástico es Stochastic Processes in Information and Dynamical Systems, de Eugene Wong, McGraw-Hill, New York, 1971

    • Es un libro antiguo, pero me parece que está escrito con mucha claridad, y solo la explicación introductoria de teoría de la medida ya valía la pena
  • Me queda el recuerdo de haber estudiado cálculo estocástico.
    También recuerdo haber anotado que la desviación estándar en estadística general y la variación cuadrática difieren un poco en la forma de calcular la varianza. Era algo como que había una diferencia de 1, o que el cuadrado era distinto, y lo había dejado anotado para investigar algún día por qué era así. Quizá se deba a la volatilidad estocástica.

    • La varianza de toda la población se define así: sum i=1..N (x_i - mu)^2 / N
      Aquí la media mu := sum x_i / N es la media real de la población.
      En cambio, cuando se obtienen n muestras independientes e idénticamente distribuidas de alguna distribución, el mejor estimador de la varianza de la distribución es sum i=1..n (x_i - a )^2 / (n-1).
      Aquí se reemplaza la media mu por la media muestral a := sum x_i / n, y se divide entre n-1 en lugar de N. “Mejor” significa estimador insesgado, y que el valor esperado de la segunda fórmula sea la varianza poblacional se puede comprobar con un cálculo tedioso pero no difícil.
    • Si pensamos en la varianza muestral, se puede abordar de dos maneras.
      Primero, la varianza muestral depende de la media muestral, que es sum(x_i) / n. Si conocemos los primeros n-1 de los n datos muestrales y también conocemos la media muestral, el último valor queda determinado, así que al menos se puede entender n-1 como los grados de libertad. Los momentos muestrales de orden superior también se pueden entender más o menos con una lógica similar de grados de libertad, aunque podría estar equivocado.
      Segundo, de manera más matemática, biased_sample_variance = sum((x_i - sum(x_i) / n)^2) / n. Para muchos conjuntos de muestras, el promedio de esta varianza muestral sesgada no es la varianza poblacional, sino (n - 1) / n * population_variance. Por lo tanto, al multiplicar por n / (n - 1) se obtiene la varianza muestral insesgada sum((x_i - sum(x_i) / n)^2) / (n - 1). Cuando le agarras el ritmo, esta matemática es bastante divertida.
  • Hace poco me encontré con este ejemplo. Supongamos que jugamos un “juego”. Se extrae un número aleatorio A con distribución uniforme entre 0 y 1, y luego se extrae un segundo número B de la misma distribución.
    Si A > B, se vuelve a extraer B, manteniendo A igual. ¿Cuál es el número promedio de extracciones necesarias, es decir, la “racha de victorias” promedio de A?
    La respuesta es infinito. Porque a veces A sale extremadamente alto, y para superarlo pueden hacer falta millones de extracciones.

    • Escrito como cálculo, sería así. Si el valor extraído para A es p, la probabilidad de que B > A en una extracción de B es (1-p).
      Por lo tanto, la probabilidad de que, después de extraer B n veces, B quede menor o igual que A es una distribución geométrica p^(n-1) (1-p). El número esperado de extracciones es 1/p, y E[draws] = E[E[draws|A=p]] = \int_0^1 E[draws|A=p] dp = \int_0^1 (1/p) dp, así que diverge a infinito, como se dijo.
      No es que lo dudara; quería ver el cálculo.
    • Para quien le interese, lo veo como un ejemplo de https://en.wikipedia.org/wiki/St._Petersburg_paradox.
    • Por la forma en que está planteada la pregunta, era ambiguo si “se vuelve a extraer” se aplica solo a B o también a A. ¿Se puede entender que la respuesta infinito corresponde solo al primer caso?
    • ¿De verdad hace falta cálculo estocástico para demostrar esto? Parece que bastaría una integral estándar basada en el hecho de que, para un A fijo, el valor esperado del número de muestras necesarias es 1/(1-A).
  • Pregunta para lectores de HN. He definido unas 50 ubicaciones (loci) en el genoma de ratones que contienen diferencias de ADN que regulan la mortalidad, y la mayoría tiene efectos actuariales complejos dependientes de la edad.
    Quiero predecir la edad de muerte; ¿sería el cálculo estocástico un enfoque útil para predicciones actuariales sobre la esperanza de vida de ratones? Por eso me alegró ver este artículo en la parte alta de HN.

    • El cálculo estocástico es más útil, igual que el cálculo común, cuando un momento y otro difieren solo en unas pocas variables de estado y son parecidos entre sí; es menos útil cuando el carácter de cada momento cambia mucho.
      La cantidad de preguntas, es decir, la cantidad de loci, parece similar a la cantidad de intervalos en que se puede dividir razonablemente el tiempo. Un efecto que cambie el momento de muerte en 1/50 de la vida de un ratón sería difícil de detectar, si no me equivoco. Como tampoco hay muchos intervalos de tiempo ni un modelo de interacción entre variables de estado, terminarías usando métodos estadísticos sin modelo, así que creo que podrías obtener casi todo el valor que se puede obtener de métodos discretos.
    • Tomaría la presencia o ausencia de genes como variables simples 0-1 y aplicaría regresión con regularización L1. La regularización L1 ayuda a manejar la alta dimensionalidad de este problema: https://en.wikipedia.org/wiki/Lasso_(statistics)
      Como el objetivo es la edad, no asumiría que hay una distribución gaussiana de fondo. Ese cambio no es tan difícil como parece: https://en.wikipedia.org/wiki/Generalized_linear_model
      Como siempre, conviene consultar con un estadístico cercano.
    • No estoy listo para afirmar que “no”, y depende de la aplicación, pero por la descripción parece una tarea más adecuada para estadística bayesiana basada en grafos.
    • El cálculo estocástico parece tratar sistemas cuyo valor de salida es un valor real suave. Básicamente se usa para modelar sistemas tipo caminata aleatoria, que suben y bajan un poco al azar en cada intervalo.
      Pero si lo que observas es supervivencia/muerte a lo largo del tiempo, la salida es binaria, y la información que realmente obtienes es solo el momento de la muerte; por eso creo que un modelo de caminata aleatoria no sería necesario o ni siquiera deseable, y que un modelo estadístico más general encaja mejor. Si hay otras variables medidas además de si murió o no, un modelo estocástico podría ayudar.
      Además, si lo de 50×X bytes de información significa que todo influye en la esperanza de vida, es un problema difícil, pero por tener muchas entradas discretas y una sola salida suave, encaja bastante bien con una red neuronal. Probaría tanto una red neuronal como un modelo lineal y vería cuánto mejor resulta la red neuronal; así se puede juzgar si están ocurriendo interacciones más complejas que las lineales.
    • Por si se te pasó, existe https://en.m.wikipedia.org/wiki/Survival_analysis precisamente para responder esta pregunta.
      Si lo abordara de forma práctica, discretizaría el tiempo y ajustaría los datos aplicando aprendizaje automático clásico para predecir “la probabilidad de morir a los X meses, dado que sobrevivió hasta ese momento”. Eso facilita mucho más encontrar errores en los datos y problemas latentes.
      Solo elegiría cálculo estocástico o análisis de supervivencia formal cuando quisiera demostrar o derivar una conexión entre propiedades matemáticas existentes, como la falta de memoria, y propiedades físicas o biológicas, como el comportamiento de una proteína específica. Sería muy interesante, pero bastante difícil, especialmente si los datos son limitados. Entiendo que los artículos de finanzas usan el análisis estocástico más o menos de esa manera: asumen alguna propiedad matemática universal del sistema y luego demuestran si encaja con los datos reales.
  • Mi comprensión del cálculo de Itô es esta: al principio, el único proceso aleatorio que entendemos es el movimiento browniano y, por suerte, podemos cambiar las coordenadas.

    • ¿Podrías explicar un poco más el punto 2?
  • Es un muy buen modelo de cómo escribir una introducción amigable para principiantes.
    En particular, me gustó mucho la parte que motiva el lema de Itô mostrando que el término dW^2, que desaparece en el cálculo común, sigue siendo importante, y también la parte sobre convertir a Stratonovich.

  • Pido ayuda para saber cómo leer esta oración: “Brownian motion and Itô calculare a notable example of fairly high-level mathematics that are applied to model the real world”.
    No sé qué debería haber sido “Itô calculare”. ¿“Its calculation”?