- The Numbers, que ofrecía datos de unas 78,000 películas, se cayó repentinamente el 5 de marzo de 2026 y, debido a tráfico automatizado masivo y exploración de seguridad dirigida a un sistema de 30 años, descartó el sitio anterior y restauró solo las funciones mínimas
- Los humanos representaban apenas alrededor del 10% del tráfico total, y desde diciembre de 2025 se dispararon la recolección basada en prompts y el tráfico de IA agéntica, por lo que cerca del 90% del tiempo laboral del equipo se destinó a mantener el sitio anterior
- En los registros se detectó no solo recolección normal, sino también búsqueda de puertas traseras que parecería apuntar a acceso anticipado o manipulación de datos, pero no se confirmó la causa real de la caída ni quién estuvo detrás
- Como los datos de The Numbers se usaban para resolver mercados de predicción de taquilla en Polymarket, acceder a datos antes de su publicación podía dar ventaja en las operaciones, y las herramientas de IA permiten explorar vulnerabilidades de sitios antiguos a bajo costo
- Los crawlers de IA generan enormes costos y caídas sin devolver lectores, rompiendo la relación de intercambio de la web abierta, y los archivos independientes, noticias, foros y sitios de referencia que dependen de código viejo y equipos pequeños son especialmente vulnerables
Una semana en la que desapareció una base de datos de la industria del cine
- The Numbers es un sitio de datos cinematográficos con más de 8 millones de visitantes al año que investiga y publica directamente ingresos de taquilla, presupuestos de producción, video doméstico y datos de streaming
- Periodistas, académicos, productores de cine, mercados de predicción y Guinness World Records lo usan como fuente autorizada
- A inicios de 2026, su base de datos incluía 78,396 películas, 178,375 registros de estrenos en cines y 236,176 personas
- El sitio quedó fuera de servicio el 5 de marzo de 2026, no volvió por más de una semana y fue restaurado el 13 de marzo en una nueva infraestructura con una versión reducida
- Desaparecieron los gráficos históricos, las páginas por película y el Report Builder, y solo quedaron funciones mínimas centradas en cifras recientes de taquilla
- Como solo aparecía un mensaje de reconstrucción sin explicación concreta, los usuarios se enfurecieron e incluso surgieron sospechas de que el recorte era deliberado para moverlos a productos de pago
Un sistema de 30 años iniciado en 1997
- Bruce Nash, matemático y exdesarrollador de software de IBM, inició el 17 de octubre de 1997 un sitio en Geocities que seguía 300 películas
- Todo comenzó cuando generaba HTML desde una base de datos Access y lo subía a Geocities, además de anunciar en el foro de Hollywood Stock Exchange análisis de taquilla para usarlos en la compraventa de acciones de películas
- Un texto retrospectivo por el 20.º aniversario hoy solo sobrevive en una copia archivada en Internet Archive
- El sitio anterior, ampliado durante décadas, servía unos 2 millones de páginas a partir de aproximadamente 160,000 archivos fuente
Dos olas de tráfico creadas por crawlers de IA
- Durante los primeros 25 años, los visitantes principales eran personas, motores de búsqueda relativamente respetuosos de las reglas y recolectores para proyectos personales; además, se podía localizar y bloquear a quienes recolectaban en exceso
- El primer cambio comenzó alrededor de 2024, cuando crawlers para entrenamiento de IA se sumaron a la recolección de los motores de búsqueda
- Los crawlers de IA tienden a respetar menos las reglas que los motores de búsqueda, lo que aumentó el trabajo de administración necesario para mantener estable el sitio
- En 2024, el tráfico automatizado superó al humano en toda la web y, según datos de Cloudflare, los bots llegaron al 57.5% de las solicitudes a páginas web
- La segunda ola empezó hacia diciembre de 2025, cuando agentes de IA que recolectan en respuesta a prompts y agentes creados por usuarios ampliaron aún más el tráfico
- Solo alrededor del 10% de las visitas a The Numbers provenían de personas navegando directamente; el resto era tráfico automatizado y bots de IA
- De diciembre a inicios de marzo, el equipo destinó cerca del 90% de su tiempo de trabajo a mantener el sitio anterior y desarrolló el nuevo sistema con el tiempo restante
Una respuesta que mostraba la ruta de licenciamiento a los crawlers
- El equipo añadió al sitio instrucciones legibles por LLM para inducirlos a responder cómo comprar una licencia de los datos en lugar de recolectarlos directamente
- Después de eso, las consultas por licencias de datos aumentaron unas 10 veces
- Las medidas para mitigar el tráfico tuvieron efecto, pero no resolvieron la carga estructural de seguir operando el servicio mientras defendían 30 años de código y 160,000 archivos
Caída del servidor y rastros de exploración de seguridad
- El servidor colapsó en la madrugada del 5 de marzo, y al principio el equipo sospechó que la causa era solo la carga del tráfico de IA
- En los registros se detectaron intentos de encontrar puertas traseras, además de accesos mediante URLs normales
- Es posible que alguien intentara acceder a datos antes de su publicación en el sitio o manipular los datos entregados a los usuarios
- Hubo meses de recolección y exploración automatizadas, pero no se pudo confirmar qué causó la caída final ni quién la ejecutó
- Por consejo de especialistas en ciberseguridad, el servidor anterior no volvió a encenderse
- Restaurar un respaldo volvería a exponer 160,000 archivos legacy a atacantes que ya habían estado explorando vulnerabilidades durante mucho tiempo
- Consideraron que el servidor anterior podía volver a caer a los pocos minutos de reactivarse, así que montaron una versión mínima en infraestructura nueva
El valor monetario que los mercados de predicción dieron a los datos de cine
- Polymarket opera mercados sobre resultados del fin de semana de estreno y designa el
Daily Box Office Performancede The Numbers como criterio de resolución del mercado - Los mercados de un fin de semana individual suelen mover desde decenas hasta cientos de miles de dólares, y el total de mercados simultáneos sobre taquilla puede involucrar millones de dólares
- Si alguien pudiera ver los datos de The Numbers antes de su publicación, podría conocer antes que otros operadores los resultados de cada semana y operar con ventaja
- Los mercados de predicción pueden convertir casi cualquier dato en valor monetario, las herramientas de IA baratas reducen la barrera técnica para irrumpir en sitios y los bots agénticos a gran escala amplían la vulnerabilidad de la infraestructura web tradicional
Cómo la IA redujo la barrera de entrada para los ciberataques
- Anthropic reveló en noviembre de 2025 la primera campaña documentada de ciberespionaje coordinada por IA
- Un grupo respaldado por un Estado atacó a unas 30 organizaciones y la IA realizó entre 80% y 90% del trabajo
- Las personas solo intervinieron en 4 a 6 puntos de decisión por campaña
- La barrera para ataques cibernéticos sofisticados cayó fuertemente y parece que seguirá bajando
- Según un reporte previo de amenazas de Anthropic, incluso delincuentes con poca capacidad técnica usan IA para realizar tareas complejas como desarrollar ransomware, algo que antes requería años de entrenamiento
- La herramienta autónoma de pentesting con IA XBOW alcanzó el primer lugar en el ranking de HackerOne en EE. UU. al reportar alrededor de 1,060 vulnerabilidades
- Un sitio de 30 años con alta probabilidad de contener vulnerabilidades conocidas es una superficie ideal para que herramientas de IA lo exploren a bajo costo, y la barrera de conocimiento que antes protegía a sitios pequeños se ha debilitado mucho
The Numbers emprende una reconstrucción total
- Aunque el sitio público se cayó, la principal fuente de ingresos de The Numbers no resultó afectada, así que el negocio como tal sigue en pie
- En los últimos años, el sitio gratuito no dependía mucho de la publicidad
- Sus principales negocios son OpusData, la venta masiva de datos, reportes comparativos para productores e inversionistas de cine y el Business Report
- Como deben reconstruir desde cero un sitio que ofrece datos sobre 78,396 películas, 178,375 registros de estrenos y 236,176 personas, no han podido restaurar todas las funciones de golpe
- El equipo divide en seis tipos a los usuarios a los que debe responder un sitio público en 2026
- Personas
- Motores de búsqueda
- Trabajos de entrenamiento para LLM
- Tráfico de IA basado en prompts
- IA agéntica
- Operadores de mercados de predicción
- Si antes se enfocaban en tres elementos —contenido, publicidad y SEO—, ahora deben considerar alrededor de 8 a 10 factores en cada decisión de diseño
- El nuevo sitio busca atender a los seis tipos de usuarios, añadir funciones para el servicio OpusData y los suscriptores de Business Report, y devolver al público los datos anteriores en una forma mejorada
El costo del crawling y los visitantes que no regresan
- En métricas por plataforma de Cloudflare, la cantidad de crawling permitida para conseguir un visitante referido variaba enormemente entre servicios
- Google rastreaba alrededor de 5 páginas por cada visitante enviado
- OpenAI rastreaba más de 1,000 páginas
- Anthropic rastreaba más de 38,000 páginas
- La relación de intercambio de la web abierta, en la que los motores de búsqueda leían contenido pero enviaban lectores a cambio, no funciona con los crawlers de IA
- La recolección masiva eleva los costos de ancho de banda de sitios pequeños y puede tumbar por completo el servicio
El daño por recolección masiva que han sufrido otros sitios
- En Read the Docs, un crawler descargó 73 TB de HTML comprimido en un mes, generando más de 5,000 dólares en costos de ancho de banda
- iFixit registró 1 millón de solicitudes en un solo día desde un crawler de Anthropic
- Triplegangers, empresa de venta de escaneos 3D con 7 empleados, sufrió una caída durante horario laboral por un bot de OpenAI, y su CEO lo calificó como prácticamente un ataque DDoS
- El operador de SourceHut dedica entre 20% y 100% de su tiempo de trabajo semanal a responder a crawlers de IA y sufre docenas de caídas breves cada semana
- El sitio de noticias sobre Linux LWN considera que el tráfico de crawlers proveniente de millones de IPs es un ataque de denegación distribuida de servicio
- Aproximadamente 97% del tráfico medido por el proyecto de código abierto GNOME provenía de bots
- Una biblioteca universitaria bloqueó 16,000 direcciones IP durante 48 horas para poder mantener su servicio de catálogo
Los costos y la caída de lectores que sufrió Wikipedia
- La Wikimedia Foundation calculó en abril de 2025 que los bots representaban alrededor del 35% de las vistas de páginas de Wikipedia, pero al menos el 65% del tráfico con mayores costos de procesamiento
- Como los crawlers se llevan masivamente páginas que casi nadie lee, su peso en costos es aún mayor
- Seis meses después, las vistas de páginas de Wikipedia por parte de humanos cayeron cerca de 8% interanual
- Cada vez más usuarios obtienen conocimiento desde resúmenes de IA sin visitar directamente Wikipedia
- Los sistemas de IA extraen contenido a gran escala y al mismo tiempo reducen los lectores que recibirían los sitios originales
Cuando se derrumban las premisas de la internet tradicional
- Las herramientas de IA son poderosas pero también destructivas, y están siendo puestas a prueba en tiempo real por el público en entornos reales
- La web abierta tradicional se construyó sobre estas premisas, pero ninguna encaja ya con la situación actual
- La mayoría de los visitantes son personas
- El tráfico es más o menos proporcional al número de lectores
- El costo de operar un sitio está conectado con el valor que obtiene su operador
- Más allá de discutir la utilidad de la IA, la web actual no está preparada para la potencia y escala de modelos de IA accesibles para cualquiera
Experimentos con cobro por crawling y bloqueo por defecto
- Cloudflare lanzó pay-per-crawl, que permite a los sitios cobrar a crawlers de IA por página
- Después anunció un modelo de pay-per-use en el que se paga a los editores cuando su contenido se usa realmente en respuestas de IA
- A partir del 15 de septiembre, las páginas basadas en publicidad de clientes de Cloudflare bloquearán por defecto a crawlers
mixed-useque no paguen - El éxito o fracaso de estas políticas dependerá de si las empresas de IA participan en el sistema de cobro en vez de evadirlo técnicamente
Una advertencia para todo el ecosistema de sitios independientes
- The Numbers perdió su sitio entero entre tráfico excesivo de máquinas y posible intrusión, pero pudo sobrevivir porque el sitio público no era todo su negocio
- La empresa textil alemana ZEGO, en operación durante 37 años, se declaró en quiebra después de que un ciberataque en marzo paralizara la producción durante 6 semanas
- Archivos independientes, bases de datos de hobby, noticias locales, foros y sitios de referencia preservan conocimiento colectivo acumulado mientras dependen de código viejo y de equipos pequeños o de operadores individuales
- The Numbers se está recuperando con una estructura mejor, y seguir usando y apoyando a los sitios pequeños creados para la internet tradicional está directamente relacionado con su supervivencia
1 comentarios
Opiniones en Hacker News
Preguntándolo en serio, ¿los mercados de predicción no podrían convertirse en una nueva fuente de ingresos para TheNumbers.com? Es posible que algunos atacantes intentaran obtener cifras antes de su publicación para apostar con información segura en mercados de predicción.
Sería claramente uso de información privilegiada y muy poco ético, pero el CEO de PolyMarket alguna vez dijo que el insider trading forma parte del propósito del servicio: https://youtu.be/ZN4njIQcSR4?si=ztyTtgjeHSJbNjSZ&t=1566
El punto clave no es solo que agentes estén golpeando el sitio, sino que existe una vulnerabilidad potencial explotable. Por eso el sitio cayó y volvió con una reducción considerable de datos y diseño.
Si un usuario malicioso accede a datos de The Numbers antes de su publicación, cada semana podría saber la respuesta antes que otros traders y adelantarse en las operaciones.
Al ver la especulación en Reddit de que fue un rug pull intencional para arruinar un sitio gratuito y empujar a los usuarios hacia un producto de pago, me pregunto si en el futuro habrá todavía menos recursos gratuitos.
Antes publicaba pequeñas herramientas como open source con la esperanza de que alguien las usara para resolver problemas similares, pero ahora me da reparo contribuir a la web gratuita porque sé que serán scrapeadas, convertidas en datos de entrenamiento y monetizadas después. Es comprensible que quienes operan sitios gratuitos útiles se enojen.
Ya no se trata solo de que usen tu trabajo de una forma desagradable, sino que aumentan los costos y el tiempo de mantenimiento, causando daños reales.
Hace unos años, durante la COVID-19, operé un sitio para consultar los apoyos del gobierno de EE. UU. a pequeños negocios y los préstamos fraudulentos procesados por el DOJ. Se podían descargar gratis unos 10 GB de datos públicos completos, y las donaciones acumuladas fueron de unos 2 mil dólares.
Pero los crawlers de IA, en vez de usar el enlace de descarga completa en la página principal, recorrieron todas las combinaciones de criterios de búsqueda página por página y descargaron decenas de terabytes de HTML. Incluso con caché de CloudFront y un backend eficiente, solo el costo mensual de red llegó a unos 1,000 dólares, así que cerré el sitio al mes siguiente.
Eso sí, si se te pasa un pago, el servidor puede ser eliminado en aproximadamente una semana, así que nunca hay que atrasarse.
¿No necesitamos patrones técnicos y bibliotecas open source para responder a esta nueva composición del tráfico? Millones de sitios pequeños y creadores no tienen capacidad para defenderse por sí solos del acceso automatizado a gran escala, y cuanto más útil es el contenido, más crawling agresivo recibe, lo que aumenta costos operativos e inestabilidad.
Se necesitan herramientas comunitarias de gestión que incluyan identificación de agentes, limitación de velocidad, clasificación de tráfico, políticas de acceso, caché, procedimientos de verificación, logging, confirmación de origen y control de uso. En vez de que cada operador las invente desde cero por su cuenta, deberían ofrecer reglas comunes sólidas adecuadas para el tráfico automatizado actual.
También hay empresas que venden públicamente acceso vía proxy a smart TVs y teléfonos infectados, así que ¿no se podría crear una base de datos de esas IP para bloquearlas? Si el aviso de bloqueo induce a revisar dispositivos infectados en casa, quizá se pueda resolver el problema desde la raíz: https://news.ycombinator.com/item?id=49000864
Al final volvemos a las herramientas existentes de control de picos de tráfico. Las herramientas propuestas se han usado durante décadas para frenar el efecto Slashdot, DDoS y crawling excesivo de motores de búsqueda, y empresas como Cloudflare ya lideran este campo.
Las empresas de IA realmente socializan los costos y privatizan las ganancias. Sitios como The Numbers cargan con el costo de resistir la ofensiva de la IA, pero no reciben nada a cambio de las empresas de IA.
Si los crawlers hubieran pagado licencias por datos completos de calidad, no habría problema; el punto central es que empezaron incluso a buscar vulnerabilidades para acceder a datos antes de su publicación.
El área pública gratuita parece un sitio ideal para reconstruirla con un generador de sitios estáticos y combinarla con una CDN que detecte bots. Así podría operarse durante mucho tiempo a un costo razonable
También me da curiosidad la arquitectura anterior y la nueva, así como las estrategias de mitigación y escalado que adoptaron para mantener el sitio
Incluso los sitios PHP endebles de los años 2000 manejaban unas 200 solicitudes por segundo, los sitios estáticos más de 1,000, y Node.js presumía 100,000 por segundo gracias al threading cooperativo. En cambio, los sitios de hoy ejecutan cientos o miles de consultas a la base de datos por culpa de los ORM y el problema N+1, tardan más de 500 ms en responder y ya sienten la carga con 1,000 usuarios simultáneos
La caché de muñeca rusa, independiente del lenguaje y la base de datos, y la invalidación precisa de caché para datos dependientes nunca se generalizaron. Probé incluso los eventos touch de Laravel y caché de consultas con Redis, pero la invalidación de caché es, en la práctica, un problema sin resolver; no conviene implementarla a mano, sino considerar desde el inicio estrategias como paquetes y sharding
La web debió haberse convertido en un almacenamiento P2P con direccionamiento por contenido, como BitTorrent, que recibiera contenido de peers cercanos, pero HTTPS/SSL y el modelo de seguridad de los navegadores fueron obstáculos. Podrían hacer falta incluso redes de confianza o pruebas de conocimiento cero, así que por ahora parece que quedaremos atrapados en las trilladas pantallas de verificación humana
En 2015 lancé Applaudience, que en ese entonces era el único que ofrecía datos de venta de boletos de cine en tiempo real, y durante el proceso de calibración solía comparar con las cifras de TheNumbers.com
Ahora estoy en otro negocio, pero de las tecnologías que construí sigue siendo mi favorita, así que algún día me gustaría revivirla
Los crawlers de las grandes empresas de IA se pueden bloquear en
robots.txtespecificandoDisallow: /paraClaudeBot,Claude-SearchBot,Claude-User,GPTBot,OAI-SearchBot,PerplexityBot,Google-Extended,Google-Extended-FactualyBingbot, respectivamentecrawl-delaypara poder ajustarlo según las condiciones del servidor, pero no lo soporta: https://developers.google.com/crawling/docs/robots-txt/robots-txt-spec#syntaxSi los bloqueas, parece que también bajará aún más el tráfico desde búsquedas
Como resultado, se agregaba una solicitud innecesaria a la mayoría de las URLs de subdirectorios
Opero un sitio pequeño, http://radar.lv, que archiva emisiones antiguas de radio en ruso. Antes el tráfico de EE. UU. era de 5%, pero recientemente 90% viene de EE. UU.
Por suerte puedo soportar hasta 1 TB al mes, y no me opongo al crawling en sí, pero me preocupa la estabilidad para los visitantes reales. Estoy considerando activar la función reciente de Cloudflare para pago por visita
Mi blog personal usa un generador estático, pero este archivo tiene además el problema de usar un Drupal viejo que lleva años sin parches de seguridad