1 puntos por GN⁺ 2025-04-27 | 1 comentarios | Compartir por WhatsApp
  • No hay pruebas claras de que los smartphones estén espiando conversaciones de forma permanente para mostrar anuncios; en la práctica, la segmentación publicitaria se parece más a una combinación de datos de ubicación, relaciones y comportamiento
  • La controversia de Active Listening de Cox Media Group en 2024 se expandió por materiales sobre “real-time intent data” y uso de datos de voz, pero las grandes tecnológicas tomaron distancia de CMG y la empresa descontinuó el producto
  • El experimento de Wandera en 2019 reprodujo audio de anuncios de alimento para mascotas durante 30 minutos en un iPhone y un Samsung Galaxy, y luego comparó anuncios mostrados, uso de datos, batería y actividad en segundo plano, pero no encontró señales de carga constante del micrófono
  • Investigadores de Northeastern University analizaron más de 17,000 apps de Android y no encontraron casos de activación secreta del micrófono, aunque sí detectaron un problema de privacidad más directo: algunas apps enviaban capturas de pantalla y grabaciones de pantalla a terceros
  • Plataformas como Facebook pueden predecir intereses usando grandes volúmenes de datos personales como rastreo entre dispositivos, relaciones de amistad, ubicación, información de compras y metadatos de llamadas y mensajes en Android, lo que vuelve al sistema publicitario más opaco y difícil de entender que una simple escucha

Por qué la teoría del espionaje del smartphone se repite

  • Cuando en redes sociales aparece un anuncio que coincide exactamente con una conversación que acabas de tener, la interpretación más simple parece ser la de una escucha por micrófono
  • La idea de que Facebook, Google y Apple oyen palabras clave de conversaciones privadas para mostrar anuncios personalizados se ha instalado como una vieja teoría conspirativa tecnológica
  • Pero más allá de casos anecdóticos, no se ha encontrado evidencia clara de que los smartphones escuchen conversaciones privadas de forma permanente y las usen para publicidad

La controversia de Active Listening en 2024

  • En 2024, documentos revelados por 404 Media mostraron que Cox Media Group (CMG) presentaba un sistema llamado Active Listening
    • El material decía que podía obtener “real-time intent data” mediante los micrófonos de dispositivos inteligentes
    • También planteaba que era posible combinar “voice data” con procesamiento de IA y otros “behavioral data” para ofrecer anuncios altamente segmentados
  • No está claro cómo funcionaba realmente Active Listening
  • Tras la polémica, las grandes tecnológicas tomaron distancia de CMG
    • Amazon dijo que nunca había trabajado con CMG como socio publicitario
    • Google y Meta rompieron relaciones con CMG
    • CMG dijo que descontinuó el producto Active Listening “para evitar malentendidos”
  • En lo que se puede entender, el sistema de CMG no se parecía a un micrófono de teléfono escuchando las 24 horas, sino más bien al uso de fragmentos cortos de voz que suben a la nube después de una palabra de activación como “Hey Google” o “Hey Siri”

La controversia por las transcripciones de Facebook Messenger y los malentendidos

  • En 2019, un reporte de Bloomberg reveló que Facebook había encargado a empresas externas la transcripción de conversaciones de audio de Facebook Messenger
  • Facebook dijo que era un procedimiento para probar la precisión de su algoritmo de transcripción automática y que los usuarios que habían hecho opt-in a la función de transcripción sabían que podía haber revisión humana
  • Algunos reportes cuestionaron cuán transparente había sido ese aviso de Facebook
  • El caso se difundió con titulares del tipo “Facebook estaba escuchando conversaciones privadas”, reavivando así la teoría del espionaje por micrófono con fines publicitarios
  • En abril de 2018, Mark Zuckerberg respondió ante el Congreso de EE. UU. que “no hacemos eso” cuando se le preguntó si escuchaban a los usuarios mediante el micrófono para usarlo en anuncios
  • Facebook también había dicho en 2016 que no usaba el micrófono del teléfono para anuncios ni para el News Feed, y que la publicidad se basaba en los intereses y la información de perfil del usuario

Experimento de Wandera: el uso de datos no cuadra

  • La empresa de seguridad móvil Wandera realizó en 2019 un experimento simple para comprobar si los smartphones escuchaban conversaciones de forma continua
    • Dejó un iPhone y un Samsung Galaxy en una habitación y reprodujo audio de anuncios de alimento para mascotas durante 30 minutos al día, por 3 días
    • Activó muchos permisos de apps
    • También dejó teléfonos idénticos en una habitación silenciosa para compararlos como grupo de control
  • El experimento verificó dos cosas
    • Si después del test aparecían anuncios de alimento para mascotas en los feeds de apps
    • El uso de datos, consumo de batería y actividad en segundo plano
  • No aparecieron anuncios de alimento para mascotas en ninguna app
  • Tampoco hubo casi diferencias en uso de datos, batería ni actividad en segundo plano entre la habitación con audio y la habitación silenciosa
  • James Mack, de Wandera, dijo que los datos de la prueba de 30 minutos estaban muy por debajo del uso de datos de un asistente virtual, lo que sugiere que en las apps analizadas no ocurrían grabación continua ni subida a la nube
  • El ex product manager de Facebook Antonio Garcia-Martinez también calculó en una columna para Wired que la vigilancia por micrófono requeriría un nivel de uso de datos difícil de ocultar
    • Una llamada VoIP unidireccional requiere unos 24 kbps, es decir, cerca de 3 kB por segundo
    • Si se asume que el teléfono está encendido la mitad del día, eso equivale a unos 130 MB por usuario al día
    • Con 150 millones de usuarios activos diarios en EE. UU., eso implicaría unos 20 PB al día
    • El almacenamiento total de datos de Facebook se estimaba en unos 300 PB y su recolección diaria en unos 600 TB
  • Hay quien responde que bastaría con detectar palabras clave localmente en el dispositivo, pero se rebate que Facebook tendría que rastrear millones de palabras clave publicitarias y que la carga de CPU sería demasiado visible como para pasar desapercibida

Un rastreo más directo que el micrófono: captura de pantalla

  • Jingjing Ren y Elleen Pan, de Northeastern University, diseñaron a inicios de 2017 una investigación para comprobar si los smartphones escuchaban a los usuarios sin que lo supieran
  • Los investigadores no encontraron casos en los que el micrófono se activara en secreto
  • En cambio, sí descubrieron casos en los que algunas apps capturaban automáticamente su propia pantalla y la enviaban a terceros
    • Christo Wilson explicó que no hubo ninguna filtración de audio y que, en un caso, una app enviaba a un tercero un video de la actividad en pantalla
  • De más de 17,000 apps de Android, más de 9,000 tenían permisos potenciales para tomar capturas de pantalla
  • David Choffnes señaló que la captura de pantalla podría ser peor que una cámara apuntando al techo o un micrófono grabando conversaciones irrelevantes, y que no existe una forma fácil de cerrar ese agujero de privacidad

La segmentación publicitaria ya tiene datos suficientes

  • Facebook tiene mejores herramientas para segmentar usuarios a partir de señales débiles, sin necesidad de ningún milagro técnico basado en el micrófono
  • Garcia-Martinez sostiene que Facebook puede localizar al usuario en todos los dispositivos desde los que haya accedido a Facebook y aprovechar tanto información que conocen los comercios como incluso compras offline pagadas en efectivo
  • Los datos que la plataforma puede aprovechar son variados
    • La ubicación actual del usuario
    • Sus relaciones de amistad y los intereses de sus amigos
    • Información sobre con quién pasa tiempo el usuario
    • Rastreo a través de múltiples dispositivos
    • Metadatos de llamadas y mensajes en teléfonos Android
    • La posibilidad de rastrear lo que el usuario escribe y borra sin llegar a enviarlo
  • Cuando esos datos se procesan con algoritmos, es posible predecir de qué podrían estar hablando el usuario y sus amigos, y mostrar anuncios ajustados a sus necesidades del momento
  • Los algoritmos publicitarios no son perfectos y también muestran con frecuencia anuncios que no encajan en absoluto con los intereses del usuario
  • Aun así, como algunos anuncios llegan a ser inquietantemente precisos, a los usuarios les resulta fácil aceptar la explicación simple del espionaje por micrófono

La diferencia entre asistentes de voz y grabación permanente

  • Los dispositivos inteligentes con control por voz, en cierto sentido, casi siempre están “escuchando” al usuario
  • Pero su funcionamiento es distinto al de una grabación permanente
    • El dispositivo detecta localmente una palabra de activación como “Hey Google”
    • Cuando detecta esa palabra, se activa brevemente y graba los siguientes segundos de datos de voz
    • Luego sube esos datos a la nube para procesar la respuesta y devuelve el resultado al dispositivo
  • Esa transmisión de datos puede detectarse y rastrearse
  • El problema, más que el espionaje por micrófono, es que a las personas les resulta difícil entender cómo algoritmos complejos que rastrean incontables puntos de datos personales deciden el momento de mostrar un anuncio
  • La incomodidad que provocan los anuncios en smartphones surge menos de una simple escucha y más de un rastreo de datos complejo y opaco

1 comentarios

 
GN⁺ 2025-04-27
Opiniones de Hacker News
  • Este artículo recuerda a una excelente sátira de Jonathan Zeller en McSweeney's: Calm Down—Your Phone Isn’t Listening to Your Conversations. It’s Just Tracking Everything You Type, Every App You Use, Every Website You Visit, and Everywhere You Go in the Physical World
    https://www.mcsweeneys.net/articles/calm-down-your-phone-isn...

    • Ver que se dedica tanto tiempo a “refutar” las grabaciones de audio compartidas con varias entidades lo hace, más bien, aún más sospechoso
      Es parecido a lo de Facebook: “nunca vendemos tus datos (solo te rastreamos y vendemos anuncios con esos datos)”. Siento que debe de haber una salida del tipo “nunca escuchamos el audio (solo lo analizamos para mejorar el control de calidad)”
    • Me recuerda a cuando un ejecutivo de una empresa de telecomunicaciones bromeó diciendo: “el banco puede saber en qué hotel te quedaste anoche, pero la telecom sabe con quién dormiste”
    • Este artículo en realidad omitió una fuente importante de datos del micrófono: los smart TV
      Estoy convencido de que mi Toshiba Fire TV escucha todas las conversaciones dentro de su rango audible incluso cuando no uso el control remoto por voz, y se las vende a redes publicitarias. Claro que también hará el reconocimiento de pantalla del que habla el artículo original, pero a lo que me refiero es a recopilar con el micrófono las conversaciones en tiempo real de la gente en la habitación
  • Hace tiempo revelé que Google recopilaba datos a gran escala de Twitter, al punto de que si ponías solo un handle de Twitter en el cuadro de búsqueda de Google Maps, podía mostrar los lugares desde donde se había usado Twitter
    Aunque desactivaras compartir ubicación en Twitter, conocía esa ubicación, así que solo era posible si Twitter le daba información a Google de forma privada. Ese “experimento” se canceló después, pero por esa revelación y varias actividades perdí permanentemente mi cuenta de Twitter; cuando pedí varias veces que la restauraran diciendo que me habían suspendido de forma permanente sin una razón válida, X Support quedó configurado para enviar todas mis apelaciones directo al basurero digital. Ya nada me sorprende

    • ¿Este experimento era este? https://github.com/jkakavas/creepy https://www.geocreepy.com/
    • ¿Puedes pasar un enlace a material relacionado? Suena muy interesante
    • Publicar algo así sin incluir enlaces a la investigación para que la gente pueda verificarlo es realmente difícil de justificar
    • ¿Acaso no todos los sitios mandan todas las solicitudes de soporte al basurero digital por cualquier motivo? Creo que lo que hay que hacer es crear una cuenta nueva, pero usando todos los medios posibles para que el sitio no pueda vincularla con la cuenta anterior
  • Al momento de escribir esto, el título de la página es “Your phone isn’t secretly listening to you, but the truth is more disturbing”, y el título actual de esta publicación es el mismo
    Pero al leerlo, en la práctica es un artículo centrado en Facebook. La frase “tu teléfono no te escucha en secreto” puede prestarse a confusión. El artículo no demuestra que el teléfono no esté escuchando; solo trata la idea de que quizá algunas empresas no lo hagan. En la realidad, el teléfono perfectamente podría estar escuchando. Hay mucho malware/spyware que lo hace explotando vulnerabilidades, y también casos como NSO Group. Además de las herramientas que se pueden comprar en el mercado abierto, hay que asumir que el Mossad, la NSA y las principales agencias de inteligencia tienen herramientas aún más potentes. Tu teléfono absolutamente podría estar escuchándote, aunque probablemente no lo esté
    https://www.bloomberg.com/news/features/2023-01-24/nso-group...
    https://www.britannica.com/topic/Pegasus-spyware
    https://citizenlab.ca/2016/08/million-dollar-dissident-iphon...
    https://newatlas.com/computers/smartphone-listening-conversa...
    https://www.bloomberg.com/news/features/2023-01-24/nso-group...

    • En términos generales, el teléfono no está escuchando, pero si eres un objetivo que puede interesarle mucho a un adversario poderoso, perfectamente podría hacerlo
      Aunque si estuvieras en una situación así, probablemente eso sería de las preocupaciones menores en la lista
    • Hoy en día los teléfonos muestran en la barra de estado cuando la cámara/micrófono está activo
  • Como referencia, los TV “smart” también envían capturas de pantalla
    [0] https://dl.acm.org/doi/10.1145/3646547.3689013

    • Ya llegamos al punto en que se puede asumir con seguridad que cualquier cosa que lleve “smart” viola la privacidad
  • Hay una parte que dice que “la app tomó automáticamente capturas de pantalla de su propia pantalla y las envió a terceros, y en un caso grabó video de la actividad en pantalla y lo envió a terceros”, y que, de más de 17,000 apps de Android, más de 9,000 tenían permisos potenciales para tomar capturas. ¿Qué permiso es ese, y cómo se puede detectar y bloquear qué apps hacen eso?

    • Sí existe el permiso para grabar la pantalla. Requiere consentimiento del usuario y, mientras está en uso, aparece un ícono en la barra de estado. Es imposible usarlo en secreto.
      Lo que parece describir el texto es el caso de una app que toma una captura de su propia ventana. Eso, por supuesto, es posible y no requiere ningún permiso. Basta con crear un bitmap del tamaño de la pantalla y hacer getWindow().getDecorView().draw(new Canvas(bitmap));. Es plausible que muchos SDK de terceros de publicidad/marketing/rastreo, que están metidos por todas partes en muchas apps, puedan hacer algo así.
    • Al revisar el estudio citado, dice que “a diferencia de las API de cámara y audio, las API de captura de pantalla y grabación de pantalla no están protegidas por ningún permiso”.
      Sin embargo, realizaron análisis estático en 9,100 de 17,260 apps para determinar cosas como “si las API de medios se referencian en el código real de la app”, y luego usaron análisis dinámico para confirmar si la app realmente llamaba a esas API. Es decir, distinguieron los casos en los que una biblioteca solo estaba enlazada pero la app no la llamaba. El resumen del artículo es malo. No debería decir “tenían permisos potenciales para tomar capturas de pantalla”, sino “tenían el potencial de tomar capturas de pantalla”.
    • No creo que exista un permiso específico llamado “capacidad de enviar capturas de pantalla en secreto al desarrollador”.
      Es muy probable que sea una combinación de varios permisos, como el de conexión a la red y algún permiso para capturar la pantalla sin que sea claramente visible para el usuario.
    • Cuando se usa como herramienta para desarrolladores, a esto se le llama RUM, es decir, monitoreo de usuarios reales.
      Es muy útil para resolver bugs, pero también tiene un enorme potencial de abuso o de uso hostil hacia el usuario.
    • Desde el punto de vista de permisos, los teléfonos deberían ofrecer un historial de uso que muestre cuándo y con qué frecuencia se usó realmente cada permiso.
  • Creo que la gente ignora el costo y la precisión cuando afirma que los teléfonos escuchan las 24 horas. Al menos con las restricciones actuales, es muy poco probable que eso ocurra.
    La transcripción de audio no es gratis y cuesta mucho cómputo. A las redes publicitarias o a los servicios grandes, sobre todo a organizaciones que cuidan la economía unitaria, les resultaría difícil costearlo. La precisión también sería pésima. La mayoría de los teléfonos están en bolsillos y casi no captarían nada. Además, las conversaciones comunes rara vez tienen contenido valioso para los anunciantes, mientras que Google imprime dinero gracias a búsquedas con intención de compra. La relación señal-ruido de una conversación normal es mucho más baja, lo que empeora aún más la economía unitaria. Además, si esto ocurriera, no sería difícil notarlo. El teléfono se calentaría, la batería se agotaría rápido y consumiría muchos datos. En iOS se muestra un indicador de uso del micrófono, y si una app consume demasiados recursos en segundo plano, es probable que el sistema operativo la mate. Hasta que se descubra un caso real, no vale la pena preocuparse.

    • Por estas razones, el espionaje de audio parece más plausible en dispositivos conectados a la corriente, fijos y con bastante RAM y capacidad de procesamiento que normalmente está ociosa.
      Bastaría con ejecutar localmente el modelo de transcripción y enviar solo el texto resultante; además, sería natural que consuman bastante energía y usen internet en momentos arbitrarios. Por ejemplo, una smart TV.
    • No hace falta escuchar todo el tiempo. Basta con capturar unas cuantas palabras justo después de que lo dejas sobre la mesa o presionas el botón de bloqueo. O incluso solo escuchar mientras está en uso.
      Crear una nube de palabras es trivial y tendría un impacto mínimo en la batería.
    • Estos puntos también se trataron en el artículo como razones por las que la grabación de voz es menos útil que otros mecanismos de rastreo que ya tienen los anunciantes.
    • No creo que la grabación de audio ocurra realmente, pero el argumento económico no es completo.
      ¿Qué pasaría si solo grabaran el audio de objetivos “de alto valor”, es decir, personas que compran mucho? Podría valer la pena grabar solo a esas personas, y por eso las pruebas aleatorias hechas normalmente con teléfonos nuevos y limpios quizá no detecten eventos de grabación.
  • No fue un teléfono sino una TV, pero ayer YouTube fue, como mínimo, bastante sospechoso.
    Primero, quedó bastante claro que, aunque desactives el historial de reproducción, usa para recomendaciones el historial de otras cuentas que acceden desde la misma IP. Si no hay historial, las recomendaciones de inicio se desactivan, pero cuando hice una búsqueda aparecieron videos totalmente irrelevantes de canales de escalada que mi esposa había visto con otra cuenta. Yo nunca había visto contenido de escalada con esta cuenta. Lo segundo fue la parte de “está escuchando”. Ayer le conté al exterminador que vino a hacer la fumigación trimestral y le mostré una cicatriz que me hice a fines del año pasado al caerme mientras bajaba en skate una colina que no podía controlar. Menos de cinco minutos después, encendí la TV y abrí YouTube, y la primera recomendación en la cuenta de mi esposa era un video de alguien cayéndose en longboard a 50 millas por hora. No es ningún secreto que ambos patinamos y que en esta cuenta vemos muchos videos de downhill, pero nunca habíamos buscado ni visto videos de accidentes, ni nos los habían recomendado, y apareció recomendado cinco minutos después de hablar de eso frente a la TV.

  • Tonterías. Hay un experimento simple que hice y que todavía funciona.
    Hace tiempo, en YouTube del Reino Unido salían muchísimos anuncios realmente horribles de extracción de cerumen. Como experimento y broma, les dije a dos amigos cercanos lo asquerosos y quitaapetito que eran esos anuncios, y luego repetí adrede varias veces y en voz alta “ear wax removal”. Como era de esperarse, un día después un amigo me mandó un mensaje del estilo “de verdad te odio”. Los teléfonos de mis amigos eran Android e iOS, y creo que el afectado fue el usuario de Android.

    • Si esa fue la fuente de ese anuncio, ¿por qué lo viste tú? ¿Estabas gritándole a tu teléfono sobre extracción de cerumen?
      Hay millones de formas en que el software publicitario que corre en el teléfono puede conectar perfiles y propagar la “infección” a un amigo. El acceso básico a la ubicación es lo más importante; también son mucho más plausibles que “el teléfono escucha 24/7” cosas como la misma dirección IP (¿el WiFi de tu amigo?), estar cerca de los mismos beacons Bluetooth, los mismos SSID guardados, o que tu amigo haya visto por casualidad un anuncio dirigido a un segmento demográfico amplio.
    • Decir “mi teléfono está escuchando y puedo probarlo” es un excelente indicador de falta de pensamiento crítico.
      ¿No ves los sesgos y errores dentro de tu propio comentario?
    • O quizá el amigo que escuchó hablar de ese anuncio horrible lo buscó distraídamente y por eso entró en una lista de retargeting.
    • Si tú y tus amigos vieron ese anuncio desde el principio, fue porque todos eran el público objetivo del anuncio. Probablemente era simple segmentación demográfica.
      Es posible que durante la primera semana de una campaña de cuatro semanas todos lo ignoraran, pero para la cuarta semana ya lo habían visto tantas veces que se les quedó grabado en la cabeza.
  • Quien crea las correlaciones ni siquiera es una persona. Así como los transformers pueden aprender gran parte del conocimiento humano solo con predicción de tokens, no sería sorprendente que los sistemas de aprendizaje automático para entrega de anuncios hayan aprendido sobre las personas con un nivel de detalle similar
    Hace unos 10 años, el estado del arte era predecir la tasa de clics con una precisión de cuatro nueves usando el contexto disponible, como el perfil del usuario, el sitio web actual y las palabras clave, y eso se interpretaba como que hacía falta un modelo de aprendizaje bastante preciso del comportamiento humano. Ya no estoy en la industria y no sé cuál sea el estado del arte actual de la tecnología publicitaria, pero seguro ha avanzado. El modelo se entrenaba con datos etiquetados automáticamente basados en tasas de clics reales recientes (a escala de GB por segundo), y la cantidad de datos de entrenamiento era más o menos comparable a la de un modelo de lenguaje grande pequeño. Una anécdota reciente: tres personas estaban sentadas a la mesa con sus teléfonos afuera, hablando de un tema raro sobre aves, y poco después apareció en el flujo de anuncios de Facebook de una de ellas. Posibles explicaciones: muchas apps enlazan montones de bibliotecas de recopilación de datos y publicidad de terceros, y cualquiera de ellas podría recopilar y revender suficientes datos de contexto como para crear la correlación; además, es posible que otros amigos hubieran hablado recientemente de ese tema y que los enlaces de la red social infirieran que nosotros lo sabríamos. Una tercera posibilidad más remota es que los modelos se hayan vuelto lo bastante buenos como para inferir voz a partir de canales laterales extraños, como el acelerómetro, por ejemplo cuando la gente gesticula y mueve las manos al hablar. La frecuencia de muestreo del acelerómetro es menor a 1 kHz, pero supera los 100 Hz, así que quizá baste con lanzarle un modelo gigante

    • Como no diste una refutación explícita sobre el “tema raro sobre aves”, predeciría con una precisión de cuatro nueves que, cualquiera que fuera el “tema raro sobre aves” que uno pudiera imaginar y debatir, un smartphone estaba en medio de la cadena de dependencias
    • Cuesta entender qué significa “precisión de cuatro nueves en la predicción de la tasa de clics”
      Si la tasa de clics de 1,000,000 impresiones de anuncios fue 24.5898% y el aprendizaje automático predijo 25.1926%, ¿cuántos nueves de precisión son eso?
  • En una empresa anterior hacíamos un SDK bastante popular para apps móviles que los desarrolladores integraban en sus apps
    Se nos acercó una empresa que afirmaba tener una tecnología de reconocimiento de audio, parecida a Shazam pero varios órdenes de magnitud más eficiente, que creo que había sido desarrollada en MIT o en Bell Labs. Decían que servía para seguimiento: reconocer y registrar si un usuario había estado expuesto a anuncios de TV o radio, y nos ofrecieron reparto de ingresos a cambio de que empaquetáramos discretamente su SDK dentro del nuestro. Esto fue hace al menos 10 años, antes de que Apple exigiera permisos de acceso al micrófono y el indicador del punto naranja, así que no recuerdo el nombre. Por supuesto nos negamos, así que no supe más ni probé si era cierto, pero hay empresas realmente turbias. Los smartphones modernos tienen potencia suficiente para procesar audio en el dispositivo, así que el argumento de que se notaría en el tráfico de red no se sostiene