- Investigadores de la University of Technology Sydney presentaron una tecnología no invasiva de brain-to-text que convierte en texto en pantalla las frases leídas en silencio usando solo ondas cerebrales EEG
- El modelo de IA DeWave funciona sin implantes cerebrales ni MRI, y el usuario usa una gorra EEG que registra la actividad cerebral
- Aunque el EEG tiene más ruido que las señales basadas en implantes, logró alrededor de 0.4 según la métrica BLEU y mostró mejores resultados al hacer coincidir verbos que sustantivos
- Aparecen errores como convertir “the author” en “the man”, lo que muestra la limitación de elegir palabras semánticamente cercanas en lugar de las palabras exactas
- Los investigadores creen que pueden elevar la precisión hasta 0.9; los resultados se presentaron en NeurIPS, pero el preprint de ArXiV aún no ha pasado por revisión por pares
Experimento para leer frases usando solo EEG
- Investigadores del GrapheneX-UTS Human-centric Artificial Intelligence Centre de la University of Technology Sydney experimentaron con un método que convierte directamente formas de onda EEG crudas en lenguaje
- Ching-Ten Lin afirmó que es el primer caso en integrar una técnica de codificación discreta (discrete encoding) en el proceso de traducción brain-to-text
- Los participantes leían pasajes de texto en silencio, y el modelo de IA DeWave recibía solo las ondas cerebrales como entrada y mostraba palabras en pantalla
- Este resultado fue seleccionado como paper destacado en la conferencia NeurIPS, la conferencia anual de investigadores de IA y machine learning
Ventajas del enfoque no invasivo y limitaciones actuales
- A diferencia de las tecnologías existentes de brain signal-to-language, este enfoque no requiere implantes cerebrales ni equipos de MRI
- También puede usarse sin entradas adicionales, como software de eye-tracking
- Los investigadores consideran que también podría usarse junto con otros equipos
- El usuario solo debe usar una gorra que registra la actividad cerebral mediante EEG
- Las señales EEG tienen más ruido que la información obtenida de implantes
- La puntuación según el algoritmo BLEU es de alrededor de 0.4
- Yiqun Duan explicó que el modelo es mejor en la coincidencia de verbos que de sustantivos
- En los sustantivos, tendía a producir sinónimos o palabras semánticamente cercanas, como “the man” en lugar de “the author”, más que una traducción exacta
- Los investigadores creen que, cuando el cerebro procesa palabras, las palabras de significado similar pueden generar patrones de ondas cerebrales similares
- La precisión objetivo a futuro es 0.9
- 0.9 es un nivel comparable al de los programas tradicionales de traducción de idiomas
- El experimento tuvo 29 participantes, una cifra que se considera más de un orden de magnitud mayor que la de varios experimentos con otras tecnologías de decodificación
- Los resultados se presentaron en NeurIPS y el preprint está disponible en ArXiV
- Aún no ha pasado por revisión por pares
1 comentarios
Comentarios de Hacker News
Hice un doctorado en interfaces cerebro-computadora y he trabajado con EEG y electrodos implantados
Gran parte de la investigación en BCI se centra en ayudar a que pacientes con parálisis puedan volver a comunicarse
Por desgracia, el EEG no ofrece una relación señal-ruido suficiente fuera de condiciones como un laboratorio con jaula de Faraday, días o semanas de eliminación de ruido y remoción de artefactos por movimiento ocular, así que es difícil lograr buenas velocidades de comunicación
Esto se debe a un límite físico: el campo eléctrico del cerebro se debilita al salir del cráneo, y no es fácil de superar. Por ejemplo, los juguetes comerciales de “lectura mental” en realidad funcionan a partir de señales musculares de la cabeza y los ojos
Los electrodos implantados dan mejores señales, pero todavía harán falta varias iteraciones antes de que sean comercialmente viable. Después de unos meses, el cerebro forma tejido cicatricial alrededor de los electrodos y la señal se degrada, y por supuesto la cirugía cerebral en sí es bastante riesgosa
Las pruebas en humanos requieren aprobación gubernamental, así que el ciclo de iteración también es muy lento. Si un amigo con parálisis pudiera mover solo los ojos, yo sin duda me enfocaría en la tecnología de seguimiento ocular. Supera por mucho a cualquier BCI que haya escuchado
Y también si crees, como dice el artículo, que buenos algoritmos de IA podrían ayudar a filtrar o interpretar mucho del ruido
Por ejemplo, pasar por un detector de metales o tocar el celular
Como era de esperarse, una de las mayores fuentes de ruido era tocar un celular conectado a la corriente
Un gorro tipo Faraday para EEG parece algo que de verdad podría funcionar, y si además se suma video auxiliar en primera persona, los médicos probablemente podrían filtrar mucho ruido
De hecho, este mismo artículo parece una prueba bastante sólida de que el problema de relación señal-ruido del EEG podría mejorar conforme mejoren los algoritmos
Creo que el paciente tenía daño en los nervios hacia la médula espinal. Parecía un avance prometedor; me gustaría saber qué opinas
https://actu.epfl.ch/news/thought-controlled-walking-again-a...
Como reconstruir qué se escribió a partir del audio de una habitación con un teclado, no hay que subestimar la capacidad del deep learning para volver a extraer señal del ruido
El mayor reto podría ser que el costo de generar datos de EEG correlacionados con la señal es relativamente alto. Así que es difícil que lleguen a existir millones de horas de datos de personas viendo o procesando objetivos conocidos para alimentar un modelo
En cambio, los datos de seguimiento ocular pronto crecerán muchísimo al convertirse en un componente clave del nuevo hardware de consumo
Respuesta correcta: Bob attended the University of Texas at Austin where he graduated, Phi Beta Kappa with a Bachelor’s degree in Latin American Studies in 1973, taking only two and a half years to complete his work, and obtaining generally excel- lent grades
Predicción: was the University of California at Austin in where he studied in Beta Kappa in a degree of degree in history American Studies in 1975. and a one classes a half years to complete the degree. and was a excellent grades
Vaya, esto se parece a los sistemas primitivos de conversión de voz a texto de los años 70 y 80. Las interfaces cerebrales están dejando rápidamente de ser ciencia ficción para volverse realidad. Todavía no sé muy bien cómo sentirme al respecto
Los resultados reales están en la Table 3, y son mucho peores
O sea, encontrar un equilibrio entre el procesamiento ascendente de lo que el modelo TTS cree que la persona “está pensando” y el procesamiento descendente de lo que un modelo gramatical cree que una persona promedio “diría después” dado el contexto de la conversación hasta ese momento. Como una neocorteza real
Pensándolo bien, si hubiera un corpus transcrito de las conversaciones de esa persona, también se podría entrenar un LLM ajustado a eso. Entonces correspondería casi exactamente a predecir “qué diría esa persona en este momento”
Incluso parece posible encontrar ubicaciones adicionales de parches EEG capaces de leer las consecuencias eléctricas de la acción de AMPAR y NMDAR. Eso permitiría determinar cuánto está dependiendo la persona de su modelo interno descendente del habla, o si está usando procesamiento interno ascendente para intentar producir oraciones extrañas y nuevas en las que nunca antes había pensado, y usar esa información para ajustar el peso de la influencia del modelo TTS y del LLM sobre la salida
Seguro alguien va a lanzar un BCI “gratis” que te vigile al máximo
https://www.youtube.com/watch?v=OSV7cxma6_s
“En una situación en la que toda esta tecnología está avanzando a una velocidad inimaginable, el futurista Peter Diamandis, a quien vale la pena seguir de cerca, sacudirá tu forma de pensar y te hará imaginar nuevas posibilidades y oportunidades para la longevidad saludable”
Hay una parte que dice que “no es la primera tecnología capaz de traducir señales cerebrales a lenguaje, pero sí la única que ha aparecido hasta ahora que no requiere implantes cerebrales ni acceso a equipos de MRI en toda regla”.
Me pregunto si en 10 o 20 años, cuando la tecnología de sensores mejore lo suficiente como para que ni siquiera haga falta usar una gorra, empezará a aparecer gente diciendo que en los espacios públicos ya no existe una expectativa razonable de que no te lean los pensamientos.
La tecnología de vigilancia suele tender a normalizarse, y también me pregunto si hay límites reales hasta dónde puede llegar.
Hace más de 10 años circuló la historia de que el algoritmo del programa de lealtad de Target detectó el embarazo de una adolescente antes de que se lo dijera a su familia, viendo correlaciones en cambios de compra, como pasar de velas aromáticas a velas sin aroma.
Si pueden tomar datos de redes sociales, seguimiento facial y de la mirada por CCTV, datos del giroscopio del celular, historial de compras, historial de búsquedas, y también los mismos datos de las personas conectadas contigo, con un conjunto comparativo lo bastante amplio podrían descubrir todo tipo de secretos ocultos.
Es parecido al miedo de que “mi teléfono está escuchando mis conversaciones”. En realidad no está escuchando, pero lo más preocupante es que puede dibujar con mucha precisión lo que vas a terminar diciendo sin necesidad de espiarte en primer lugar.
No espero gran cosa.
Esto es muy impresionante y útil, y al mismo tiempo terrible.
Todo el mundo pensó de inmediato en lectura de la mente para interrogatorios, pero ¿qué hay de la introspección? Existen muchas formas de educación y terapia porque no podemos analizarnos a nosotros mismos de manera completamente objetiva.
Si pudiéramos analizar nuestros patrones de pensamiento fuera de nuestra propia cabeza, podrían lograrse todo tipo de mejoras. Se podría descubrir qué técnicas educativas son realmente las más efectivas, verificar objetivamente cuándo uno se concentra más o menos, e identificar con precisión cuándo comenzaron pensamientos ansiosos y qué los detonó.
Sobre todo, esto podría hacerse de forma privada, con una pareja o selectivamente en grupo.
Además, incluso hoy en día se podría usar fMRI como detector de mentiras mediante escaneo cerebral. Solo que siguen existiendo muchas dudas sobre su validez.
https://scholarship.law.columbia.edu/cgi/viewcontent.cgi?art...
Lo difícil no es solo la introspección en sí, sino recordar reflexionar y anotar los eventos para poder analizarlos después. Eso sí, suponiendo que se pueda confiar en la precisión.
Sorprende que, aunque el agujero ético de esto sea del tamaño del universo, igual se pueda pasar tan rápido a hablar de beneficios.
Aunque tal vez esa sea la naturaleza del optimista tecnológico.
Me recuerda al Silent Talk de DARPA de hace 14 años.
El objetivo era “permitir la comunicación entre usuarios en el campo de batalla sin habla vocalizada, mediante el análisis de señales neuronales”.
https://www.engadget.com/2009-05-14-darpa-working-on-silent-...
Esto es muy impresionante y útil, y al mismo tiempo terrible.
Parece que podría ayudar a pacientes con accidente cerebrovascular, pero al mismo tiempo imagino que podría meterlos en problemas al sacar hacia afuera pensamientos sin filtrar.
Con Neuralink no habrá problema. Solo habrá que subir de inmediato el rastro de tus pensamientos.
Aunque tengas pensamientos equivocados, no tendrás de qué preocuparte. Habrá escuelas de rehabilitación que cambien tu estado mental.
No olvides que debes ser feliz. Estar triste estará prohibido.
Ahora es de solo lectura, pero ¿y la escritura?
Esto también podría abrir nuevas posibilidades, como una versión real de Matrix.
Por cierto, ¿has oído hablar de Lightspeed Briefs?
Claro que la investigación en sí es excelente y puede volverse útil. Solo que, a largo plazo, el potencial de abuso político es enorme.
Para pacientes con síndrome de enclaustramiento los beneficios positivos serían difíciles de imaginar, pero al mismo tiempo también da para pensar “¡dejen de inventar el Torment Nexus!”.
A menos que me haya perdido de algo importante, una demostración ciega con control donde el participante escriba las palabras en papel y luego se comparen los resultados sería convincente
Lamentablemente, la demostración mostrada en el artículo parecía algo que también podría hacer un mago profesional o un mentalista
Puede que de verdad nos estemos acercando a una interfaz cerebral, pero en este caso hay algo raro
Imaginemos que dentro de unos años alguien inventa un escáner de aeropuerto que detecta “pensamientos malvados”. Pero no hay forma de verificarlo ni responsabilidad por falsos positivos o falsos negativos. El resultado es simplemente lo que diga el operador
Si suficientes personas lo aceptan lo bastante como para no resistirse, e incluso atacan a quienes son “detectados”, entonces ya no importa qué sea real. Simplemente se convierte en un ritual chamánico de empatía en el que la gente participa en conjunto. Siento que hay ejemplos de una dinámica parecida en la memoria reciente
Me pregunto si también sería posible el pensamiento no verbal
¿No podríamos averiguar qué piensa o sueña un perro a partir de un conjunto de datos de señales vinculado con actividades cotidianas?
Sacar una representación de experiencias corporales parece una tarea difícil de construir e interpretar bien. Aun así, quizá un conjunto de datos de señales conectado con experiencias físicas podría anotarse de manera más fácil y robusta con descripciones en lenguaje usando modelos visión-lenguaje
Entonces, un modelo para leer la mente de un perro podría predecir y emitir esas descripciones en lenguaje
Basta imaginar que podrías saber con precisión a qué parque quiere ir tu perro, si está percibiendo señales sutiles tempranas de enfermedad o lesión, o qué premio quiere que le compres
Como referencia, el modelo base que usa este paper tiene un bug de código, así que los resultados de referencia quedaron inflados
Actualmente están investigando el problema
https://github.com/duanyiqun/DeWave/issues/1
Dejando de lado las implicaciones terribles, esto haría posible algo muy genial: comunicación telepática bidireccional
Piensas un mensaje y piensas en “enviar”, y luego escuchas la respuesta por un earbud. Si además se suma clonación de voz, incluso podrías recibir el mensaje con la voz de quien lo envió
Para un observador externo sería completamente silencioso e invisible
Me daría muchísima curiosidad ver los resultados de usar el hardware de este sistema como una especie de transductor. Es decir, ejecutar en reversa el modelo de aprendizaje automático de aquí a partir del texto objetivo, y volver a inyectar la señal eléctrica subyacente resultante como señal de estimulación transcraneal por corriente directa a través de los pads de EEG
Si el resultado fuera que una persona “escucha” ese texto como un pensamiento verbal en la voz de su mente, sería realmente fascinante
En ese entonces el GameBoy Color era lo más genial del mundo
Tomb Raider en la PsOne se veía como alta resolución, la alta resolución ni siquiera existía, y pensábamos que habíamos llegado al techo de los videojuegos
Apple Pro One está intentando espacializar la computación, y a nosotros la telepatía nos parece genial
Estaría bueno poder correr por el bosque o hacer buceo y aun así programar por 10 segundos solo con la mente
Estaría bueno recibir una imagen que otra persona creó en su mente y hacer que aparezca frente a ti, y luego compartirla con la gente alrededor diciendo “oye, miren lo que hizo Julia”
En realidad, esto es exactamente igual a lo que ya pasa, solo que de una forma más inmediata. Si cambias el smartphone por la mente y la pantalla por el entorno, ya estás dentro de ese mundo futuro
Si algo parece genial por lo novedoso, ¿entonces no sería también genial volver a perforar código en tarjetas o escribir líneas en
eddesde una terminal?Hace unos años me pasé en la producción musical con DAW a 10 sintetizadores de los años 70–84 y una máquina de cinta, y era muchísimo más genial; no pienso volver atrás
Pero, ¿estoy produciendo tan rápido como antes? No
Si quiero escribir código usando solo la mente y pantallas virtuales flotantes, aparte de esos pocos días de emoción que trae la novedad, hay una sola razón
Porque quiero trabajar menos, o más exactamente, quiero estar menos en el trabajo
Pero en la práctica me van a exigir producir todavía más. Será obligatorio trabajar solo con el poder de la mente, con 5 o 6 pantallas virtuales flotando alrededor
Y eso será todo. Hasta que otro invento nuevo vuelva a parecer genial
Por ejemplo, pensamientos intrusivos, canciones pegadas en la cabeza, secretos y cosas así
Las consecuencias no intencionadas de esta tecnología van a superar la imaginación