- Un equipo de investigación de la Universidad de Washington desarrolló Target Speech Hearing, un sistema que registra a la persona que habla con solo que el usuario la mire durante 3 a 5 segundos y permite escuchar esa voz en tiempo real incluso en entornos ruidosos
- Los micrófonos de ambos lados de unos audífonos comerciales funcionan junto con una computadora embebida integrada, y cuando el usuario presiona un botón y apunta hacia la persona que habla, el software de aprendizaje automático aprende el patrón de voz
- Tras el registro, el sistema sigue rastreando la voz aunque se muevan quien escucha o quien habla; mientras más hable la persona, más datos de entrenamiento se acumulan y mejor se vuelve el rendimiento para enfocarse en el hablante objetivo
- En una prueba con 21 personas, los participantes calificaron en promedio la claridad de la voz del hablante registrado casi el doble de alta que el audio sin filtrar
- Por ahora solo se puede registrar a una persona a la vez, y si se mezclan voces fuertes desde la misma dirección el registro se dificulta, por lo que la expansión a earbuds y audífonos para sordera queda como tarea futura
Cómo funciona Target Speech Hearing
- Target Speech Hearing, de la Universidad de Washington, es un sistema de IA que permite al usuario elegir y escuchar solo la voz de una persona específica en audífonos con cancelación de ruido
- El usuario usa audífonos comerciales equipados con micrófonos, gira la cabeza hacia la persona que habla y presiona un botón
- Las ondas sonoras del hablante objetivo deben llegar simultáneamente a los micrófonos de ambos lados del headset
- La tolerancia permitida es de 16 grados
- Los audífonos envían la señal recopilada a una computadora embebida integrada, y el software de aprendizaje automático aprende el patrón de voz del hablante deseado
- Una vez completado el registro, el sistema reduce otros sonidos del entorno y reproduce en tiempo real solo la voz del hablante registrado
- Sigue rastreando la voz registrada aunque se muevan quien escucha y quien habla
- Si el hablante sigue hablando, aumentan los datos de entrenamiento y el sistema puede enfocarse mejor en el hablante objetivo
- El equipo de investigación presentó los resultados el 14 de mayo en la ACM CHI Conference on Human Factors in Computing Systems
- El código del dispositivo de prueba de concepto está publicado en LookOnceToHear
- Este sistema aún no es un producto comercial
Resultados del experimento y límites actuales
- En una prueba con 21 personas, los participantes calificaron la claridad del hablante registrado casi el doble de alta en promedio que el audio sin filtrar
- Esta investigación se basa en un trabajo anterior de semantic hearing, que eliminaba el resto de los sonidos del entorno cuando el usuario elegía una categoría de sonido que quería escuchar
- El sistema anterior funcionaba eligiendo una clase específica de sonido, como aves o voces
- TSH se enfoca no en una categoría de sonido, sino en un solo hablante registrado
- Actualmente, TSH solo puede registrar a un hablante a la vez
- Si hay otra voz fuerte desde la misma dirección que el hablante objetivo, no se puede registrar al hablante
- Si el usuario no queda satisfecho con la calidad de audio, puede volver a ejecutar el proceso de registro con el mismo hablante para mejorar la claridad
- El equipo de investigación busca ampliar el sistema en el futuro a earbuds y audífonos para sordera
1 comentarios
Opiniones en Hacker News
Si llegaran a reducirlos al tamaño de unos tapones pequeños para los oídos, los usaría incluso como alguien sin discapacidad auditiva.
Al menos según el diagnóstico, me dijeron que no tengo discapacidad auditiva, pero ya no sé si la forma de evaluar es mala, si yo soy normal o si los demás simplemente son mejores fingiendo que oyen bien.
Con amigos o en reuniones uno termina inevitablemente en restaurantes o bares ruidosos, y siempre me frustra no oír, pedir que repitan y que lo vuelvan a decir con la misma voz baja, para volver a no escucharlo.
Perderme chistes o comentarios al pasar es todavía peor, y termina siendo una situación tipo: “¿De qué se ríen? No lo escuché, ¿me lo pueden repetir unas tres veces?”
Pero todos los audiólogos a los que iba me decían que mi audición era normal, y al final conseguí cita con el especialista que supuestamente era el mejor de una gran área metropolitana, después de un año de espera.
Tras un día entero de pruebas, el especialista me dijo que tenía “buenas noticias, malas noticias, y noticias que eran buenas y malas a la vez”: la buena noticia era que mi audición era muy buena, al nivel de un niño de 5 años; la mala era que oía tan bien que no podía distinguir los sonidos.
No es que se me hubiera deteriorado la audición, sino que al cerebro se le había reducido la capacidad de separar sonidos; y la noticia buena y mala a la vez era que, como a todo el mundo, eventualmente se me irá degradando la audición, así que durante algunos años podré oír mejor en lugares públicos.
Creo que una de las razones por las que este problema se ha agravado es que los diseñadores de restaurantes y espacios públicos ya no se preocupan por el entorno sonoro.
La mayoría de los bares abiertos en los últimos 15 años tienen pisos de cemento, casi nada de absorción acústica, y parecen diseñados bajo la premisa de que, si no te zumban los oídos, no fue una salida divertida.
Literalmente no se puede mantener una conversación, así que ya no voy a esos lugares.
En vez de resolverlo con dispositivos, recomendaría verlo tal cual es y solucionarlo de la forma tradicional: “No escuché absolutamente nada, y ustedes probablemente tampoco. Esto es una estupidez, vámonos”.
Muchos de estos lugares están diseñados para que sufras si no estás gritando todo el tiempo o si no eres insensible a lo que te rodea.
No entiendo por qué la gente va ahí y encima paga; yo creo que no iría ni aunque me pagaran.
No quiero reemplazar con dispositivos de IA el acto de respetar los límites de los demás.
Puedes escuchar el headset manteniendo los oídos abiertos, y si necesitas oír con más claridad, como en una llamada en un lugar lleno de gente, puedes taparte los oídos con los dedos.
Eso crea dentro del oído un efecto parecido al de una caja acústica de parlante, hace que el sonido por conducción ósea sea más rico y además bloquea el ruido externo.
Si necesitas calidad completa de audífonos, te pones tapones para los oídos; además son pequeños y llaman menos la atención.
No es perfecto, pero me gusta que puedas pasar suavemente de “escuchar el headset con los oídos abiertos” a “bloquear el sonido y escuchar el headset con mucha claridad” usando solo los dedos o tapones.
Sería genial ponerles al lado un micrófono shotgun. Si es que así se llaman los micrófonos con un ángulo de captación estrecho.
https://www.flareaudio.com/pages/earhd
Si puedo ver los labios, aunque no sepa leer los labios, me ayuda a interpretar el habla con mucha más precisión.
Cada vez que investigaba esto, terminaba llegando a asociaciones con autismo o TDAH, y en 2008, antes de recibir un diagnóstico, medio que ignoré esa idea.
Ahora tengo diagnóstico de AuDHD.
Lo que los lectores de HN deberían saber es lo caros y malos que son los audífonos
Si buscan precios, incluso los audífonos básicos del tipo “hacer que el sonido sea más fuerte” son increíblemente caros
Lo peor es que, al intervenir el oído, es fácil perder la capacidad de “dirigir” la audición
Es decir, se vuelve difícil filtrar otras conversaciones o ruidos
Un buen subproducto de que Facebook haya invertido miles de millones de dólares en algo probablemente cercano a una pérdida de tiempo, intentando encontrar una AR práctica y masiva, es https://www.projectaria.com/glasses/
Es una plataforma relativamente barata para experimentar con comportamientos tipo AR y, como tiene seguimiento de la mirada, arreglo de micrófonos y cámara frontal, puede modificarse con bastante facilidad para convertirla en un micrófono direccionable
Mis audífonos Phonak cambian de programa automáticamente hasta cierto punto, y también se pueden ajustar en detalle con la app complementaria
Funcionan hasta cierto punto en entornos ruidosos y me permiten conversar, algo que habría sido imposible con audífonos de hace unos 10 años, así que lo agradezco muchísimo
Un par cuesta aproximadamente 2000 dólares y, por suerte, está cubierto por el sistema nacional de salud, así que pago solo 50 dólares más o menos una vez cada 5 años. Claro que también lo pago con impuestos
Espero que los avances de la “IA” permitan ir más allá de la simple amplificación y filtrado, y separar y reforzar o reconstruir voces en entornos ruidosos
Por otro lado, ojalá desaparezca la moda de poner la música cada vez más fuerte en cafés, restaurantes y bares. Es una pesadilla de accesibilidad, especialmente para personas con pérdida auditiva, pero también para los demás
0: https://www.socialstyrelsen.se/en/about-us/healthcare-for-vi...
1: https://www.vox.com/2018/4/18/17168504/restaurants-noise-lev...
Un pequeño cártel controla la oferta, lo que les da incentivos para maximizar ganancias en lugar de competir con mejor tecnología
(0) https://www.thebignewsletter.com/p/silencing-the-competition...
Así puedes conseguir los audífonos que mejor te queden, más baratos y confiables
De lo contrario, debido a la pérdida sensorial empieza a aparecer el problema de filtrado de atención mencionado antes
Cuanto más tiempo evites la corrección auditiva después de que tu audición empiece a deteriorarse, más complejos y caros tendrán que ser los audífonos para compensarlo de nuevo
Porque los audífonos caros hacen una aproximación torpe de lo que antes hacían el cerebro y la corteza auditiva, antes de la pérdida sensorial
Un momento, tengo que ir a agendar una prueba de audición
Cuando estaba viva, al intentar conversar con ella en reuniones familiares o lugares públicos, alguna vez pensé en hacer algo parecido
Supongo que son caros por la relación con empresas médicas y de salud, y porque el cumplimiento regulatorio eleva los costos
Por ejemplo, una misma pantalla puede costar varias veces más si tiene certificación para uso en instalaciones médicas
Mis audífonos Widex son excelentes. La calidad de sonido en situaciones normales es fantástica
Mi única queja real es que no son totalmente impermeables, así que tengo que planear un poco cuando salgo en días de lluvia
Como persona con discapacidad auditiva, una función así sería realmente como un regalo del cielo
Esta función debería integrarse en audífonos lo antes posible. Cállate, no, de hecho sigue hablando, que pago
Si se pudiera aislar la voz de cada persona, también se podría pasar a reconocimiento de voz para poner subtítulos a conversaciones reales. Sería útil cuando la audición empeore aún más o desaparezca por completo
Pero la latencia de ida y vuelta a la nube puede reducir mucho su utilidad o volverlo inútil, así que de verdad se necesita un dispositivo móvil capaz de procesarlo localmente
Están descontinuados, pero se pueden conseguir reacondicionados
Los lentes wearables son bastante prometedores para el caso de uso mencionado, porque evitan el volumen y la sensación de rudeza que da usar audífonos mientras hablas con alguien
Una forma más avanzada de esto creo que también ayudaría bastante con mi tinnitus
Cuando habla una sola persona, la escucho bien aunque hable bajo o esté lejos, pero si hablan varias personas o hay música, no escucho nada
Si estoy sentado en un bar ruidoso, es casi imposible oír lo que dicen salvo las dos personas más cercanas
En entornos normales, las conversaciones por lo general no son un problema
Por eso sería increíble tener una función que refuerce la voz de la persona a la que estoy mirando
Los Apple AirPods ya tienen ajustes de sonido que reaccionan al entorno y al modo, y también admiten refuerzo de una voz específica si pones el teléfono frente a la persona que habla
Si llegaran a admitir directamente dentro de los AirPods un refuerzo de voz direccional como el de este estudio, sería de gran ayuda para la interacción social en lugares ruidosos
Código: https://github.com/vb000/LookOnceToHear
Parece más probable que tenga éxito comercial para el uso opuesto
Imagínate poder silenciar solo a esa persona que habla demasiado fuerte con una voz molesta en una fiesta
En los conciertos, mucha gente usa tapones para no arruinarse los oídos; imagínate cambiarlos por audífonos in-ear que filtren todo excepto el concierto y las voces de tu familia y amigos
También ajustarían el volumen: si tu pareja habla, harían que solo esa voz sobresalga por encima de los demás sonidos, dejarían el ruido de la multitud para mantener el ambiente y eliminarían las conversaciones normales de la gente alrededor
No soy experto en machine learning ni en IA, pero entiendo que con la tecnología actual no es imposible
Habría limitaciones de batería y energía, pero en un concierto también tendría sentido usar audífonos con una banda que pase por detrás de la cabeza, los mantenga fijos y evite que se pierdan si se caen
Haría falta entrenar “tu voz”, pero si Alexa puede hacerlo en 10 segundos, una app de teléfono también podría
Si saliera algo para cines por menos de 200 euros, lo compraría ahora mismo y quizá volvería a ir al cine
¿La gente usa audífonos en las fiestas?
Si hubiera una forma de filtrar a esa persona, sin duda lo agradecería
Trabajé antes en Sonos, mucho antes del desastre actual con la actualización de la app y del lanzamiento de sus audífonos
Durante el primer intento cancelado de desarrollar un producto de audífonos, evaluamos una función conceptual parecida: dejar pasar selectivamente solo la voz de una persona mediante el chipset de cancelación activa de ruido
No recuerdo exactamente qué enfoque usaron los de DSP. Yo estaba más cerca del hardware de cancelación activa de ruido
Pero lo único que realmente podían separar era la voz del propio usuario, porque esa señal era más fuerte que todos los demás sonidos
Esto es realmente genial. Me da curiosidad qué otras cosas interesantes se podrán hacer con audífonos
Los chipsets de cancelación activa de ruido son increíblemente potentes, y creo que todavía falta mucho para aprovecharlos por completo
Todavía no he encontrado un producto adecuado
La cancelación de ruido del lado del oyente parece estar resuelta con aislamiento y cancelación activa de ruido, pero sería fantástico que apareciera una combinación de hardware y software que separe solo mi voz y bloquee el ruido para quien me escucha, haciendo posible el verdadero trabajo remoto
Los productos de Sonos en general tienen problemas con funciones básicas; por ejemplo, si se cae el Wi-Fi y vuelve, no logran reconectarse, y es especialmente grave si mientras tanto cambia el canal de Wi-Fi
La solución “técnica” es desenchufar para reiniciar, algo que ni siquiera se puede hacer de forma remota
Incluso cuando está conectado al Wi-Fi y quieres reiniciarlo porque Spotify Connect de Sonos tiene una cantidad absurda de bugs, no puedes hacerlo
Con algo como un ESP o un módulo similar de TI se puede mantener la conexión Wi-Fi y hacer que siempre se reconecte; ¿tan difícil es para los desarrolladores de firmware de Sonos hacer algo tan básico?
Sigue dependiendo de la condición de que no haya sonidos o voces competidores en la misma ubicación que el hablante objetivo
El código open source está en https://github.com/vb000/LookOnceToHear y el paper está en https://arxiv.org/abs/2405.06289
Así que quizá no sea algo totalmente lejano, como pasa con muchos artículos de divulgación científica
Si alguien logra hacerlo funcionar de forma independiente, me gustaría escuchar los resultados
Me cuesta oír a alguien hablar en una habitación concurrida, quizá porque mi mente intenta captar todos los sonidos, así que esto podría ayudarme mucho. Probablemente sea por TDAH
Sería increíble tener una forma de reducir mucho todos los sonidos excepto la voz de la persona con la que converso
Espero que solo sea cuestión de tiempo para que los propios AirPods puedan hacer esto algún día
Una función así sería una bendición para mí
En las pruebas de audición donde hay que escuchar pitidos suaves salgo bien, pero tengo muchas dificultades para procesar lo que dice la gente, sobre todo en entornos concurridos
A mi padre le pasa lo mismo
Es una función potencial que no sabía que necesitaba
En casa uso siempre audífonos con cancelación activa de ruido, y sería muy útil que dejaran pasar automáticamente solo la voz de mi pareja
Probablemente no la pareja, pero quién sabe…
Si la voz de tu pareja se escucha débil y no llega bien a tus oídos, probablemente sea por el aislamiento pasivo de los audífonos
O quizá simplemente la música que estás escuchando está tapando la voz
La cancelación activa de ruido solo bloquearía la voz de tu pareja si esa voz se mezclara con un tono y volumen similares al ruido de fondo, volviéndose algo como ruido blanco o ruido coloreado, y la cancelación activa pudiera suprimir todo ese conjunto