1 puntos por GN⁺ 2024-05-30 | 1 comentarios | Compartir por WhatsApp
  • Un equipo de investigación de la Universidad de Washington desarrolló Target Speech Hearing, un sistema que registra a la persona que habla con solo que el usuario la mire durante 3 a 5 segundos y permite escuchar esa voz en tiempo real incluso en entornos ruidosos
  • Los micrófonos de ambos lados de unos audífonos comerciales funcionan junto con una computadora embebida integrada, y cuando el usuario presiona un botón y apunta hacia la persona que habla, el software de aprendizaje automático aprende el patrón de voz
  • Tras el registro, el sistema sigue rastreando la voz aunque se muevan quien escucha o quien habla; mientras más hable la persona, más datos de entrenamiento se acumulan y mejor se vuelve el rendimiento para enfocarse en el hablante objetivo
  • En una prueba con 21 personas, los participantes calificaron en promedio la claridad de la voz del hablante registrado casi el doble de alta que el audio sin filtrar
  • Por ahora solo se puede registrar a una persona a la vez, y si se mezclan voces fuertes desde la misma dirección el registro se dificulta, por lo que la expansión a earbuds y audífonos para sordera queda como tarea futura

Cómo funciona Target Speech Hearing

  • Target Speech Hearing, de la Universidad de Washington, es un sistema de IA que permite al usuario elegir y escuchar solo la voz de una persona específica en audífonos con cancelación de ruido
  • El usuario usa audífonos comerciales equipados con micrófonos, gira la cabeza hacia la persona que habla y presiona un botón
    • Las ondas sonoras del hablante objetivo deben llegar simultáneamente a los micrófonos de ambos lados del headset
    • La tolerancia permitida es de 16 grados
  • Los audífonos envían la señal recopilada a una computadora embebida integrada, y el software de aprendizaje automático aprende el patrón de voz del hablante deseado
  • Una vez completado el registro, el sistema reduce otros sonidos del entorno y reproduce en tiempo real solo la voz del hablante registrado
    • Sigue rastreando la voz registrada aunque se muevan quien escucha y quien habla
    • Si el hablante sigue hablando, aumentan los datos de entrenamiento y el sistema puede enfocarse mejor en el hablante objetivo
  • El equipo de investigación presentó los resultados el 14 de mayo en la ACM CHI Conference on Human Factors in Computing Systems
  • El código del dispositivo de prueba de concepto está publicado en LookOnceToHear
  • Este sistema aún no es un producto comercial

Resultados del experimento y límites actuales

  • En una prueba con 21 personas, los participantes calificaron la claridad del hablante registrado casi el doble de alta en promedio que el audio sin filtrar
  • Esta investigación se basa en un trabajo anterior de semantic hearing, que eliminaba el resto de los sonidos del entorno cuando el usuario elegía una categoría de sonido que quería escuchar
    • El sistema anterior funcionaba eligiendo una clase específica de sonido, como aves o voces
    • TSH se enfoca no en una categoría de sonido, sino en un solo hablante registrado
  • Actualmente, TSH solo puede registrar a un hablante a la vez
  • Si hay otra voz fuerte desde la misma dirección que el hablante objetivo, no se puede registrar al hablante
  • Si el usuario no queda satisfecho con la calidad de audio, puede volver a ejecutar el proceso de registro con el mismo hablante para mejorar la claridad
  • El equipo de investigación busca ampliar el sistema en el futuro a earbuds y audífonos para sordera

1 comentarios

 
GN⁺ 2024-05-30
Opiniones en Hacker News
  • Si llegaran a reducirlos al tamaño de unos tapones pequeños para los oídos, los usaría incluso como alguien sin discapacidad auditiva.
    Al menos según el diagnóstico, me dijeron que no tengo discapacidad auditiva, pero ya no sé si la forma de evaluar es mala, si yo soy normal o si los demás simplemente son mejores fingiendo que oyen bien.
    Con amigos o en reuniones uno termina inevitablemente en restaurantes o bares ruidosos, y siempre me frustra no oír, pedir que repitan y que lo vuelvan a decir con la misma voz baja, para volver a no escucharlo.
    Perderme chistes o comentarios al pasar es todavía peor, y termina siendo una situación tipo: “¿De qué se ríen? No lo escuché, ¿me lo pueden repetir unas tres veces?”

    • En lugares con mucha gente no entendía a nadie, y pensé que al llegar a la mediana edad se me estaba deteriorando la audición.
      Pero todos los audiólogos a los que iba me decían que mi audición era normal, y al final conseguí cita con el especialista que supuestamente era el mejor de una gran área metropolitana, después de un año de espera.
      Tras un día entero de pruebas, el especialista me dijo que tenía “buenas noticias, malas noticias, y noticias que eran buenas y malas a la vez”: la buena noticia era que mi audición era muy buena, al nivel de un niño de 5 años; la mala era que oía tan bien que no podía distinguir los sonidos.
      No es que se me hubiera deteriorado la audición, sino que al cerebro se le había reducido la capacidad de separar sonidos; y la noticia buena y mala a la vez era que, como a todo el mundo, eventualmente se me irá degradando la audición, así que durante algunos años podré oír mejor en lugares públicos.
      Creo que una de las razones por las que este problema se ha agravado es que los diseñadores de restaurantes y espacios públicos ya no se preocupan por el entorno sonoro.
      La mayoría de los bares abiertos en los últimos 15 años tienen pisos de cemento, casi nada de absorción acústica, y parecen diseñados bajo la premisa de que, si no te zumban los oídos, no fue una salida divertida.
      Literalmente no se puede mantener una conversación, así que ya no voy a esos lugares.
    • Esto no es un problema individual. Es una decisión colectiva de conversar en entornos donde apenas podemos oírnos.
      En vez de resolverlo con dispositivos, recomendaría verlo tal cual es y solucionarlo de la forma tradicional: “No escuché absolutamente nada, y ustedes probablemente tampoco. Esto es una estupidez, vámonos”.
      Muchos de estos lugares están diseñados para que sufras si no estás gritando todo el tiempo o si no eres insensible a lo que te rodea.
      No entiendo por qué la gente va ahí y encima paga; yo creo que no iría ni aunque me pagaran.
      No quiero reemplazar con dispositivos de IA el acto de respetar los límites de los demás.
    • Terminé usando muchísimo audífonos de conducción ósea, y me impresiona lo flexibles que son en estas situaciones.
      Puedes escuchar el headset manteniendo los oídos abiertos, y si necesitas oír con más claridad, como en una llamada en un lugar lleno de gente, puedes taparte los oídos con los dedos.
      Eso crea dentro del oído un efecto parecido al de una caja acústica de parlante, hace que el sonido por conducción ósea sea más rico y además bloquea el ruido externo.
      Si necesitas calidad completa de audífonos, te pones tapones para los oídos; además son pequeños y llaman menos la atención.
      No es perfecto, pero me gusta que puedas pasar suavemente de “escuchar el headset con los oídos abiertos” a “bloquear el sonido y escuchar el headset con mucha claridad” usando solo los dedos o tapones.
      Sería genial ponerles al lado un micrófono shotgun. Si es que así se llaman los micrófonos con un ángulo de captación estrecho.
    • Existen estos tapones auditivos direccionales pasivos.
      https://www.flareaudio.com/pages/earhd
    • Tengo trastorno del procesamiento auditivo, así que mi audición en sí es realmente buena, pero siento que el sonido de alguien hablándome recibe una prioridad de interpretación mucho más baja que cualquier ruido del entorno.
      Si puedo ver los labios, aunque no sepa leer los labios, me ayuda a interpretar el habla con mucha más precisión.
      Cada vez que investigaba esto, terminaba llegando a asociaciones con autismo o TDAH, y en 2008, antes de recibir un diagnóstico, medio que ignoré esa idea.
      Ahora tengo diagnóstico de AuDHD.
  • Lo que los lectores de HN deberían saber es lo caros y malos que son los audífonos
    Si buscan precios, incluso los audífonos básicos del tipo “hacer que el sonido sea más fuerte” son increíblemente caros
    Lo peor es que, al intervenir el oído, es fácil perder la capacidad de “dirigir” la audición
    Es decir, se vuelve difícil filtrar otras conversaciones o ruidos
    Un buen subproducto de que Facebook haya invertido miles de millones de dólares en algo probablemente cercano a una pérdida de tiempo, intentando encontrar una AR práctica y masiva, es https://www.projectaria.com/glasses/
    Es una plataforma relativamente barata para experimentar con comportamientos tipo AR y, como tiene seguimiento de la mirada, arreglo de micrófonos y cámara frontal, puede modificarse con bastante facilidad para convertirla en un micrófono direccionable

    • Los audífonos modernos son bastante geniales. En un formato diminuto meten una cantidad sorprendente de funciones, y aun usando Bluetooth la batería dura una semana
      Mis audífonos Phonak cambian de programa automáticamente hasta cierto punto, y también se pueden ajustar en detalle con la app complementaria
      Funcionan hasta cierto punto en entornos ruidosos y me permiten conversar, algo que habría sido imposible con audífonos de hace unos 10 años, así que lo agradezco muchísimo
      Un par cuesta aproximadamente 2000 dólares y, por suerte, está cubierto por el sistema nacional de salud, así que pago solo 50 dólares más o menos una vez cada 5 años. Claro que también lo pago con impuestos
      Espero que los avances de la “IA” permitan ir más allá de la simple amplificación y filtrado, y separar y reforzar o reconstruir voces en entornos ruidosos
      Por otro lado, ojalá desaparezca la moda de poner la música cada vez más fuerte en cafés, restaurantes y bares. Es una pesadilla de accesibilidad, especialmente para personas con pérdida auditiva, pero también para los demás
      0: https://www.socialstyrelsen.se/en/about-us/healthcare-for-vi...
      1: https://www.vox.com/2018/4/18/17168504/restaurants-noise-lev...
    • Que sean caros no es un problema tecnológico, sino un problema antimonopolio
      Un pequeño cártel controla la oferta, lo que les da incentivos para maximizar ganancias en lugar de competir con mejor tecnología
      (0) https://www.thebignewsletter.com/p/silencing-the-competition...
    • El único consejo sobre los audífonos es que, si los necesitas, te diagnostiques e intervengas temprano
      Así puedes conseguir los audífonos que mejor te queden, más baratos y confiables
      De lo contrario, debido a la pérdida sensorial empieza a aparecer el problema de filtrado de atención mencionado antes
      Cuanto más tiempo evites la corrección auditiva después de que tu audición empiece a deteriorarse, más complejos y caros tendrán que ser los audífonos para compensarlo de nuevo
      Porque los audífonos caros hacen una aproximación torpe de lo que antes hacían el cerebro y la corteza auditiva, antes de la pérdida sensorial
      Un momento, tengo que ir a agendar una prueba de audición
    • Mi abuela también tenía todo eso
      Cuando estaba viva, al intentar conversar con ella en reuniones familiares o lugares públicos, alguna vez pensé en hacer algo parecido
      Supongo que son caros por la relación con empresas médicas y de salud, y porque el cumplimiento regulatorio eleva los costos
      Por ejemplo, una misma pantalla puede costar varias veces más si tiene certificación para uso en instalaciones médicas
    • Es cierto que son caros. Mis audífonos costaron unos 2500 dólares canadienses por lado, pero que los audífonos sean malos no coincide con mi experiencia
      Mis audífonos Widex son excelentes. La calidad de sonido en situaciones normales es fantástica
      Mi única queja real es que no son totalmente impermeables, así que tengo que planear un poco cuando salgo en días de lluvia
  • Como persona con discapacidad auditiva, una función así sería realmente como un regalo del cielo
    Esta función debería integrarse en audífonos lo antes posible. Cállate, no, de hecho sigue hablando, que pago

    • Si vives lo suficiente, la mayoría de nosotros terminaremos llegando a donde estás tú ahora
      Si se pudiera aislar la voz de cada persona, también se podría pasar a reconocimiento de voz para poner subtítulos a conversaciones reales. Sería útil cuando la audición empeore aún más o desaparezca por completo
      Pero la latencia de ida y vuelta a la nube puede reducir mucho su utilidad o volverlo inútil, así que de verdad se necesita un dispositivo móvil capaz de procesarlo localmente
    • Yo también tengo hipoacusia neurosensorial, y los Bose Hearphones tienen una función parecida, como cancelación de ruido direccional, que ayuda bastante
      Están descontinuados, pero se pueden conseguir reacondicionados
    • Vale la pena ver lo que está haciendo Luxottica en este campo
      Los lentes wearables son bastante prometedores para el caso de uso mencionado, porque evitan el volumen y la sensación de rudeza que da usar audífonos mientras hablas con alguien

      https://www.cnet.com/health/medical/what-did-you-say-these-e...

  • Una forma más avanzada de esto creo que también ayudaría bastante con mi tinnitus
    Cuando habla una sola persona, la escucho bien aunque hable bajo o esté lejos, pero si hablan varias personas o hay música, no escucho nada

    • A mí me pasa algo parecido. Tengo un poco de tinnitus como ruido de radio de baja frecuencia, y en lugares ruidosos con ruido de fondo y muchas conversaciones se me dificulta conversar
      Si estoy sentado en un bar ruidoso, es casi imposible oír lo que dicen salvo las dos personas más cercanas
      En entornos normales, las conversaciones por lo general no son un problema
      Por eso sería increíble tener una función que refuerce la voz de la persona a la que estoy mirando
      Los Apple AirPods ya tienen ajustes de sonido que reaccionan al entorno y al modo, y también admiten refuerzo de una voz específica si pones el teléfono frente a la persona que habla
      Si llegaran a admitir directamente dentro de los AirPods un refuerzo de voz direccional como el de este estudio, sería de gran ayuda para la interacción social en lugares ruidosos
  • Código: https://github.com/vb000/LookOnceToHear

  • Parece más probable que tenga éxito comercial para el uso opuesto
    Imagínate poder silenciar solo a esa persona que habla demasiado fuerte con una voz molesta en una fiesta

    • Si pensamos en algo que realmente se pueda vender en masa, quizá haya que ver “fiesta” a una escala más grande
      En los conciertos, mucha gente usa tapones para no arruinarse los oídos; imagínate cambiarlos por audífonos in-ear que filtren todo excepto el concierto y las voces de tu familia y amigos
      También ajustarían el volumen: si tu pareja habla, harían que solo esa voz sobresalga por encima de los demás sonidos, dejarían el ruido de la multitud para mantener el ambiente y eliminarían las conversaciones normales de la gente alrededor
      No soy experto en machine learning ni en IA, pero entiendo que con la tecnología actual no es imposible
      Habría limitaciones de batería y energía, pero en un concierto también tendría sentido usar audífonos con una banda que pase por detrás de la cabeza, los mantenga fijos y evite que se pierdan si se caen
      Haría falta entrenar “tu voz”, pero si Alexa puede hacerlo en 10 segundos, una app de teléfono también podría
      Si saliera algo para cines por menos de 200 euros, lo compraría ahora mismo y quizá volvería a ir al cine
    • La función de silenciar personas de forma selectiva apareció en varios episodios de Black Mirror
    • Creo que este es el momento más fuerte de “ah, creo que ya estoy viejo” que he tenido
      ¿La gente usa audífonos en las fiestas?
    • Si hay alguien que se ríe tan fuerte que duele aunque esté a 15 pies de distancia, y se ríe tres veces por minuto sin parar, de verdad te vuelve loco
      Si hubiera una forma de filtrar a esa persona, sin duda lo agradecería
    • El uso criminal para escuchar a escondidas conversaciones ajenas también podría ser bastante útil
  • Trabajé antes en Sonos, mucho antes del desastre actual con la actualización de la app y del lanzamiento de sus audífonos
    Durante el primer intento cancelado de desarrollar un producto de audífonos, evaluamos una función conceptual parecida: dejar pasar selectivamente solo la voz de una persona mediante el chipset de cancelación activa de ruido
    No recuerdo exactamente qué enfoque usaron los de DSP. Yo estaba más cerca del hardware de cancelación activa de ruido
    Pero lo único que realmente podían separar era la voz del propio usuario, porque esa señal era más fuerte que todos los demás sonidos
    Esto es realmente genial. Me da curiosidad qué otras cosas interesantes se podrán hacer con audífonos
    Los chipsets de cancelación activa de ruido son increíblemente potentes, y creo que todavía falta mucho para aprovecharlos por completo

    • Más o menos una vez al año pierdo un día buscando earbuds que permitan trabajar en entornos ruidosos sin que ese ruido se transmita a una llamada o videoconferencia
      Todavía no he encontrado un producto adecuado
      La cancelación de ruido del lado del oyente parece estar resuelta con aislamiento y cancelación activa de ruido, pero sería fantástico que apareciera una combinación de hardware y software que separe solo mi voz y bloquee el ruido para quien me escucha, haciendo posible el verdadero trabajo remoto
    • Definitivamente no quiero audífonos médicos de Sonos
      Los productos de Sonos en general tienen problemas con funciones básicas; por ejemplo, si se cae el Wi-Fi y vuelve, no logran reconectarse, y es especialmente grave si mientras tanto cambia el canal de Wi-Fi
      La solución “técnica” es desenchufar para reiniciar, algo que ni siquiera se puede hacer de forma remota
      Incluso cuando está conectado al Wi-Fi y quieres reiniciarlo porque Spotify Connect de Sonos tiene una cantidad absurda de bugs, no puedes hacerlo
      Con algo como un ESP o un módulo similar de TI se puede mantener la conexión Wi-Fi y hacer que siempre se reconecte; ¿tan difícil es para los desarrolladores de firmware de Sonos hacer algo tan básico?
    • Al leer el paper, nada cambió
      Sigue dependiendo de la condición de que no haya sonidos o voces competidores en la misma ubicación que el hablante objetivo
  • El código open source está en https://github.com/vb000/LookOnceToHear y el paper está en https://arxiv.org/abs/2405.06289
    Así que quizá no sea algo totalmente lejano, como pasa con muchos artículos de divulgación científica
    Si alguien logra hacerlo funcionar de forma independiente, me gustaría escuchar los resultados

  • Me cuesta oír a alguien hablar en una habitación concurrida, quizá porque mi mente intenta captar todos los sonidos, así que esto podría ayudarme mucho. Probablemente sea por TDAH
    Sería increíble tener una forma de reducir mucho todos los sonidos excepto la voz de la persona con la que converso

    • Si saliera en un formato poco llamativo, como los AirPods, estaría dispuesto a pagar mucho dinero
      Espero que solo sea cuestión de tiempo para que los propios AirPods puedan hacer esto algún día
    • Tengo el mismo problema. Mi audición está bien, pero conversar con gente en un club o café lleno es casi imposible
      Una función así sería una bendición para mí
    • No sé mucho sobre TDAH o autismo, pero creo que tengo cierto grado de rasgos autistas y este problema es muy grave
      En las pruebas de audición donde hay que escuchar pitidos suaves salgo bien, pero tengo muchas dificultades para procesar lo que dice la gente, sobre todo en entornos concurridos
      A mi padre le pasa lo mismo
  • Es una función potencial que no sabía que necesitaba
    En casa uso siempre audífonos con cancelación activa de ruido, y sería muy útil que dejaran pasar automáticamente solo la voz de mi pareja

    • Lo contrario también estaría bien: una función para bajar el volumen solo de fuentes específicas
      Probablemente no la pareja, pero quién sabe…
    • La cancelación activa de ruido no bloquea las voces
      Si la voz de tu pareja se escucha débil y no llega bien a tus oídos, probablemente sea por el aislamiento pasivo de los audífonos
      O quizá simplemente la música que estás escuchando está tapando la voz
      La cancelación activa de ruido solo bloquearía la voz de tu pareja si esa voz se mezclara con un tono y volumen similares al ruido de fondo, volviéndose algo como ruido blanco o ruido coloreado, y la cancelación activa pudiera suprimir todo ese conjunto
    • Siento que usar demasiado la cancelación activa de ruido tarde o temprano, o algún día, traerá efectos secundarios físicos o fisiológicos