- A medida que el centro del software se aleja de pantallas y menús hacia conversación/delegación/ejecución en segundo plano, el objeto del diseño UX también deja de ser una pantalla fija y pasa a ser un sistema que interpreta la intención del usuario y actúa
- El chat no es una interfaz que reemplace todas las tareas: cuando el usuario sabe con claridad lo que quiere, conviene usar una GUI estructurada; solo cuando el objetivo es ambiguo resulta adecuado usar una interfaz conversacional
- La voz se percibe como una interacción social, por lo que mantener el contexto de la conversación es más importante que los comandos aislados; latencia/pérdida de contexto/recuperación de errores son problemas mucho más críticos que en las interfaces basadas en pantalla
- La IA agéntica puede trabajar sin una interfaz, pero para que el usuario confíe en ella debe mostrar el plan de acción, el progreso, el alcance de los permisos y el punto en que algo ya no puede revertirse; los patrones clave son visibilidad del plan/delegación gradual/intervención elegante
- Los tres paradigmas trasladan el centro de la UX desde el flujo de interacción hacia la intención y la relación de confianza, pero se mantiene el principio básico de que los usuarios quieren sentirse comprendidos, conservar el control y que se respete su tiempo y atención
La fragmentación de la UX centrada en la pantalla
- Durante los últimos 30 años, el diseño UX consistió en diseñar pantallas, menús, modales, botones, carruseles y flujos entre estados
- La metáfora de escritorio compuesta por ventanas, carpetas y archivos proporcionó un vocabulario común para crear productos digitales
- En lugar de desaparecer, este vocabulario se está fragmentando en varias formas de interacción que casi no se parecen entre sí
- Los usuarios le hablan al software, delegan tareas y a veces solo revisan resultados que ya fueron procesados en segundo plano
- La pantalla seguirá existiendo, pero ya no será la superficie que representa el contrato básico entre la persona y el producto
- Los tres paradigmas que hoy están reconfigurando la UX son el chat, la voz y la IA agéntica, y cada uno exige un contrato de interacción distinto
El chat no es una interfaz universal
- En 2022, no mucha gente había ingresado comandos en lenguaje natural en interfaces de productos, pero para 2025 el 73% de las empresas usará algún tipo de interfaz conversacional en sus interacciones con clientes
- El campo de entrada de texto emergió como un elemento central de UI, pero el chat por sí solo no garantiza una buena UX
- Conversational Design, de Erika Hall, distingue que la conversación solo es adecuada cuando el sistema y el usuario deben negociar significado
- Si el usuario ya sabe lo que quiere hacer, como
agregar al carrito,filtrar por preciooenviar formulario, una interfaz estructurada es más rápida, más precisa y menos agotadora - La conversación funciona cuando el usuario está explorando, su objetivo no está claro y le resulta difícil expresar lo que necesita mediante clics o formularios
- Si el usuario ya sabe lo que quiere hacer, como
- Los productos que aplican esto no reemplazan todo el producto solo con chat, sino que usan interfaces híbridas
- Notion AI no reemplaza los documentos, sino que funciona en una barra lateral junto a ellos
- La paleta de comandos de Linear gestiona la creación de tickets que el usuario ya conoce, mientras que la IA maneja preguntas ambiguas como “¿qué está bloqueando al equipo móvil?”
- GitHub Copilot no reemplaza el IDE por una ventana de chat, sino que ofrece sugerencias inline dentro del entorno de trabajo existente
- El criterio central es usar una GUI estructurada cuando la intención del usuario es clara, y conversación cuando es ambigua
- Tratar el chat como una herramienta universal para resolver todos los problemas de interfaz genera costos de interacción innecesarios
La claridad de la intención determina la interfaz
- La patente US20260065349A1, sobre un sistema de recomendación basado en intención multinivel, divide las solicitudes en dos niveles
- La microintención es una solicitud de alta confianza dentro de una misma categoría
- La macrointención es un objetivo exploratorio que cruza varias categorías
- Qué interfaz ofrecer no debería decidirse según si el producto está centrado en chat o en GUI, sino según qué tan clara es la intención del usuario
- En lugar de mejorar la caja de búsqueda, Perplexity genera para cada pregunta una página de respuesta armada en tiempo real con resumen, citas de fuentes, preguntas de seguimiento y datos estructurados
- En investigación, la forma en que el usuario dice lo que quiere y se arma al instante una interfaz adecuada para ese propósito se denomina Generative UI
- En lugar de crear manualmente todos los estados de pantalla, los diseñadores pasan a diseñar sistemas y reglas que generan el estado adecuado
- Se desplazan de escribir frases terminadas a crear la gramática que generará esas frases
Diseño de confianza en interfaces generativas
- Si, en lugar de mostrar el resultado generado de una sola vez, el texto aparece secuencialmente, el usuario percibe que el sistema está trabajando y no que se congeló
- Un botón de detener siempre visible durante la generación da la sensación de que el usuario puede intervenir en un proceso opaco
- Las citas de fuentes clicables convierten al chatbot de un oráculo que declara la respuesta correcta en un colaborador que revisa la evidencia junto con el usuario
- Pequeños diseños de interacción como streaming, botón de detener e indicación de fuentes determinan la confianza y la posibilidad de adopción de todo el sistema
La voz no es un canal de comandos, sino un canal social
- Las interfaces de voz se presentaron desde la era de los smart speakers como el núcleo de la computación ambiental, pero la experiencia real no cumplió las expectativas
- Desde fines de 2025, el centro del cambio empezó a desplazarse no hacia la pantalla, sino hacia el oído
- Siri AI, anunciada en junio de 2026, se presentó no como un asistente de voz añadido al teléfono, sino como una capa conversacional que atraviesa dispositivos
- Una pregunta iniciada en el iPhone puede continuar en el iPad y conservar el contexto de la conversación
- Reconoce lo que se está viendo en pantalla y aprovecha el contexto personal de emails, calendario y fotos
- Las solicitudes sensibles se procesan mediante inferencia on-device que protege la privacidad, y AirPods se expanden de accesorio a interfaz principal
- Wired for Speech, de Clifford Nass y Scott Brave, analiza que las personas perciben la voz no como un canal de comandos, sino como un canal de interacción social
- Al oír una voz se activa un sistema de cognición social que espera reciprocidad, contexto y relación
- El Siri tradicional se apartaba de esas expectativas porque seguía un modelo transaccional: dar una orden, recibir un resultado y terminar la relación
- El nuevo modelo apunta a una estructura relacional que mantiene el contexto a través de conversaciones, dispositivos y tiempo
Las condiciones de fracaso que mostraron Humane AI Pin y Rabbit R1
- Humane AI Pin fue un wearable centrado en voz y sin pantalla en el que se invirtieron 240 millones de dólares; se lanzó en abril de 2024 por 699 dólares, pero fue descontinuado antes de cumplir un año
- Designing Voice User Interfaces, de Cathy Pearl, identifica la latencia y la recuperación de errores como variables clave que determinan la experiencia de voz
- AI Pin tardaba entre 2 y 5 segundos incluso en preguntas cotidianas, y en una interfaz de voz hasta 2 segundos se sienten demasiado
- El estado se reiniciaba en cada interacción, por lo que no ofrecía el contexto persistente que es condición básica de una conversación
- Rabbit R1 sufrió los mismos problemas al momento de su lanzamiento, pero mejoró no por un cambio de hardware, sino porque RabbitOS 2, a fines de 2025, reflejó los requisitos de la interacción por voz
- La UX de voz es mucho más sensible a la latencia y a la pérdida de contexto que la pantalla
- En pantalla, el usuario puede recorrer visualmente los elementos cercanos y volver a ubicarse
- En la voz no hay puntos de referencia visuales que ayuden a la memoria espacial, así que si se corta el flujo de la conversación, recuperarlo es difícil
- También es más alto el nivel de infraestructura necesario para respuestas rápidas, mantenimiento del contexto y recuperación natural de errores
Nuevos elementos de diseño para el oído y el cuerpo
- El audio espacial aparece como una capa de feedback que reemplaza a la pantalla
- El análisis de escenas de audio en tiempo real de AirPods permite distinguir señales del ruido ambiente y usar el sonido mismo como medio para comunicar estados
- La vibración háptica de los wearables permite confirmar que una acción se completó sin mirar una pantalla
- El paradigma de voz no trata tanto de una función para conversar con el teléfono como de diseñar interacciones que ocurren mientras se hacen otras cosas, como cocinar, caminar o manejar
- La atención del usuario solo se dirige parcialmente al producto
- El contexto no está dentro de la pantalla, sino en la actividad corporal y el entorno
- Es difícil abordarlo solo con modelos de diseño centrados en layout de pantalla
La IA agéntica actúa sin interfaz
- La IA agéntica va más allá de responder preguntas: usa herramientas, navega la web, escribe código, envía emails y presenta formularios mediante una serie de acciones
- Entre 2024 y 2025 pasó de demostraciones de investigación a productos reales
- OpenAI Operator realiza reservas en restaurantes
- Anthropic Claude manipula navegadores web en nombre del usuario mediante la computer use API
- Salesforce Agentforce gestiona casos de atención al cliente de punta a punta sin intervención humana
- Gartner proyecta que la proporción de aplicaciones empresariales integradas con agentes de IA especializados en tareas pasará de menos del 5% en 2025 al 40% a fines de 2026
- Los agentes no necesitan una interfaz para ejecutar tareas, pero para que el usuario confíe en ellos se necesita una interfaz visible que permita comprender y controlar sus acciones
Aumentar al mismo tiempo la automatización y el control humano
- Human-Centered AI, de Ben Shneiderman, considera que sustituir el juicio humano por agentes autónomos es técnicamente prematuro y éticamente riesgoso
- La alternativa no es reducir la automatización para asegurar control humano ni eliminar el control humano para aumentar la automatización, sino ofrecer alto control humano y alta automatización al mismo tiempo
- En lugar de minimizar el rol humano, hay que diseñar la supervisión para que sea comprensible, accesible y de baja carga
- El objetivo de la UX agéntica no es elegir entre autonomía y control, sino construir desde el inicio una autonomía controlable
La paradoja de la transparencia de los agentes
- Un agente que actúa en silencio y sin explicación es eficiente, pero puede generar miedo
- Un agente que explica continuamente cada acción puede ser confiable, pero también puede agotar al usuario con logs del sistema
- Un diseño adecuado debe mostrar lo suficiente para que el usuario sienta control, pero limitar la información para que no se vea abrumado por la actividad interna del sistema
- Los patrones comunes en productos de agentes ya desplegados son visibilidad del plan, delegación gradual e intervención elegante
Visibilidad del plan
- Antes de empezar a actuar, el agente debe mostrarle al usuario qué pretende hacer
- No debe usar lenguaje de sistema como
ejecutaré POST /api/calendar/event, sino expresiones comprensibles para personas, como “Voy a reservar una mesa a las 7 p. m. en el restaurante que mencionaste. ¿Primero reviso si hay lugares disponibles?” - La vista previa antes de la ejecución se convierte en el punto en el que el usuario decide si confiará en el sistema
- La investigación sobre aprendizaje por refuerzo multiagente también señala que, para que varios agentes mantengan la coherencia del sistema, deben compartir sus planes antes de actuar
Delegación gradual
- No se le debe otorgar toda la autonomía al agente desde el principio, sino ampliarla en la medida en que gane confianza
- El agente de Intercom empieza por tareas simples y de alta certeza, y pide aprobación antes de realizar acciones de mayor riesgo
- El historial de aprobaciones del usuario funciona como modelo de confianza, y mientras el agente demuestra confiabilidad obtiene permisos de acción más amplios
- El humano permanece dentro del loop no ejecutando directamente la tarea, sino definiendo los límites que el agente no debe cruzar
Intervención elegante y acciones irreversibles
- El usuario debe poder pedir que se detenga el flujo de trabajo del agente y recuperar el control en cualquier momento
- Como el agente puede realizar acciones difíciles de revertir, como enviar un email o reservar un vuelo, una simple función de deshacer no alcanza
- En lugar de intentar recuperar después de la acción, el sistema debe marcar claramente el punto irreversible antes de cruzarlo y pedir aprobación
La explicabilidad se convierte en el producto
- Cuando un sistema de IA clínica mostraba solo recomendaciones sin evidencia, el personal médico no lo usaba
- La adopción llegó después de cambiar la interfaz para mostrar una sola recomendación a la vez, ofrecer un panel de evidencia y permitir ignorarla con un clic
- El modelo de IA y los resultados recomendados no cambiaron; solo cambió la interfaz
- En la UX agéntica, la explicabilidad no es una función añadida para cumplir regulaciones, sino una experiencia central del producto que hace que el usuario lo acepte
De estados de pantalla a comportamiento del sistema
- Los diseñadores pasan a diseñar no solo los estados visibles de la interfaz, sino también cómo se comporta el sistema cuando el usuario no está mirando
- La pregunta también pasa de “¿qué ve el usuario?” a “¿qué necesita poder creer el usuario para confiar en este sistema?”
- El comportamiento, la responsabilidad y los juicios sobre intención y confianza se vuelven más importantes que la composición visual
De la interacción a la intención
- The Design of Everyday Things, de Don Norman, sostiene que el diseño fracasa cuando el modelo de funcionamiento del sistema en el que cree el usuario difiere de su funcionamiento real
- La UX tradicional asumía que el usuario ya había decidido qué acción realizar antes de llegar a la interfaz
- Existe un menú porque el usuario sabe qué menú abrir
- Existe un formulario porque el usuario sabe qué campos completar
- En realidad, lo que el usuario trae no es una intención concreta, sino un objetivo más abstracto
- La suposición que ignora esta diferencia nunca fue del todo exacta, pero durante 30 años fue lo bastante útil para construir UX basada en pantallas
- Las nuevas interfaces separan objetivo e intención
- El chat permite que el usuario exprese un objetivo en lenguaje natural y que el sistema concrete la intención
- La voz permite expresar objetivos incluso en situaciones en las que no se pueden usar las manos
- El agente recibe un objetivo una vez y ejecuta un plan de varios pasos para cumplirlo
- El cambio común que une a los tres paradigmas es que el principal objeto de diseño pasa a ser la intención, no la interacción
Los diseñadores diseñan relaciones de confianza
- El rol del diseñador se desplaza de arquitecto de flujos de interacción a diseñador de relaciones de confianza entre las personas y los sistemas que actúan en su nombre
- Los nuevos objetos a tratar incluyen:
- Cuánto trabajo delegará el usuario al sistema
- Cómo interpretará el sistema una solicitud ambigua
- Cómo confirmará la diferencia entre lo que el usuario dijo y lo que realmente quiere
- Este trabajo requiere nuevas herramientas y métodos de evaluación
- La investigación en interacción humano-IA propone evaluar no solo si se completó la tarea, sino si el usuario sintió que recibió información suficiente y mantuvo el control
- Al crear sistemas que toman decisiones en nombre del usuario, también se necesitan criterios éticos sobre qué decisiones pueden delegarse
Los desafíos para diseñadores de chat/voz/agentes
- En interfaces de chat, lo más difícil es decidir dónde no se debe usar chat, más que dónde aplicarlo
- Los productos exitosos no son los que tienen la IA más potente, sino los que distinguen con precisión qué tareas corresponden a conversación y cuáles a formularios
- Esta distinción no es de ingeniería, sino una decisión de diseño
- En interfaces de voz hay que diseñar elementos fuera de la pantalla
- Como el tiempo de respuesta importa más que el layout, hay que diseñar el tiempo
- Hay que diseñar el contexto considerando qué recuerda el usuario
- Hay que diseñar cómo recuperar la conversación cuando el sistema no entendió
- El feedback de audio, la háptica, las señales espaciales y las estrategias de recuperación conversacional se vuelven nuevas herramientas
- Los sistemas agénticos son el área con menos patrones establecidos y mayor riesgo
- Las decisiones sobre transparencia, control de intervención y delegación gradual determinan si el usuario se sentirá empoderado o vigilado
- También influyen, más allá de productos individuales, en cuánta autonomía estará dispuesta a otorgarle la gente a la IA en múltiples industrias
- Si un producto soporta los tres paradigmas juntos, además debe resolver el problema de coordinación de conectar interfaces con contratos de interacción distintos en una experiencia coherente
Los principios de UX que no cambian
- Aunque aparezcan nuevas interfaces, los usuarios siguen queriendo sentir que se los entiende
- Temen perder el control, evitan productos opacos y confían en productos honestos
- Los productos que hacen que el usuario se sienta incompetente o lento seguirán siendo ignorados
- El rol de un buen diseñador UX siempre fue hacer que el usuario se sienta competente y comprendido
- El chat, la voz y los agentes son nuevos instrumentos para lograrlo, y los criterios de claridad/confianza/disfrute/respeto por el tiempo y la atención no cambian
Lecturas adicionales
- Erika Hall — Conversational Design
- Cathy Pearl — Designing Voice User Interfaces
- Clifford Nass / Scott Brave — Wired for Speech
- Ben Shneiderman — Human-Centered AI
- Don Norman — The Design of Everyday Things
Aún no hay comentarios.