1 puntos por catch88 7 시간 전 | Aún no hay comentarios. | Compartir por WhatsApp

Como no me gustaba tener abierta todo el día una pestaña de Telegram para hablar con un agente local (Hermes/OpenClaw), hice un avatar para ocupar ese lugar. Son dos ventanas tipo videollamada que permanecen en el monitor (avatar + chat), y hacen que las respuestas del agente no se lean, sino que se "interpreten".

  • El avatar no usa GPU en tiempo de ejecución. En vez de inferencia en tiempo real, reproduce uno de ~30 clips prerenderizados según las etiquetas emocionales de la salida del LLM. Si es [working], se pone lentes y toma notas; con la etiqueta [confirm] aparecen aprobar/cancelar para preguntar antes de acciones irreversibles; y el código/logs no se leen en voz alta, sino que se renderizan como tarjetas. La GPU queda por completo para el modelo.

  • No reemplaza al agente: se conecta como conector. La arquitectura hace que el gateway marque por dial-out al WebSocket local levantado por la app, así que desde la perspectiva del agente solo se agrega un canal más. También recibe y muestra tal cual el menú de comandos con barra del agente.

  • Voz bidireccional: Edge TTS (se puede cambiar por un motor local) + Silero VAD y faster-whisper.

  • Open core (MIT). Incluye un avatar inicial gratuito, así que al clonar el repositorio funciona de inmediato. Ese avatar en sí también fue hecho solo con herramientas locales gratuitas (Animagine XL → HunyuanVideo 1.5 i2v), así que también sirve como ejemplo que demuestra que el método de creación descrito en la documentación realmente funciona.

Lo que aprendí al hacerlo: fue más difícil de lo esperado lograr microexpresiones con prompts en modelos de difusión de video. Wan 2.2 5B podía hacer una sonrisa con la boca bien abierta, pero emociones expresadas con las cejas, como "preocupación" o "enojo", salían simplemente con cara neutra. Al cambiar a HunyuanVideo 1.5 (destilación progresiva de 8.3B), fue más rápido en la misma tarjeta de 12 GB y además las expresiones salieron correctamente.

Por ahora solo hay build para Windows y no hay lip sync en tiempo real (ese es el trade-off del enfoque prerenderizado).

Aún no hay comentarios.

Aún no hay comentarios.