- Echo combina varios modelos de pesos abiertos, como GLM-5.2 y Kimi K2.7, según cada solicitud, para compensar las limitaciones de delegar todas las tareas a un solo modelo
- En cada solicitud define la cantidad de cómputo y los modelos participantes, y ajusta incluso la forma de combinar los resultados, usando menos recursos de inferencia para prompts simples
- En su primera configuración de evaluación, superó de forma consistente al mejor modelo individual del conjunto y logró resultados generales similares a Fable con cerca de un tercio del costo de inferencia
- Incluso modelos generalmente más débiles tienen capacidades complementarias y pueden ser útiles en ciertos problemas o combinaciones, aunque todavía quedan casos de malas decisiones de asignación y combinación
- Publicaron una interfaz de chat y una API compatible con OpenAI, y están probando si el mismo enfoque funciona también en tareas de código y agentes, donde medir la calidad es más difícil
Selección de modelos y combinación de resultados
- En los experimentos iniciales, evaluaron GLM-5.2, Kimi K2.7 y otros en el mismo benchmark, asumiendo que para cada problema se sabía de antemano qué modelos eran útiles y cuál era la forma adecuada de combinar sus salidas
- Este sistema hipotético mostró un rendimiento mucho mayor que cualquier modelo individual incluido en el conjunto
- Como esas buenas decisiones solo pueden identificarse después de ver los resultados, no sirve para despliegue real; Echo es un intento de recuperar parte de esa ventaja sin información previa
- Según las características de la solicitud, elige el cómputo necesario, los modelos participantes y la forma de combinar los resultados
- A los prompts simples les asigna relativamente poca inferencia
- En otros problemas, organiza varios modelos para que resuelvan partes distintas entre sí
- Las capacidades de los modelos son complementarias, así que incluso modelos con rendimiento global claramente inferior pueden ser muy útiles en ciertos problemas o combinaciones
Resultados de evaluación y pruebas públicas
- En su primera configuración de evaluación, registró un rendimiento consistentemente superior al del mejor modelo individual y logró un resultado general aproximadamente igual al de Fable a cerca de un tercio del costo
- En algunas solicitudes toma malas decisiones sobre la asignación de cómputo o la combinación de modelos, y actualmente están analizando esos casos de falla
- En tareas de código y de agentes es mucho más difícil medir la calidad de cada decisión, por lo que están probando por separado si el mismo enfoque se mantiene
- Para pruebas externas, ofrecen la interfaz de chat de Echo y una API compatible con OpenAI
- Publicaron un video que explica cómo funciona y detalles sobre la metodología de evaluación, resultados por modelo, costos y limitaciones actuales, y piden feedback sobre fallas inusuales o casos de asignación de recursos poco intuitivos
1 comentarios
Opiniones de Hacker News
Es un típico patrón oscuro: muestran un campo de entrada de Message Echo que parece que va a darte una respuesta, y luego te mandan a la página de registro.
Como desde la primera acción inducida por el sitio me pusieron una traba, me fui de inmediato y no volveré.
Desde la perspectiva de alguien que crea productos de IA, también es una decisión comprensible.
Gracias a todos los que usaron Echo y dieron feedback; lanzamos temprano precisamente por este motivo.
Seguiremos publicando evaluaciones que muestren con más precisión la diferencia frente al estado del arte, incluyendo benchmarks de codificación y agentes más difíciles, y también ampliaremos el panel público de evaluaciones. Los problemas encontrados en la UI del panel de evaluaciones y en el proceso de registro ya se corrigieron en producción.
Para probar Echo no se necesita tarjeta de crédito, y cada cuenta recibe 10 dólares de créditos gratis para usar en la API y el chat.
Más allá del simple enrutamiento de modelos, estamos explorando formas de distribuir eficientemente los recursos de inferencia entre modelos de pesos abiertos. No solo decidimos qué modelo usar, sino también cuánta computación invertir en una solicitud y cómo combinar los resultados intermedios.
Los ensambles como tal se conocen desde antes de los random forests, pero el punto central de Echo es modelarlos y aprovecharlos sin pagar el costo del ensamble completo en cada solicitud. Aunque conceptualmente tiene similitudes con Fusion o Fugu, su estructura y sus objetivos de optimización son distintos.
create passwordexige caracteres especiales, pero la contraseña generada por defecto por el administrador de contraseñas de Google no incluye caracteres especiales.Una combinación alfanumérica de dos dígitos de longitud parece suficiente, pero la idea en sí es excelente.
too many authentication attempts.Sin transparencia, no veo qué beneficio tiene para el usuario final que usen modelos de pesos abiertos.
La descripción de
resultados al nivel de Fable por un tercio del costono parece muy atractiva para usuarios del plan de 200 dólares al mes, que está muy subsidiado.No sé hasta cuándo se mantendrá ese plan, pero mientras tanto, un tercio del precio de la API pública tampoco resulta tan atractivo.
También influyó que se ejecutaron varios subagentes al mismo tiempo y que Claude olvidó la instrucción de usar modelos baratos, por lo que quedaron corriendo varias instancias de Fable, pero el cobro por token es difícil de asumir. 200 dólares al mes ya es caro, pero 200 dólares en una noche es absurdo.
Si un usuario de 200 dólares al mes consume el equivalente a 10.000 dólares en créditos de API, el margen por usuario es de -98%, así que no ayuda a la rentabilidad.
Se podrá seguir usando, pero requerirá créditos de pago por uso y no contará dentro de los límites de uso del plan de suscripción.
No me sorprendería que, en los próximos años, el concepto de mejor modelo quede relegado a un nicho.
En la mayoría de los sistemas en producción, el ganador podría ser el orquestador que sepa cuándo usar un modelo barato, cuándo pasar a uno potente y cuándo combinar varias salidas.
La gran tendencia son los modelos integrados en el dispositivo, e incluso es posible que el modelo esté dentro del die del chip y se reemplace el chipset cada ciertos años. En ese entorno, los grandes proveedores de nube saldrían perdiendo.
Una de las conclusiones más interesantes es que la elección del modelo puede ser más importante que el tamaño del modelo.
La industria se ha concentrado en modelos más grandes, pero enrutar inteligentemente las solicitudes a la combinación adecuada de modelos especializados parece poder lograr mejoras mucho mayores a un costo mucho menor.
Los modelos débiles no se han vuelto inútiles; destacan en dominios distintos y, al combinarse con otros modelos, su valor puede aumentar mucho. Aun así, me pregunto si esto también aplica a tareas de codificación y agentes, donde elegir el modelo adecuado es mucho más difícil.
Las tareas de agentes y codificación son más complejas por su granularidad. Hay que decidir cuándo y cómo usar cada modelo, y en qué capa de abstracción: sesión, objetivo, tarea, turno de conversación o llamada a herramientas; es algo que estamos investigando activamente.
En la práctica encontré algunos defectos de experiencia de usuario.
Thinkingsigue mostrándose y parece que se quedó trabado o que hay un problema de red; además, el panel izquierdo donde se ingresa el prompt no se puede expandir ni redimensionar. Cuando pido que genere código, la salida se corta continuamente y luego vuelve a empezar desde el principio, sin poder continuar la conversación anterior.Si no se puede saber de antemano la complejidad del problema y no hay garantía de que la conversación posterior se envíe al mismo modelo, este enfoque no funciona bien.
Si se envía la misma conversación a varios modelos en round robin, se rompe la caché y puede terminar costando más que un sistema que sí tome en cuenta la caché.
Usé Anthropic Opus 4.8 y Fable 5 durante un tiempo, y también probé los modelos más recientes de OpenAI, pero todos generan demasiada salida innecesaria.
Empecé a probar otros modelos no por el precio, sino por la calidad, y en mi área de trabajo GLM 5.2 fue muy superior a Fable 5 en todos los aspectos. De hecho, sorprende cuando no logra completar una tarea con éxito.
Kimi K2.7 necesita un poco más de instrucciones, pero ofrece una mejor experiencia que Opus 4.8; K3 todavía no lo he probado. Los modelos más recientes de OpenAI son absurdamente malos en diseño e implementación de software.
Esta evaluación se limita a mi ámbito de trabajo, con mucho análisis de datos, aprendizaje automático e ingeniería de software.
No hay benchmarks ni información sobre los modelos usados, solo un video generado por IA y una página de registro.
Me recuerda al chiste de arquitectura de “convertimos el monolito en microservicios para que cada falla parezca una novela de misterio”.
Actualmente publican 907 filas guardadas de 7 familias de benchmarks, donde se pueden revisar prompts, salidas, evaluaciones y registros de costos, y planean agregar más.
La política de ruteo por solicitud en sí es el producto, así que no la hacen pública, pero sí pueden publicar parte de la lista de modelos de pesos abiertos disponibles, fechas de versión, proporciones generales de asignación y configuración de evaluación, sin revelar la receta por solicitud. También están produciendo un nuevo video.
No son buenos benchmarks, pero al menos existen.
Da pena que parezca más un intento de decirles a inversionistas “OpenRouter se volvió unicornio, así que yo también puedo hacer algo parecido con vibe coding”, en vez de resolver un problema real.
Llamarlo
nivel Fabletambién se siente intelectualmente flojo o deshonesto.Me pregunto si esto es volver a crear Dogpile.com, que agregaba resultados de Ask Jeeves, AltaVista y Lycos. Parece que el tiempo es cíclico.
Nosotros implementamos el mismo enfoque: https://trustedrouter.com/blog/prometheus-2-new-draco-state-...
Otros productos de gateway de IA como OpenRouter, JusCode y Fireworks también recomiendan últimamente la misma configuración, así que es muy probable que tenga partes útiles.