1 puntos por GN⁺ 3 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Echo combina varios modelos de pesos abiertos, como GLM-5.2 y Kimi K2.7, según cada solicitud, para compensar las limitaciones de delegar todas las tareas a un solo modelo
  • En cada solicitud define la cantidad de cómputo y los modelos participantes, y ajusta incluso la forma de combinar los resultados, usando menos recursos de inferencia para prompts simples
  • En su primera configuración de evaluación, superó de forma consistente al mejor modelo individual del conjunto y logró resultados generales similares a Fable con cerca de un tercio del costo de inferencia
  • Incluso modelos generalmente más débiles tienen capacidades complementarias y pueden ser útiles en ciertos problemas o combinaciones, aunque todavía quedan casos de malas decisiones de asignación y combinación
  • Publicaron una interfaz de chat y una API compatible con OpenAI, y están probando si el mismo enfoque funciona también en tareas de código y agentes, donde medir la calidad es más difícil

Selección de modelos y combinación de resultados

  • En los experimentos iniciales, evaluaron GLM-5.2, Kimi K2.7 y otros en el mismo benchmark, asumiendo que para cada problema se sabía de antemano qué modelos eran útiles y cuál era la forma adecuada de combinar sus salidas
    • Este sistema hipotético mostró un rendimiento mucho mayor que cualquier modelo individual incluido en el conjunto
    • Como esas buenas decisiones solo pueden identificarse después de ver los resultados, no sirve para despliegue real; Echo es un intento de recuperar parte de esa ventaja sin información previa
  • Según las características de la solicitud, elige el cómputo necesario, los modelos participantes y la forma de combinar los resultados
    • A los prompts simples les asigna relativamente poca inferencia
    • En otros problemas, organiza varios modelos para que resuelvan partes distintas entre sí
  • Las capacidades de los modelos son complementarias, así que incluso modelos con rendimiento global claramente inferior pueden ser muy útiles en ciertos problemas o combinaciones

Resultados de evaluación y pruebas públicas

  • En su primera configuración de evaluación, registró un rendimiento consistentemente superior al del mejor modelo individual y logró un resultado general aproximadamente igual al de Fable a cerca de un tercio del costo
  • En algunas solicitudes toma malas decisiones sobre la asignación de cómputo o la combinación de modelos, y actualmente están analizando esos casos de falla
  • En tareas de código y de agentes es mucho más difícil medir la calidad de cada decisión, por lo que están probando por separado si el mismo enfoque se mantiene
  • Para pruebas externas, ofrecen la interfaz de chat de Echo y una API compatible con OpenAI
  • Publicaron un video que explica cómo funciona y detalles sobre la metodología de evaluación, resultados por modelo, costos y limitaciones actuales, y piden feedback sobre fallas inusuales o casos de asignación de recursos poco intuitivos

1 comentarios

 
GN⁺ 3 시간 전
Opiniones de Hacker News
  • Es un típico patrón oscuro: muestran un campo de entrada de Message Echo que parece que va a darte una respuesta, y luego te mandan a la página de registro.
    Como desde la primera acción inducida por el sitio me pusieron una traba, me fui de inmediato y no volveré.

    • Sentí exactamente lo mismo; detesto tanto estos patrones oscuros que ya no tengo ningún interés en este producto.
    • Lo estamos eliminando ahora.
    • Por otro lado, si permiten solicitudes antes de iniciar sesión, el creador tendría que asumir el costo de las consultas iniciales, y el abuso podría generar una factura enorme.
      Desde la perspectiva de alguien que crea productos de IA, también es una decisión comprensible.
  • Gracias a todos los que usaron Echo y dieron feedback; lanzamos temprano precisamente por este motivo.
    Seguiremos publicando evaluaciones que muestren con más precisión la diferencia frente al estado del arte, incluyendo benchmarks de codificación y agentes más difíciles, y también ampliaremos el panel público de evaluaciones. Los problemas encontrados en la UI del panel de evaluaciones y en el proceso de registro ya se corrigieron en producción.
    Para probar Echo no se necesita tarjeta de crédito, y cada cuenta recibe 10 dólares de créditos gratis para usar en la API y el chat.
    Más allá del simple enrutamiento de modelos, estamos explorando formas de distribuir eficientemente los recursos de inferencia entre modelos de pesos abiertos. No solo decidimos qué modelo usar, sino también cuánta computación invertir en una solicitud y cómo combinar los resultados intermedios.
    Los ensambles como tal se conocen desde antes de los random forests, pero el punto central de Echo es modelarlos y aprovecharlos sin pagar el costo del ensamble completo en cada solicitud. Aunque conceptualmente tiene similitudes con Fusion o Fugu, su estructura y sus objetivos de optimización son distintos.

    • Un pequeño comentario: create password exige caracteres especiales, pero la contraseña generada por defecto por el administrador de contraseñas de Google no incluye caracteres especiales.
      Una combinación alfanumérica de dos dígitos de longitud parece suficiente, pero la idea en sí es excelente.
    • Me pregunto por qué usaron un patrón oscuro. Tenía interés, pero ahora desapareció.
    • Aunque solo intenté registrarme una vez, me apareció el error too many authentication attempts.
    • Deberían eliminar el patrón oscuro.
    • Siguen enfatizando los pesos abiertos, pero no revelan en absoluto qué modelos usan.
      Sin transparencia, no veo qué beneficio tiene para el usuario final que usen modelos de pesos abiertos.
  • La descripción de resultados al nivel de Fable por un tercio del costo no parece muy atractiva para usuarios del plan de 200 dólares al mes, que está muy subsidiado.
    No sé hasta cuándo se mantendrá ese plan, pero mientras tanto, un tercio del precio de la API pública tampoco resulta tan atractivo.

    • Después de agotar mi uso semanal de Fable en el plan de 200 dólares al mes, ejecuté un plan de codificación de tamaño medio con 200 dólares de créditos promocionales y gasté 120 dólares en 1 hora y 15 minutos.
      También influyó que se ejecutaron varios subagentes al mismo tiempo y que Claude olvidó la instrucción de usar modelos baratos, por lo que quedaron corriendo varias instancias de Fable, pero el cobro por token es difícil de asumir. 200 dólares al mes ya es caro, pero 200 dólares en una noche es absurdo.
    • Los clientes empresariales que lo usan para trabajar no pueden acceder a planes subsidiados, así que es probable que esos planes representen una minoría del uso total.
    • Este plan probablemente se mantenga hasta la oferta pública inicial (IPO), pero no creo que dure mucho después.
      Si un usuario de 200 dólares al mes consume el equivalente a 10.000 dólares en créditos de API, el margen por usuario es de -98%, así que no ayuda a la rentabilidad.
    • Si el objetivo es evitar límites de uso o la suspensión de la cuenta al cruzar cierta línea, entonces la historia cambia.
    • Según un correo que recibí hoy de Anthropic, Fable 5 pasará a un sistema de créditos de uso a partir del 20 de julio.
      Se podrá seguir usando, pero requerirá créditos de pago por uso y no contará dentro de los límites de uso del plan de suscripción.
  • No me sorprendería que, en los próximos años, el concepto de mejor modelo quede relegado a un nicho.
    En la mayoría de los sistemas en producción, el ganador podría ser el orquestador que sepa cuándo usar un modelo barato, cuándo pasar a uno potente y cuándo combinar varias salidas.

    • Me pregunto si esa no es la idea de Gemini CLI.
    • Hay muchísimas ramas por las que esto puede evolucionar, pero al final parece que convergerá hacia que el mejor modelo se vuelva un concepto de nicho.
      La gran tendencia son los modelos integrados en el dispositivo, e incluso es posible que el modelo esté dentro del die del chip y se reemplace el chipset cada ciertos años. En ese entorno, los grandes proveedores de nube saldrían perdiendo.
  • Una de las conclusiones más interesantes es que la elección del modelo puede ser más importante que el tamaño del modelo.
    La industria se ha concentrado en modelos más grandes, pero enrutar inteligentemente las solicitudes a la combinación adecuada de modelos especializados parece poder lograr mejoras mucho mayores a un costo mucho menor.
    Los modelos débiles no se han vuelto inútiles; destacan en dominios distintos y, al combinarse con otros modelos, su valor puede aumentar mucho. Aun así, me pregunto si esto también aplica a tareas de codificación y agentes, donde elegir el modelo adecuado es mucho más difícil.

    • Si se ensambla con fuerza un conjunto de modelos pequeños especializados en cada tarea y con baja correlación entre sí, se pueden obtener resultados muy interesantes.
      Las tareas de agentes y codificación son más complejas por su granularidad. Hay que decidir cuándo y cómo usar cada modelo, y en qué capa de abstracción: sesión, objetivo, tarea, turno de conversación o llamada a herramientas; es algo que estamos investigando activamente.
  • En la práctica encontré algunos defectos de experiencia de usuario.
    Thinking sigue mostrándose y parece que se quedó trabado o que hay un problema de red; además, el panel izquierdo donde se ingresa el prompt no se puede expandir ni redimensionar. Cuando pido que genere código, la salida se corta continuamente y luego vuelve a empezar desde el principio, sin poder continuar la conversación anterior.

  • Si no se puede saber de antemano la complejidad del problema y no hay garantía de que la conversación posterior se envíe al mismo modelo, este enfoque no funciona bien.
    Si se envía la misma conversación a varios modelos en round robin, se rompe la caché y puede terminar costando más que un sistema que sí tome en cuenta la caché.

    • Se puede usar la técnica de Ralph Wiggum: https://ghuntley.com/ralph/
    • Los aciertos de caché también deberían formar parte de la estrategia.
  • Usé Anthropic Opus 4.8 y Fable 5 durante un tiempo, y también probé los modelos más recientes de OpenAI, pero todos generan demasiada salida innecesaria.
    Empecé a probar otros modelos no por el precio, sino por la calidad, y en mi área de trabajo GLM 5.2 fue muy superior a Fable 5 en todos los aspectos. De hecho, sorprende cuando no logra completar una tarea con éxito.
    Kimi K2.7 necesita un poco más de instrucciones, pero ofrece una mejor experiencia que Opus 4.8; K3 todavía no lo he probado. Los modelos más recientes de OpenAI son absurdamente malos en diseño e implementación de software.
    Esta evaluación se limita a mi ámbito de trabajo, con mucho análisis de datos, aprendizaje automático e ingeniería de software.

  • No hay benchmarks ni información sobre los modelos usados, solo un video generado por IA y una página de registro.
    Me recuerda al chiste de arquitectura de “convertimos el monolito en microservicios para que cada falla parezca una novela de misterio”.

    • El evaluador público está en https://echo.tracerml.ai/eval/
      Actualmente publican 907 filas guardadas de 7 familias de benchmarks, donde se pueden revisar prompts, salidas, evaluaciones y registros de costos, y planean agregar más.
      La política de ruteo por solicitud en sí es el producto, así que no la hacen pública, pero sí pueden publicar parte de la lista de modelos de pesos abiertos disponibles, fechas de versión, proporciones generales de asignación y configuración de evaluación, sin revelar la receta por solicitud. También están produciendo un nuevo video.
    • Los benchmarks están en https://echo.tracerml.ai/eval/
      No son buenos benchmarks, pero al menos existen.
    • En esencia, parece un intento de recrear OpenRouter. OpenRouter es una abstracción de infraestructura bastante ingeniosa que abstrae proveedores específicos con failover, medición de uso, conmutación automática, etc., y funciona bastante bien.
      Da pena que parezca más un intento de decirles a inversionistas “OpenRouter se volvió unicornio, así que yo también puedo hacer algo parecido con vibe coding”, en vez de resolver un problema real.
      Llamarlo nivel Fable también se siente intelectualmente flojo o deshonesto.
    • Me viene a la mente la frase de tenderlove: “los microservicios convierten las llamadas a funciones en un problema de computación distribuida”.
    • Tengo entendido que las apps protegidas por login no están permitidas en Show HN.
  • Me pregunto si esto es volver a crear Dogpile.com, que agregaba resultados de Ask Jeeves, AltaVista y Lycos. Parece que el tiempo es cíclico.

    • Las buenas ideas suelen seguir siendo buenas aunque cambien la época y las herramientas.
    • Los modelos en ensamble también siempre dieron el mejor rendimiento en Kaggle.
      Nosotros implementamos el mismo enfoque: https://trustedrouter.com/blog/prometheus-2-new-draco-state-...
    • Es un enfoque de no usar el mismo tamaño de instancia EC2 para todas las tareas del servicio.
    • Uno podría hacer una rueda triangular, pero hay una razón por la que las ruedas son redondas.
    • Se puede ver como una mezcla de modelos (Mixture of Models).
      Otros productos de gateway de IA como OpenRouter, JusCode y Fireworks también recomiendan últimamente la misma configuración, así que es muy probable que tenga partes útiles.