1 puntos por GN⁺ 2 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Reúne guías prácticas y ejemplos para implementar aplicaciones con Claude, cubriendo ampliamente desde la construcción de agentes hasta RAG, uso de herramientas, multimodalidad y evaluación
  • Los ejemplos de Claude Agent SDK y Managed Agents incluyen patrones operativos como coordinación multiagente, gestión de sesiones, despliegue, respuesta a fallas, detección de vulnerabilidades y memoria de usuario
  • Ofrece memoria y compresión de contexto para agentes de larga duración, llamadas programáticas a herramientas, búsqueda de herramientas basada en embeddings y técnicas de subagentes asíncronos
  • Además de RAG, generación de SQL, grafos de conocimiento, resumen de documentos y procesamiento de imágenes y audio, también permite revisar ejemplos de implementación para evaluación, costos, observabilidad y medidas de seguridad
  • Abarca despliegue con Docker, Modal y Kubernetes, control de versiones de prompts y rollback, aprobación humana y análisis de costos, por lo que puede usarse en todo el ciclo de desarrollo y operación en producción

Evaluación de agentes y medidas de seguridad

Patrones de multiagente y flujos de trabajo

  • Coordinación multiagente asíncrona: aborda la estructura de mensajería y ciclo de vida de un equipo fijo de N agentes que intercambian mensajes en un hub compartido y de subagentes asíncronos creados dinámicamente
  • Multiagente: coordinación de equipos especialistas: un coordinador dirige a un investigador de búsqueda web, un encargado de revisión de archivos y un responsable de precios basado en reglas para redactar una propuesta comercial
    • Incluye el campo multiagent, eventos thread_created y thread_message_received, y restricciones de alcance de herramientas por rol
  • Outcomes: agentes que verifican su propio trabajo: un redactor crea un resumen de investigación con citas, luego un calificador sin estado revisa URLs y citas, y construye un bucle de calificación y mejora hasta aprobar
    • Cubre user.define_outcome, eventos span.outcome_evaluation_* y cómo redactar criterios de evaluación que el calificador pueda ejecutar
  • Flujos de trabajo básicos: ofrece tres patrones multi-LLM que intercambian costo o latencia por rendimiento
  • Evaluador-optimizador: estructura iterativa donde un LLM genera resultados y otro LLM aporta retroalimentación de evaluación
  • Orquestador-trabajadores: un LLM central delega tareas dinámicamente y sintetiza los resultados de los LLM trabajadores
  • Usar Haiku como subagente: subagentes Haiku extraen reportes financieros y Opus sintetiza los resultados

Claude Agent SDK

  • Agente de investigación de una sola línea: construye un agente de investigación autónomo con Claude Code SDK y WebSearch
  • Agente jefe de gabinete: crea un sistema multiagente con subagentes, hooks, estilo de salida y modo de planificación
  • Agente de observabilidad: conecta agentes a sistemas externos con un servidor MCP para manejar monitoreo de GitHub y flujos de CI
  • Agente de confiabilidad del sitio: diagnostica y recupera fallas con herramientas MCP de lectura y escritura, y redacta informes postmortem
  • Migración desde OpenAI Agents SDK: usando como ejemplo un agente de aprobación de costos, mapea herramientas, guardrails, sesiones y handoffs a los elementos base de Claude Agent SDK
  • Construir un navegador de sesiones: lista y revisa sesiones de Agent SDK en disco, además de renombrarlas, etiquetarlas y bifurcarlas, para crear una barra lateral sin un parser separado del historial de conversación
  • Agente de detección de vulnerabilidades: realiza modelado de amenazas sobre objetivos en C y usa herramientas de archivos integradas para encontrar bugs de seguridad de memoria, clasificándolos en un informe estructurado
  • Hospedaje del agente: despliega un agente de investigación en Docker, Modal y Kubernetes en tres etapas, manteniendo la misma imagen de contenedor y la interfaz HTTP

Claude Managed Agents

Memoria y gestión de contexto

Uso de herramientas e integraciones externas

Búsqueda·RAG·procesamiento de conocimiento

Multimodalidad·voz·documentos

Respuesta, razonamiento y prompting

Skills y aplicaciones empresariales

Patrones de agentes de LlamaIndex y contribuciones de la comunidad

  • Agente ReAct: crea un agente ReAct con LlamaIndex para ejecutar flujos de razonamiento y acción basados en herramientas
  • Se aceptan contribuciones de la comunidad para nuevas ideas de Cookbook, y se ofrece una guía de contribución

1 comentarios

 
GN⁺ 2 시간 전
Opiniones en Hacker News
  • Sinceramente, casi todo el material sobre cómo usar IA me parece inútil. Puedes preguntarle directamente a la IA cómo hacerlo y, si se trata de formas de usar IA, basta con integrarlas en el harness o esperar a que Anthropic/OpenAI las implementen, ya que son funciones menores.
    Incluso cosas como flujos de trabajo de agentes, gestión de memoria e ingeniería de harness me parecen, en su mayoría, puro show.

    • En 2023 aprendimos con entusiasmo CoT, ReAct, etc., diciendo que la ingeniería de prompts sería la nueva ingeniería de software, pero en 2024 casi todo eso se volvió innecesario por los modelos de razonamiento y las actualizaciones de harness.
      Las técnicas o frameworks de IA más recientes también se absorben o reemplazan cada tres meses, así que parece que vale poco la pena invertir en ellos.
    • A medida que aumenta la capacidad de los modelos, absorben por sí mismos las herramientas que los rodean, así que estas herramientas tienen una vida útil demasiado corta. Ya hemos visto el mismo patrón una y otra vez.
    • Vercel mostró que un solo archivo Markdown con instrucciones claras puede ser más efectivo que las llamadas a herramientas, y también presentó una forma de usar un índice comprimido. Yo también pasé varias horas intentando perfeccionar las llamadas a herramientas y tuve resultados parecidos; desde entonces solo uso Claude.md, Agents.md y, si hace falta, Project.md.
    • Los LLM parecen pésimos para aprovechar otros LLM dentro de un harness. Si los dejas solos, también pueden meter de todo en archivos .md y contaminar el contexto.
      Al final hay que hacer que el LLM busque en este tipo de material, así que quizá sea material más para LLM que para humanos.
    • Para cuando todos estaban elogiando MCP, skills ya se había vuelto una alternativa más eficiente, y la gestión agresiva del contexto también perdió importancia por las ventanas de contexto largas y las funciones de agentes. Si una técnica es buena, lo más probable es que venga integrada en la siguiente versión.
      Por eso, salvo que sea realmente necesario, evito los plugins y MCP y uso prompts completos. Gracias a eso pude evitar forzar optimizaciones obsoletas al LLM y entorpecer su evolución.
  • Las imágenes de antes y después de prompting para estética frontend son ridículas. Parece que nadie verificó si esta skill realmente mejoraba el diseño.

    • Todos los resultados mostrados parecen retrocesos, no mejoras.
    • Muchas guías recomiendan sin pensar la skill de diseño frontend, como el típico culto cargo de los LLM, pero el contenido real no es lo que la gente cree.
    • El sitio al que se le aplicó la estética parece un keygen de principios de los 2000; solo le falta música techno.
    • En realidad, el resultado da bastante vergüenza. Básicamente es “usa fondo negro y una fuente horriblemente ancha”.
    • Me pregunto si eligieron ejemplos que maximizan la diferencia entre antes y después para dar la impresión de que funciona. Personalmente, en todos los ejemplos me gusta más el diseño antes de aplicarlo.
  • El resultado de prompting para estética frontend es plano antes de aplicarlo y plano con degradados añadidos después.

    • En varios ejemplos, el antes es mejor, y el único que realmente podría considerarse una mejora es el ejemplo del blog.
    • De hecho, me gusta más la versión sin la estética aplicada.
    • También se agregan etiquetas en mayúsculas, una característica típica de las páginas diseñadas por IA.
  • Estoy usando las skills de Matt Pocock en casa y son bastante buenas. Están diseñadas para que el usuario las invoque directamente, no para que se llamen automáticamente, así que no ocupan mucho contexto solo por existir.
    En lugar de excluir al programador del resultado final, lo empujan a pensar más a fondo en el resultado. Las grill skills ayudan a aclarar los requisitos reales, y la prototype skill ayuda a explorar partes donde solo se pueden tomar decisiones difíciles al experimentarlas directamente.

  • El OpenAI Cookbook también es útil. Otros laboratorios de IA también publican con frecuencia ejemplos y cookbooks en GitHub y Hugging Face, así que vale la pena seguir revisándolos.

  • Los agentes de coding tienen muchos más bugs en frontend que en backend, y producen con mucha más frecuencia funciones rotas, incompletas o torpes. Parece deberse a la diferencia de verificabilidad entre ambas áreas, y un conjunto básico de tests no alcanza.
    Enfoques como gstack de Garry Tan parecen adecuados, pero no sé si ya están lo bastante maduros como para adoptarlos. También hay evaluaciones que dicen que Gemini 3.5 Flash es mejor que Opus o GPT-5.5 en tareas frontend; me gustaría ver evaluaciones de usuarios reales para saber si se debe a sus capacidades multimodales o a su comprensión de Chrome.

    • Podría haber opciones combinadas con agentes, como la Front End Design skill de Claude, pero no la he probado. Magic Patterns es especialmente bueno para la generación de prototipos iniciales cuando lo maneja un agente que conoce sus funciones y limitaciones.
      Para obtener resultados creativos hay que pedirlos de forma activa, pero es bueno para diseño frontend estándar. Eso sí, lo uso solo para probar ideas, no para agregar o modificar funciones arbitrarias.
    • A los agentes les cuesta manejar actualizaciones complejas de estado asíncrono porque son difíciles de representar en el contexto. En cambio, van bien para crear componentes complejos de forma independiente o implementar funciones con bajo acoplamiento, como animaciones.
  • Pensé que era un libro de cocina de verdad para crear recetas plausibles y realmente cocinables con LLM, pero parece que todavía no estamos en esa etapa.

    • Llevo más de un año cocinando con ayuda de LLM varias veces al mes, y nueve de cada diez veces salió bien. Las recetas promedio contenidas en los pesos del modelo suelen ser bastante sólidas, y también son muy buenos con sustituciones de ingredientes del tipo “no tengo el ingrediente X” o “hazlo vegetariano”.
      También es divertido pedir una o dos veces “hazla más sabrosa” después de recibir la receta y ver el resultado.
    • Estoy aprendiendo cocina italiana con ChatGPT y, salvo algunos intentos fallidos, funciona sorprendentemente bien.
    • Este año cociné varias veces con Gemini y fue mejor de lo esperado. También puedes decirle “tengo estos ingredientes en la despensa y quiero una dieta keto” y luego ir acotando las opciones conversando.
    • Yo también esperaba una herramienta digital de planificación de comidas.
  • Pensé que era un producto nuevo para generar recetas con Claude.

    • Estoy usando proyectos de Claude para recetas, y es excelente para recomendar menús y ajustar recetas a los ingredientes que tengo en la despensa, así que yo también esperaba un producto así.
    • De hecho, también se puede usar para eso.
  • Los diseños de antes y después de aplicar el cookbook parecen hechos con vibe coding en ambos casos. No soy diseñador como para señalar la causa exacta, pero el rango de estilos que maneja Claude parece algo limitado.
    Quizá se pueda contener esta tendencia especificando con más detalle los cambios necesarios.

  • Al menos deberían haber revisado la UI una vez. Ni siquiera lograron alinear correctamente un simple espaciado de tabla.