- Reúne guías prácticas y ejemplos para implementar aplicaciones con Claude, cubriendo ampliamente desde la construcción de agentes hasta RAG, uso de herramientas, multimodalidad y evaluación
- Los ejemplos de Claude Agent SDK y Managed Agents incluyen patrones operativos como coordinación multiagente, gestión de sesiones, despliegue, respuesta a fallas, detección de vulnerabilidades y memoria de usuario
- Ofrece memoria y compresión de contexto para agentes de larga duración, llamadas programáticas a herramientas, búsqueda de herramientas basada en embeddings y técnicas de subagentes asíncronos
- Además de RAG, generación de SQL, grafos de conocimiento, resumen de documentos y procesamiento de imágenes y audio, también permite revisar ejemplos de implementación para evaluación, costos, observabilidad y medidas de seguridad
- Abarca despliegue con Docker, Modal y Kubernetes, control de versiones de prompts y rollback, aprobación humana y análisis de costos, por lo que puede usarse en todo el ciclo de desarrollo y operación en producción
Evaluación de agentes y medidas de seguridad
- Reproducir las puntuaciones de Claude en benchmarks de búsqueda agéntica: reproduce las puntuaciones de DeepSearchQA y BrowseComp con un harness de Messages API, usando llamadas programáticas a herramientas, compresión del lado del servidor y presupuesto de tareas
- Fallback del clasificador y facturación en Claude Fable 5: detecta el bloqueo del clasificador de seguridad y cambia a Opus 4.8; cubre fallback del lado del servidor o del cliente SDK, streaming y nuevos cambios de facturación
- Evaluación de herramientas: ejecuta evaluación paralela de agentes sobre herramientas, de forma independiente a los archivos de trabajo de evaluación
- Construcción de evaluaciones: construye un sistema de evaluación para medir y mejorar el rendimiento de Claude en métricas clave
- Generación de datos de prueba sintéticos para plantillas de prompts: genera casos de prueba sintéticos para evaluar y mejorar prompts de Claude
- Construir un filtro de moderación con Claude: crea un filtro de moderación de contenido personalizado definiendo reglas y categorías en el prompt
Patrones de multiagente y flujos de trabajo
- Coordinación multiagente asíncrona: aborda la estructura de mensajería y ciclo de vida de un equipo fijo de N agentes que intercambian mensajes en un hub compartido y de subagentes asíncronos creados dinámicamente
- Multiagente: coordinación de equipos especialistas: un coordinador dirige a un investigador de búsqueda web, un encargado de revisión de archivos y un responsable de precios basado en reglas para redactar una propuesta comercial
- Incluye el campo
multiagent, eventosthread_createdythread_message_received, y restricciones de alcance de herramientas por rol
- Incluye el campo
- Outcomes: agentes que verifican su propio trabajo: un redactor crea un resumen de investigación con citas, luego un calificador sin estado revisa URLs y citas, y construye un bucle de calificación y mejora hasta aprobar
- Cubre
user.define_outcome, eventosspan.outcome_evaluation_*y cómo redactar criterios de evaluación que el calificador pueda ejecutar
- Cubre
- Flujos de trabajo básicos: ofrece tres patrones multi-LLM que intercambian costo o latencia por rendimiento
- Evaluador-optimizador: estructura iterativa donde un LLM genera resultados y otro LLM aporta retroalimentación de evaluación
- Orquestador-trabajadores: un LLM central delega tareas dinámicamente y sintetiza los resultados de los LLM trabajadores
- Usar Haiku como subagente: subagentes Haiku extraen reportes financieros y Opus sintetiza los resultados
Claude Agent SDK
- Agente de investigación de una sola línea: construye un agente de investigación autónomo con Claude Code SDK y
WebSearch - Agente jefe de gabinete: crea un sistema multiagente con subagentes, hooks, estilo de salida y modo de planificación
- Agente de observabilidad: conecta agentes a sistemas externos con un servidor MCP para manejar monitoreo de GitHub y flujos de CI
- Agente de confiabilidad del sitio: diagnostica y recupera fallas con herramientas MCP de lectura y escritura, y redacta informes postmortem
- Migración desde OpenAI Agents SDK: usando como ejemplo un agente de aprobación de costos, mapea herramientas, guardrails, sesiones y handoffs a los elementos base de Claude Agent SDK
- Construir un navegador de sesiones: lista y revisa sesiones de Agent SDK en disco, además de renombrarlas, etiquetarlas y bifurcarlas, para crear una barra lateral sin un parser separado del historial de conversación
- Agente de detección de vulnerabilidades: realiza modelado de amenazas sobre objetivos en C y usa herramientas de archivos integradas para encontrar bugs de seguridad de memoria, clasificándolos en un informe estructurado
- Hospedaje del agente: despliega un agente de investigación en Docker, Modal y Kubernetes en tres etapas, manteniendo la misma imagen de contenedor y la interfaz HTTP
Claude Managed Agents
- Creación de un agente que recuerda al usuario: aprende y recuerda las preferencias del usuario a lo largo de múltiples interacciones usando un almacén de Memory
- Creación de un agente de respuesta a incidentes de SRE con Claude Managed Agents: cuando se activa una alerta, lee logs y runbooks, encuentra la causa raíz, abre un PR de corrección y lo fusiona después de la aprobación humana
- Creación de un agente de análisis de datos: usa un entorno sandbox y montajes de archivos para convertir CSV en reportes HTML con gráficos interactivos
- Creación de un bot de análisis de datos para Slack: al mencionar al bot con un CSV, genera un reporte de análisis en el hilo y permite conversaciones de seguimiento en la misma sesión
- Tutorial de Managed Agents: mejorar una colección de pruebas fallidas: corrige tres bugs en el paquete
calc.pyusando creación de agentes, entornos y sesiones, montajes de archivos y un bucle de eventos en streaming - Tutorial de Managed Agents: configuración para producción: cubre credenciales de MCP basadas en vault, el webhook
session.status_idledpara involucrar a personas sin conexiones persistentes y el CRUD del ciclo de vida de recursos - Tutorial de Managed Agents: versionado de prompts y rollback: crea v1 en el servidor, la evalúa con un conjunto de pruebas etiquetado y luego detecta una regresión en v2 para fijar la sesión en la versión 1
- incluye el anclaje de versión de
agents.updateysessions.create, y dónde se mueve la compuerta de revisión cuando el prompt no es código
- incluye el anclaje de versión de
Memoria y gestión de contexto
- Ingeniería de contexto: memoria, compresión y eliminación de herramientas: compara cuándo aplicar cada estrategia, su costo y cómo combinarlas en agentes de larga duración
- Compactación de memoria de sesión: compacta de inmediato la memoria de sesión de conversaciones largas con threading en segundo plano y caché de prompts
- Compactación automática de contexto: compacta automáticamente el historial de conversación en flujos de trabajo de agentes de larga duración para gestionar el límite de contexto
- Memoria y gestión de contexto en Claude Sonnet 4.6: construye agentes con memoria persistente con la herramienta de memoria y la edición de contexto de Claude
- Caché especulativa de prompts: prepara la caché por adelantado mientras el usuario redacta una consulta para reducir el tiempo hasta el primer token
- Caché de prompts en la API de Claude: almacena en caché y reutiliza el contexto del prompt para reducir costos y tiempo de respuesta
Uso de herramientas e integraciones externas
- Llamado programático de herramientas: hace que Claude escriba código de llamada de herramientas en un entorno de ejecución de código para reducir la latencia y el consumo de tokens
- Búsqueda de herramientas con embeddings: amplía aplicaciones de Claude hasta miles de herramientas con búsqueda dinámica basada en embeddings semánticos
- Llamado paralelo de herramientas en Claude 3.7 Sonnet: habilita llamadas paralelas usando el metapatrón de herramientas por lotes como solución alternativa
- Selección de herramientas: fuerza o automatiza la selección de herramientas de Claude con el parámetro
tool_choice - Herramienta de guardado de memoria que combina Pydantic y el uso de herramientas de Anthropic: genera herramientas con seguridad de tipos validadas con modelos de Pydantic
- Uso de una herramienta de calculadora en Claude: proporciona una herramienta de calculadora para operaciones aritméticas y resolución de problemas matemáticos
- Crear un agente de servicio al cliente con herramientas del lado del cliente: construye un chatbot que usa herramientas de consulta de clientes y gestión de pedidos
- Extracción de JSON estructurado con Claude y uso de herramientas: extrae datos JSON estructurados de múltiples entradas
- Usar la API de Wolfram Alpha LLM como herramienta en Claude: integra la API de Wolfram Alpha LLM para consultas y respuestas de cálculo
- Agente de enriquecimiento de inteligencia de amenazas: investiga y valida de forma cruzada indicadores de compromiso de múltiples fuentes de amenazas, los mapea a MITRE ATT&CK y genera reportes para SIEM y SOAR
Búsqueda·RAG·procesamiento de conocimiento
- Construcción de grafos de conocimiento con Claude: extrae entidades y relaciones de texto no estructurado, elimina duplicados y permite consultas de grafos de múltiples saltos
- Text-to-SQL con Claude: convierte lenguaje natural en SQL con RAG, cadena de pensamiento y técnicas de auto-mejora
- Mejora de RAG con búsqueda contextual: aumenta la precisión de RAG al agregar contexto a los chunks antes de los embeddings y aplicar prompt caching
- Generación aumentada por recuperación: construye y optimiza sistemas RAG con indexación de resúmenes y reordenamiento
- Clasificación con Claude: construye un sistema de clasificación para tickets de seguros usando RAG y cadena de pensamiento
- Citas: proporciona citas detalladas y verificables de fuentes para consultas basadas en documentos
- Resumen de contenido web con Claude 3 Haiku: obtiene contenido desde una URL y lo resume con Claude 3 Haiku
- Crear consultas SQL con Claude: genera SQL a partir de preguntas en lenguaje natural proporcionando el contexto del esquema de la base de datos
- Generación aumentada por recuperación con Pinecone: conecta Claude con la base de datos vectorial Pinecone para implementar RAG y búsqueda semántica
- Construcción de un sistema RAG con Claude 3 y MongoDB: construye un chatbot de Claude·MongoDB que usa noticias tecnológicas como base de conocimiento
- Agente RAG con Claude 3 y LangChain v1: crea un agente RAG con patrones actualizados del framework de agentes de LangChain v1
- Agentes multi-documento: construye RAG para grandes colecciones de documentos con DocumentAgents y el patrón ReAct
- Pipeline RAG con LlamaIndex: crea un pipeline básico para recuperación de documentos y preguntas y respuestas
- Motor RouterQuery: dirige consultas a distintos índices con
RouterQueryEnginede LlamaIndex - SubQuestionQueryEngine: descompone consultas complejas en subpreguntas a través de varios documentos
- “Subir” PDF a Claude mediante la API: procesa y resume documentos PDF con extracción y codificación de texto
- Búsqueda iterativa en Wikipedia con Claude: notebook heredado de un flujo de trabajo de investigación que realiza búsquedas iterativas en Wikipedia con Claude 2
Multimodalidad·voz·documentos
- Proveer una herramienta de recorte para mejorar el análisis de imágenes: amplía áreas específicas de gráficos, documentos y diagramas para analizarlas en detalle
- Usar visión y herramientas juntas en Claude: combina comprensión de imágenes y herramientas para extraer datos estructurados de imágenes como etiquetas nutricionales
- Buenas prácticas para usar visión en Claude: ofrece técnicas y consejos para mejorar el rendimiento del procesamiento de imágenes
- Primeros pasos: enviar imágenes a Claude: envía imágenes a la API de Claude 3 para realizar análisis de texto basado en visión
- Transcripción de documentos con Claude: extrae y estructura texto no estructurado de imágenes y PDF
- Trabajo con tablas, gráficos y presentaciones: extrae información de tablas, gráficos y presentaciones con Claude Vision
- Multimodalidad: realiza comprensión y razonamiento sobre imágenes con la abstracción Anthropic MultiModal LLM de LlamaIndex
- Asistente de voz de baja latencia con ElevenLabs: combina las funciones de voz a texto y texto a voz de ElevenLabs con Claude
- Transcribir audio con Deepgram y preparar preguntas de entrevista con Anthropic: transcribe audio y genera preguntas de entrevista con Claude
Respuesta, razonamiento y prompting
- Pensamiento extendido: usa el pensamiento extendido paso a paso de Claude junto con control de presupuesto
- Pensamiento extendido combinado con uso de herramientas: combina pensamiento extendido y herramientas en flujos de trabajo de varios pasos
- Prompting para estética de frontend: trata cómo escribir prompts para generar frontends distintivos y bien logrados evitando estéticas genéricas
- Resumen con Claude: resume documentos legales, incluyendo evaluaciones y técnicas avanzadas
- Muestreo de respuestas de Claude más allá del límite máximo de tokens: genera respuestas largas que superan
max_tokenscon prefill y continuación de mensajes - Metaprompt: genera prompts iniciales de trabajo para reducir el problema de la página en blanco
- Prompting de «modo JSON» para Claude: obtiene salidas JSON confiables con técnicas de prompting sin muestreo restringido
- Procesamiento por lotes con Message Batches API: procesa grandes volúmenes de solicitudes de forma asíncrona y reduce costos en 50%
Skills y aplicaciones empresariales
- Claude Skills para aplicaciones financieras: crea dashboards financieros y análisis de portafolios con Skills de Excel, PowerPoint y PDF
- Creación de Skills personalizadas para Claude: crea, implementa y administra Skills que amplían flujos de trabajo específicos de la organización
- Introducción a Claude Skills: realiza creación de documentos, análisis de datos y automatización de flujos de trabajo con Skills de Excel, PowerPoint y PDF
- Fine-tuning de Claude 3 Haiku en Amazon Bedrock: ofrece el procedimiento para hacer fine-tuning de Claude 3 Haiku en Amazon Bedrock para tareas personalizadas
- Cookbook de la Admin API de uso y costos: accede y analiza de forma programática los datos de uso y costos de la API de Claude con la Admin API
Patrones de agentes de LlamaIndex y contribuciones de la comunidad
- Agente ReAct: crea un agente ReAct con LlamaIndex para ejecutar flujos de razonamiento y acción basados en herramientas
- Se aceptan contribuciones de la comunidad para nuevas ideas de Cookbook, y se ofrece una guía de contribución
1 comentarios
Opiniones en Hacker News
Sinceramente, casi todo el material sobre cómo usar IA me parece inútil. Puedes preguntarle directamente a la IA cómo hacerlo y, si se trata de formas de usar IA, basta con integrarlas en el harness o esperar a que Anthropic/OpenAI las implementen, ya que son funciones menores.
Incluso cosas como flujos de trabajo de agentes, gestión de memoria e ingeniería de harness me parecen, en su mayoría, puro show.
Las técnicas o frameworks de IA más recientes también se absorben o reemplazan cada tres meses, así que parece que vale poco la pena invertir en ellos.
.mdy contaminar el contexto.Al final hay que hacer que el LLM busque en este tipo de material, así que quizá sea material más para LLM que para humanos.
Por eso, salvo que sea realmente necesario, evito los plugins y MCP y uso prompts completos. Gracias a eso pude evitar forzar optimizaciones obsoletas al LLM y entorpecer su evolución.
Las imágenes de antes y después de prompting para estética frontend son ridículas. Parece que nadie verificó si esta skill realmente mejoraba el diseño.
El resultado de prompting para estética frontend es plano antes de aplicarlo y plano con degradados añadidos después.
Estoy usando las skills de Matt Pocock en casa y son bastante buenas. Están diseñadas para que el usuario las invoque directamente, no para que se llamen automáticamente, así que no ocupan mucho contexto solo por existir.
En lugar de excluir al programador del resultado final, lo empujan a pensar más a fondo en el resultado. Las grill skills ayudan a aclarar los requisitos reales, y la prototype skill ayuda a explorar partes donde solo se pueden tomar decisiones difíciles al experimentarlas directamente.
El OpenAI Cookbook también es útil. Otros laboratorios de IA también publican con frecuencia ejemplos y cookbooks en GitHub y Hugging Face, así que vale la pena seguir revisándolos.
Los agentes de coding tienen muchos más bugs en frontend que en backend, y producen con mucha más frecuencia funciones rotas, incompletas o torpes. Parece deberse a la diferencia de verificabilidad entre ambas áreas, y un conjunto básico de tests no alcanza.
Enfoques como gstack de Garry Tan parecen adecuados, pero no sé si ya están lo bastante maduros como para adoptarlos. También hay evaluaciones que dicen que Gemini 3.5 Flash es mejor que Opus o GPT-5.5 en tareas frontend; me gustaría ver evaluaciones de usuarios reales para saber si se debe a sus capacidades multimodales o a su comprensión de Chrome.
Para obtener resultados creativos hay que pedirlos de forma activa, pero es bueno para diseño frontend estándar. Eso sí, lo uso solo para probar ideas, no para agregar o modificar funciones arbitrarias.
Pensé que era un libro de cocina de verdad para crear recetas plausibles y realmente cocinables con LLM, pero parece que todavía no estamos en esa etapa.
También es divertido pedir una o dos veces “hazla más sabrosa” después de recibir la receta y ver el resultado.
Pensé que era un producto nuevo para generar recetas con Claude.
Los diseños de antes y después de aplicar el cookbook parecen hechos con vibe coding en ambos casos. No soy diseñador como para señalar la causa exacta, pero el rango de estilos que maneja Claude parece algo limitado.
Quizá se pueda contener esta tendencia especificando con más detalle los cambios necesarios.
Al menos deberían haber revisado la UI una vez. Ni siquiera lograron alinear correctamente un simple espaciado de tabla.