Hola.
Recientemente creé una extensión de Chrome que convierte automáticamente las tareas realizadas en el navegador en una guía de usuario (SOP).
A diferencia del método tradicional de grabación de pantalla, recopila eventos de clic e ingreso de texto junto con el contexto del DOM y los reconstruye en pasos de trabajo fáciles de entender para las personas.
Actualmente, el pipeline es el siguiente.
Browser Recording → DOM Context Extraction → Solar Pro 3 → AI Validation → Word / PDF / Markdown
La parte más difícil durante la implementación fue decidir "hasta dónde considerar una sola etapa".
Si se registran los eventos del navegador tal cual, quedan demasiado fragmentados; por el contrario, si se combinan demasiado, se pierde la intención importante del usuario. Actualmente, se implementó un método en el que primero se fusionan los eventos con base en cambios del DOM, estado de entrada y transiciones de página, y luego Solar Pro 3 genera una descripción en lenguaje natural para cada paso, mientras que la IA vuelve a validar el orden y si hay omisiones.
Por ahora ya está implementada la etapa de generación de documentos, y lo siguiente que estoy probando es usar el manual generado como un Task Plan estructurado. La meta no es un simple documento, sino evolucionarlo hacia un flujo de trabajo ejecutable en el que un agente de IA pueda entender la tarea, guiarla o reproducir tareas repetitivas en el navegador.
Interaction Segmentation y Task Planning todavía siguen en mejora. Me gustaría escuchar comentarios de quienes tengan investigaciones o experiencia de implementación relacionadas.
Aún no hay comentarios.