- Un experimento que comparó a los LLM con un abogado junior y con la subcontratación de procesos legales (LPO) en revisión de contratos, usando el criterio de un abogado senior como referencia correcta para evaluar en conjunto la determinación de cuestiones, la identificación de ubicación, la velocidad y el costo
- En la determinación de cuestiones legales, GPT4-1106 obtuvo un F-score de 0.871, casi igual al 0.874 de LPO y por encima del 0.860 del abogado junior; pero en identificación de ubicación, LPO con 0.770 superó a GPT4-32k con 0.740
- El experimento utilizó 10 contratos de compras anonimizados, excluyó los NDA por ser documentos cortos y no aptos para una evaluación compleja, e incluyó de forma equilibrada contratos bajo jurisdicción de EE. UU. y Nueva Zelanda
- La velocidad de revisión fue ampliamente favorable a los LLM: el tiempo promedio fue de 56.17 minutos para el abogado junior y 201 minutos para LPO, frente a 4.70 minutos para GPT4-1106, 2.11 minutos para GPT4-32k y 0.73 minutos para Palm2 text-bison
- El costo por contrato se calculó en 0.02 dólares para Claude 2.0 y Claude 2.1, y en 0.25 dólares para GPT4-1106, mostrando hasta 99.97% de ahorro de costos frente a los 74.26 dólares del abogado junior y 36.85 dólares de LPO
Qué se comparó en la revisión de contratos
- El objetivo fue evaluar si los LLM superan o igualan a un abogado junior y a un LPO en tareas de revisión masiva de contratos en términos de precisión, velocidad y eficiencia de costos
- Las tareas comparadas fueron determinar las cuestiones legales dentro de un contrato y localizar la posición de las cláusulas contractuales que influyeron en esa determinación
- Se compararon los resultados de los LLM, el abogado junior y el LPO usando como referencia correcta las decisiones elaboradas por abogados senior
- Las preguntas de investigación se resumieron en tres
- Si los LLM son mejores que un abogado junior y un LPO en la determinación de cuestiones legales e identificación de ubicación dentro del contrato
- Si los LLM pueden revisar contratos más rápido
- Si los LLM pueden revisar contratos a menor costo
Conjunto de datos y diseño experimental
- El conjunto de datos estuvo compuesto por 10 contratos de compras tomados de contratos legales reales y anonimizados para preservar la confidencialidad
- Los contratos de compras se eligieron por ser un tipo de contrato revisado con frecuencia en la práctica legal, mientras que los NDA se excluyeron porque suelen ser breves y no se consideraron suficientes para evaluar la capacidad de un LLM de juzgar cuestiones legales complejas
- Las jurisdicciones incluyeron de forma equilibrada contratos de EE. UU. y Nueva Zelanda
- EE. UU. se trató como un sistema que combina derecho escrito y common law
- Nueva Zelanda se trató como un sistema basado en common law
- Cada contrato se analizó con una estructura de dos elementos: escenario del documento y playbook de revisión contractual
- El escenario del documento proporcionó jurisdicción, historial, tamaño de la organización y contexto de los productos o servicios de las partes del contrato
- El playbook de revisión ofreció una lista estandarizada de verificación derivada de casos reales
- Los abogados senior determinaron si cada contrato cumplía criterios predefinidos y localizaron las partes específicas del contrato que influyeron en esa decisión
- También se registró explícitamente cuando un criterio no se cumplía porque la información pertinente no estaba en el contrato
- Los resultados de varios abogados senior se agregaron por criterio de mayoría
- El estudio se realizó conforme a los estándares éticos de Onit Inc., incluyendo notificación a los participantes, derecho a retirarse, anonimización, desidentificación de los datos contractuales, participación del comité de ética y auditoría
Selección de modelos y prompts
- Los modelos se eligieron considerando a los principales proveedores del campo de los LLM, los resultados de pruebas preliminares y el tamaño de la ventana de contexto
- Los modelos incapaces de procesar más de 16,000 tokens fueron excluidos por considerarse poco aptos para manejar el contexto completo del contrato
- LLaMA2 y Amazon Titan requerían dividir el documento en varias partes y repetir en cada una el escenario, el playbook y las cláusulas de definición
- También se evaluaron técnicas como RAG, pero en la evaluación preliminar generaban discontinuidades en la comprensión del contexto contractual, por lo que no se consideraron adecuadas para compararlas con la comprensión de nivel humano de un abogado
- Los modelos y configuraciones incluidos en la evaluación fueron los siguientes
- GPT4 32k: temperature 0.2, entrada de 32,768 tokens, datos de entrenamiento hasta septiembre de 2021
- GPT4-1106: temperature 0.2, entrada de 128,000 tokens, datos de entrenamiento hasta abril de 2023
- GPT3.5-turbo-16k: temperature 0.2, entrada de 16,385 tokens, datos de entrenamiento hasta septiembre de 2021
- Claude 2.1: temperature 0.2, entrada de 200,000 tokens, datos de entrenamiento hasta inicios de 2023
- Claude 2.0: temperature 0.2, entrada de 100,000 tokens, datos de entrenamiento hasta inicios de 2023
- Palm2 Text-bison-32k-2: temperature 0.2, entrada de 32,768 tokens, datos de entrenamiento hasta mediados de 2021
- Los prompts se componían de rol, tarea y contexto
- El rol hacía que el modelo siguiera una persona de abogado
- La tarea consistía en revisar el contrato según criterios dados y determinar la existencia de cuestiones y su ubicación
- El contexto se estructuró de forma similar a las instrucciones dadas a abogados, LPO y revisores de contratos, incluyendo lector objetivo del contrato, antecedentes de las partes y escenario de negociación
Precisión: cercanía en determinación de cuestiones, brecha en identificación de ubicación
- El grado de acuerdo entre grupos de profesionales legales se evaluó con Cronbach’s Alpha
- El acuerdo total entre todos los participantes fue alto, con 0.923366
- El acuerdo entre abogados senior fue el más bajo, con 0.719308
- El de los abogados junior fue 0.765058
- El de LPO fue 1.0, mostrando coincidencia total en las respuestas
- En la determinación de cuestiones legales, los mejores resultados por F-score fueron LPO y GPT4-1106
- LPO: precision 0.933, recall 0.823, F-score 0.874
- GPT4-1106: precision 0.835, recall 0.910, F-score 0.871
- Abogado junior: precision 0.876, recall 0.845, F-score 0.860
- Claude 2.0 y GPT4-32k registraron F-score de 0.817 y 0.820, respectivamente
- GPT3.5 tuvo 0.657 y Palm2 text-bison 0.708, ambos más bajos
- En la identificación de ubicación de cuestiones, LPO registró el F-score más alto
- LPO: precision 0.915, recall 0.666, F-score 0.770
- GPT4-32k: precision 0.847, recall 0.660, F-score 0.740
- Claude 2.1: precision 0.911, recall 0.569, F-score 0.701
- GPT4-1106: precision 0.857, recall 0.575, F-score 0.686
- Abogado junior: precision 0.866, recall 0.542, F-score 0.667
- Palm2 text-bison tuvo el F-score más bajo, con 0.452
- Los LLM pueden igualar o superar al abogado junior y al LPO en la determinación de cuestiones, pero en la tarea de señalar con precisión la ubicación de las cláusulas hay grandes diferencias entre modelos y no siempre superan a los profesionales humanos
Velocidad, costo y limitaciones de adopción
- El tiempo promedio de revisión por contrato fue mucho menor en los LLM que en los profesionales humanos
- Abogado senior: 43.46 minutos
- Abogado junior: 56.17 minutos
- LPO: 201.00 minutos
- GPT4-1106: 4.70 minutos
- GPT4-32k: 2.11 minutos
- GPT3.5: 1.44 minutos
- Claude 2.1: 2.05 minutos
- Claude 2.0: 1.63 minutos
- Palm2 text-bison: 0.73 minutos
- Se calculó que Palm2 text-bison, el LLM más rápido, completó la revisión contractual 276 veces más rápido que LPO y 77 veces más rápido que un abogado junior
- La configuración, prueba, ajuste fino y validación del system prompt del LLM tomó en promedio 16 horas, un nivel similar al tiempo usado para dar instrucciones equivalentes a un abogado junior o a un LPO
- El costo promedio por contrato mostró una gran diferencia entre profesionales humanos y LLM
- Abogado senior: 75.92 dólares
- Abogado junior: 74.26 dólares
- LPO: 36.85 dólares
- GPT4-1106: 0.25 dólares
- GPT4-32k: 1.24 dólares
- GPT3.5: 0.05 dólares
- Claude 2.1: 0.02 dólares
- Claude 2.0: 0.02 dólares
- Palm2 text-bison: 0.03 dólares
- El cálculo de costos se basó en el tiempo promedio requerido y la tarifa por hora de los profesionales humanos, y en el número promedio de tokens de entrada y salida y el precio por token para los LLM
- En Palm2 text-bison, el cálculo se hizo por cantidad de caracteres y no por tokens
- Los LLM con bajo desempeño en identificación de ubicación de cuestiones pueden tener limitaciones para marcar contratos de forma autónoma, por lo que en trabajo legal la selección del modelo es tan importante como el rendimiento y el costo
1 comentarios
Opiniones en Hacker News
Manejo una startup de generación de contratos legales que convierte contratos redactados por abogados en plantillas, y también probé crear algunas funciones de análisis con GPT para que personas comunes puedan leer contratos y hacer preguntas.
En la revisión de contratos, GPT fue más fuerte en el análisis de documentos que en la generación de documentos, y este paper también respalda ese punto. Sin embargo, al probar varias startups de revisión de documentos con IA, la mayoría se desmoronaba en cuanto uno empezaba a exigir respuestas concretas. Este paper parece haber tratado más bien de encontrar cláusulas relevantes, no de una conversación del tipo abogado-cliente.
Como GPT no tiene responsabilidad legal aunque dé una respuesta incorrecta, resulta útil cuando una persona inteligente investiga por su cuenta. Es parecido a cómo antes una persona inteligente podía investigar por su cuenta con Google.
Sobre la generación de contratos, creo que en la mayoría de los casos ayuda más un repositorio de contratos estándar bien redactados y revisados que hacer que GPT genere cada vez un contrato único desde cero. Los abogados se aferran a los contratos, y también fue muy difícil encontrar abogados que nos redactaran contratos para convertirlos en plantillas. Al final, porque eso reduce una futura fuente de ingresos para ellos y para su comunidad profesional. Entrenar GPT-4 costó cientos de millones de dólares, pero si se hubieran gastado solo 10 millones de dólares en crear un repositorio de contratos bien revisados, habría sido más útil que entrenar un modelo de generación de contratos con el mismo dinero.
La gente hace preguntas bastante variadas sobre lo que quiere hacer con los documentos, y GPT todavía no lo hacía bien. Parece que, en el futuro cercano, todavía habrá trabajo para abogados.
Por ejemplo, hace unos 20 años, al menos donde vivo, los arquitectos tampoco querían crear diseños para venderlos barato a muchas personas. Pensaban que esos diseños reducirían el mercado de productos arquitectónicos. Pero es fácil ver que la mayoría de la gente realmente no necesita un diseño único.
Al final, al mercado no le importó demasiado, y en cuanto alguien pudo crear una biblioteca de diseños usable y un modelo de negocio, el problema se resolvió solo. Desde el punto de vista de los arquitectos, solo quedaron dos opciones: colaborar y rescatar algo, o perder.
Creo que los abogados seguirán el mismo camino. Pasarán por una etapa difícil a medida que se automaticen las tareas más fáciles y rentables, el mercado de servicios legales se reducirá, y el trabajo que quede será el más complejo que la automatización no pueda resolver.
Sentí que se le daba demasiado peso a temas que no me parecían tan importantes, como el cuidado de las mascotas. Podía volver a modificar el resultado para adaptarlo a mí, pero por un servicio de 150 dólares esperaba más.
La empresa que tengo en mente da a entender en su material de marketing que es una solución completamente basada en IA, pero parece que en realidad no funciona solo con IA.
En casos extremos podría convertirse en un problema ético y recibir sanciones del colegio de abogados, pero ¿no suele tener solo consecuencias reputacionales? ¿Hay situaciones en las que se pueda exigir responsabilidad legal a un abogado por un contrato mal redactado?
Entre las áreas en las que los LLM pueden ayudar, el campo legal me parece especialmente prometedor. En 5 a 10 años —aunque viendo este paper, quizá ya estemos casi ahí— creo que podré conversar durante horas con un LLM “abogado” que tenga acceso a mis documentos fiscales, médicos, de seguros y matrimoniales, y recibir asesoría e información personalizada sin pagar 500 dólares la hora.
Se viene una ola de personas comunes con más conocimiento legal, y eso me entusiasma mucho.
Ya le hice preguntas a un LLM sobre licencias relacionadas con software y sus consecuencias legales, y pude obtener una base para preguntas de proyectos personales sin involucrar a un experto caro.
Eso sí, si hubiera mucho dinero en juego en la decisión, por supuesto usaría servicios profesionales. En estos temas, “por lo general correcto” no es suficiente.
Nuestro negocio principal es la generación de documentos legales, y funciona con lógica basada en reglas, no con IA. Como resultado del negocio principal ya tenemos documentos legales de los usuarios, así que estamos en una muy buena posición para crear una función auxiliar de chat con IA relacionada con esos documentos.
Recientemente desplegamos en producción una IA de recomendación de productos. Una parte es basada en reglas, y GPT-4 genera los textos personalizados de recomendación. Ahora estamos creando una función de chat con IA que ayude a los usuarios a entender varios documentos legales y nuestros servicios. Queremos reemplazar el soporte al cliente de primer nivel con este chat de IA, pero antes de enojarse, quisiera que sepan que el soporte actual de primer nivel es una IA basada en reglas muy mala.
El sitio web principal en finlandés es https://aatos.app. También tenemos algunos servicios para SE y DK, y recientemente abrimos primero en UK solo el servicio de firma electrónica.
Voy a reservar mi juicio sobre la posibilidad de aplicar los LLM al ámbito legal hasta que se los pruebe en tareas distintas de la revisión de documentos y contratos. En el área legal de grandes empresas, la revisión de contratos suele tercerizarse a cientos de recién graduados; se parece más a un trabajo de corrección que usa al mínimo las capacidades reales de un abogado, y sirve para aumentar los ingresos de la empresa.
Los servicios legales que suelen comprar las personas son cosas como casos de familia, casos penales y juicios de menor cuantía. No creo que un LLM del futuro cercano pueda hacerse cargo del análisis específico de hechos y circunstancias necesario para llevar un proceso penal por delitos graves. Tampoco he visto nada que demuestre que un LLM pueda abordar las dinámicas familiares individuales, caso por caso y enredadas que se requieren en un caso de custodia o en un divorcio disputado.
No hay razón para no aceptar los LLM como herramientas que usan los abogados, pero de ningún modo creo que sea una tecnología lista para incorporarse a la práctica real más allá del trabajo repetitivo de corrección legal.
Sin emociones, perspectivas personales y la jurisprudencia construida sobre ellas, no tengo muy claro cómo serían estos casos.
Lidero datos e IA en una corredora de seguros comerciales basada en tecnología. Estamos usando GPT-4 para crear una herramienta de análisis contractual profundo especializada en requisitos de seguros, y cuando estaba en Google también creé varias soluciones con LLM para el equipo legal de Google, desde clasificación de patentes hasta apoyo en discovery.
Los modelos de lenguaje son muy buenos para digerir texto legal y analizar situaciones. Pero muchas aplicaciones legales están vinculadas a decisiones importantes en las que no se puede fallar, como “¿esto está cubierto contractualmente por el programa de seguros actual?”. Por eso estamos construyendo productos con LLM para el ámbito legal bajo estos principios:
Deben ser herramientas human-in-the-loop usadas junto con expertos. Siempre que sea posible, deben diseñarse como apoyo a la toma de decisiones, no como automatización, y aun así pueden ahorrar muchísimo tiempo.
Se necesitan transparencia y citas. Si es una herramienta que se usa junto con una persona, debe tener mecanismos para generar confianza. Ya sea resaltando las cláusulas del documento que el LLM consultó o explicando por qué no se proporcionó parte del análisis, es importante citar la evidencia.
Hay que ajustarla para precisión, no para recall. En muchos casos de uso legales, los falsos positivos y las alucinaciones son especialmente malos, así que ajustar el modelo o el prompt con foco en la precisión ayuda a mitigarlos.
Me pregunto si “ajustarlo para precisión” se refiere a prompt engineering o si en realidad significa hacer fine-tuning de GPT-4.
Este paper no es que no tenga ningún mérito, pero parece una excusa para hacer afirmaciones exageradas sobre toda una profesión o “industria”. Quizá sea para ganar visibilidad y vender algo después.
La peor parte es que, como trabajo previo, cita un único documento en preprint. Ese documento en sí trata sobre razonamiento legal general, no sobre revisión de contratos. Por supuesto, parte de LegalBench es “interpretación” y se construyó sobre benchmarks existentes de revisión de contratos, pero podrían haber encontrado papers más relevantes.
La automatización de revisión de documentos legales, incluidas tareas de preguntas y respuestas, ha sido un área muy activa en procesamiento de lenguaje natural durante unos 20 años, y mucho más desde 2017. Como mínimo, herramientas como Kira y Luminance, aunque no estén basadas en LLM, se usan bastante en equipos legales y estudios jurídicos de todo el mundo. Así que los abogados ya conocen sus límites en la práctica.
Dicho eso, las herramientas tipo Kira no miden el rendimiento de los modelos más recientes ni usan benchmarks transparentes. En ese sentido, los resultados de benchmark de este paper son un aporte bienvenido para el uso de LLM.
Pero considerando el alcance limitado de revisar 10 documentos con un único playbook de revisión, no daba para hablar de “implicancias para la industria”. Tiene bastante pose, y muestra más que los autores no conocen bien esa industria que el futuro de la industria de servicios legales.
Si quieren saber sobre funciones y límites, también recomiendo estas lecturas ligeras pero útiles: https://kirasystems.com/science/, https://zuva.ai/blog/, https://www.atticusprojectai.org/cuad
Me pregunto qué argumentos legales inventarán los abogados para debilitar una tecnología que amenaza a su industria.
Los argumentos irán desde el riesgo de defensa ineficaz hasta “piensen en los niños”. Usarán cualquier cosa que ayude a proteger el monopolio.
Viendo los casos recientes en los que abogados investigaron con ChatGPT y lo usaron para ayudar a redactar escritos judiciales, y les salió mal, no me convence del todo el optimismo de los comentarios acá.
Crear un pequeño pipeline de generación→verificación no es trivial, pero tampoco imposible. Los casos que mencionas parecen una combinación de asociados muy flojos y una comprensión muy poor de lo que hace un LLM.
En teoría, el lenguaje jurídico debería estar estructurado de forma similar al código. Como tiene una estructura lógica, podría aplicarse a los LLM más fácilmente que otros lenguajes naturales.
Aunque hubo noticias iniciales de abogados que presentaron jurisprudencia “falsa”, la reestructuración de la profesión jurídica es cuestión de tiempo. En los despachos hay muchas personas que hacen tareas simples, como asistentes, y los LLM pueden hacer ese trabajo. Se les considera trabajadores de cuello blanco, pero desaparecerán.
Avanzará de una forma similar a la programación. Es como tener un socio junior más que necesita revisión, y puede encargarse del trabajo con documentos estándar.
No se puede confiar plenamente en ellos, pero tampoco se confía plenamente en un desarrollador junior, ¿no? Aun así, te llevan hasta el 80% del camino.
Es un espacio de problemas interesante. Hay una teoría jurídica de disrupción cultural que también podría funcionar aquí.
Supongamos que un servicio de litigio pro se de 99 dólares al mes hace dos cosas: 1) te enseña cómo mover todos tus activos a medios seguros. 2) al mismo tiempo, te permite defenderte por tu cuenta en litigio pro se. El objetivo no es ganar, sino atascar el sistema. Si, después de señalarle a la contraparte que estás legalmente en bancarrota, sigues presentando escritos y haces que todo sea lo más doloroso posible, quizá se den cuenta de que el proceso de apelación tomará 5 años y simplemente se rindan.
Es cierto que los abogados no quieren entregar documentos legales a servicios de plantillas, pero, sinceramente, podría bastar con ir a los tribunales, recopilar grandes volúmenes de escritos presentados y entrenar con eso. En esa estrategia no se necesitan necesariamente documentos excelentes ni teoría jurídica sólida. Basta con documentos que cumplan los requisitos de presentación del tribunal. Algo como: “Sí, tendremos que tomar declaración a las hijas de su empleada doméstica a 400 dólares la hora, y si tiene algún problema, podemos celebrar una audiencia”. Si suficiente gente hace esto, el sistema legal básicamente se detendrá y el poder volverá a la gente.
En memoria de Aaron Swartz, quien murió luchando por este tipo de problemas.
https://www.courts.ca.gov/12272.htm
[0]https://en.wikipedia.org/wiki/Paper_terrorism
“En todos los procesos penales, el acusado gozará del derecho a contar con la asistencia de un abogado para su defensa” — Sexta Enmienda de Estados Unidos.
Si un LLM llega a ser más competente que un abogado humano promedio, ¿esta cláusula seguiría exigiendo la asistencia de un abogado humano?
Quizá la característica más importante de un abogado no sea el conocimiento técnico.
Un LLM puede ayudar con cuestiones de hechos, etc., y, si se configura correctamente, incluso podría ofrecer garantías de privacidad más fuertes que un abogado. Por supuesto, no parece probable que eso ocurra en la práctica.