1 puntos por GN⁺ 2024-02-07 | 1 comentarios | Compartir por WhatsApp
  • Un experimento que comparó a los LLM con un abogado junior y con la subcontratación de procesos legales (LPO) en revisión de contratos, usando el criterio de un abogado senior como referencia correcta para evaluar en conjunto la determinación de cuestiones, la identificación de ubicación, la velocidad y el costo
  • En la determinación de cuestiones legales, GPT4-1106 obtuvo un F-score de 0.871, casi igual al 0.874 de LPO y por encima del 0.860 del abogado junior; pero en identificación de ubicación, LPO con 0.770 superó a GPT4-32k con 0.740
  • El experimento utilizó 10 contratos de compras anonimizados, excluyó los NDA por ser documentos cortos y no aptos para una evaluación compleja, e incluyó de forma equilibrada contratos bajo jurisdicción de EE. UU. y Nueva Zelanda
  • La velocidad de revisión fue ampliamente favorable a los LLM: el tiempo promedio fue de 56.17 minutos para el abogado junior y 201 minutos para LPO, frente a 4.70 minutos para GPT4-1106, 2.11 minutos para GPT4-32k y 0.73 minutos para Palm2 text-bison
  • El costo por contrato se calculó en 0.02 dólares para Claude 2.0 y Claude 2.1, y en 0.25 dólares para GPT4-1106, mostrando hasta 99.97% de ahorro de costos frente a los 74.26 dólares del abogado junior y 36.85 dólares de LPO

Qué se comparó en la revisión de contratos

  • El objetivo fue evaluar si los LLM superan o igualan a un abogado junior y a un LPO en tareas de revisión masiva de contratos en términos de precisión, velocidad y eficiencia de costos
  • Las tareas comparadas fueron determinar las cuestiones legales dentro de un contrato y localizar la posición de las cláusulas contractuales que influyeron en esa determinación
  • Se compararon los resultados de los LLM, el abogado junior y el LPO usando como referencia correcta las decisiones elaboradas por abogados senior
  • Las preguntas de investigación se resumieron en tres
    • Si los LLM son mejores que un abogado junior y un LPO en la determinación de cuestiones legales e identificación de ubicación dentro del contrato
    • Si los LLM pueden revisar contratos más rápido
    • Si los LLM pueden revisar contratos a menor costo

Conjunto de datos y diseño experimental

  • El conjunto de datos estuvo compuesto por 10 contratos de compras tomados de contratos legales reales y anonimizados para preservar la confidencialidad
  • Los contratos de compras se eligieron por ser un tipo de contrato revisado con frecuencia en la práctica legal, mientras que los NDA se excluyeron porque suelen ser breves y no se consideraron suficientes para evaluar la capacidad de un LLM de juzgar cuestiones legales complejas
  • Las jurisdicciones incluyeron de forma equilibrada contratos de EE. UU. y Nueva Zelanda
    • EE. UU. se trató como un sistema que combina derecho escrito y common law
    • Nueva Zelanda se trató como un sistema basado en common law
  • Cada contrato se analizó con una estructura de dos elementos: escenario del documento y playbook de revisión contractual
    • El escenario del documento proporcionó jurisdicción, historial, tamaño de la organización y contexto de los productos o servicios de las partes del contrato
    • El playbook de revisión ofreció una lista estandarizada de verificación derivada de casos reales
  • Los abogados senior determinaron si cada contrato cumplía criterios predefinidos y localizaron las partes específicas del contrato que influyeron en esa decisión
    • También se registró explícitamente cuando un criterio no se cumplía porque la información pertinente no estaba en el contrato
    • Los resultados de varios abogados senior se agregaron por criterio de mayoría
  • El estudio se realizó conforme a los estándares éticos de Onit Inc., incluyendo notificación a los participantes, derecho a retirarse, anonimización, desidentificación de los datos contractuales, participación del comité de ética y auditoría

Selección de modelos y prompts

  • Los modelos se eligieron considerando a los principales proveedores del campo de los LLM, los resultados de pruebas preliminares y el tamaño de la ventana de contexto
  • Los modelos incapaces de procesar más de 16,000 tokens fueron excluidos por considerarse poco aptos para manejar el contexto completo del contrato
    • LLaMA2 y Amazon Titan requerían dividir el documento en varias partes y repetir en cada una el escenario, el playbook y las cláusulas de definición
    • También se evaluaron técnicas como RAG, pero en la evaluación preliminar generaban discontinuidades en la comprensión del contexto contractual, por lo que no se consideraron adecuadas para compararlas con la comprensión de nivel humano de un abogado
  • Los modelos y configuraciones incluidos en la evaluación fueron los siguientes
    • GPT4 32k: temperature 0.2, entrada de 32,768 tokens, datos de entrenamiento hasta septiembre de 2021
    • GPT4-1106: temperature 0.2, entrada de 128,000 tokens, datos de entrenamiento hasta abril de 2023
    • GPT3.5-turbo-16k: temperature 0.2, entrada de 16,385 tokens, datos de entrenamiento hasta septiembre de 2021
    • Claude 2.1: temperature 0.2, entrada de 200,000 tokens, datos de entrenamiento hasta inicios de 2023
    • Claude 2.0: temperature 0.2, entrada de 100,000 tokens, datos de entrenamiento hasta inicios de 2023
    • Palm2 Text-bison-32k-2: temperature 0.2, entrada de 32,768 tokens, datos de entrenamiento hasta mediados de 2021
  • Los prompts se componían de rol, tarea y contexto
    • El rol hacía que el modelo siguiera una persona de abogado
    • La tarea consistía en revisar el contrato según criterios dados y determinar la existencia de cuestiones y su ubicación
    • El contexto se estructuró de forma similar a las instrucciones dadas a abogados, LPO y revisores de contratos, incluyendo lector objetivo del contrato, antecedentes de las partes y escenario de negociación

Precisión: cercanía en determinación de cuestiones, brecha en identificación de ubicación

  • El grado de acuerdo entre grupos de profesionales legales se evaluó con Cronbach’s Alpha
    • El acuerdo total entre todos los participantes fue alto, con 0.923366
    • El acuerdo entre abogados senior fue el más bajo, con 0.719308
    • El de los abogados junior fue 0.765058
    • El de LPO fue 1.0, mostrando coincidencia total en las respuestas
  • En la determinación de cuestiones legales, los mejores resultados por F-score fueron LPO y GPT4-1106
    • LPO: precision 0.933, recall 0.823, F-score 0.874
    • GPT4-1106: precision 0.835, recall 0.910, F-score 0.871
    • Abogado junior: precision 0.876, recall 0.845, F-score 0.860
    • Claude 2.0 y GPT4-32k registraron F-score de 0.817 y 0.820, respectivamente
    • GPT3.5 tuvo 0.657 y Palm2 text-bison 0.708, ambos más bajos
  • En la identificación de ubicación de cuestiones, LPO registró el F-score más alto
    • LPO: precision 0.915, recall 0.666, F-score 0.770
    • GPT4-32k: precision 0.847, recall 0.660, F-score 0.740
    • Claude 2.1: precision 0.911, recall 0.569, F-score 0.701
    • GPT4-1106: precision 0.857, recall 0.575, F-score 0.686
    • Abogado junior: precision 0.866, recall 0.542, F-score 0.667
    • Palm2 text-bison tuvo el F-score más bajo, con 0.452
  • Los LLM pueden igualar o superar al abogado junior y al LPO en la determinación de cuestiones, pero en la tarea de señalar con precisión la ubicación de las cláusulas hay grandes diferencias entre modelos y no siempre superan a los profesionales humanos

Velocidad, costo y limitaciones de adopción

  • El tiempo promedio de revisión por contrato fue mucho menor en los LLM que en los profesionales humanos
    • Abogado senior: 43.46 minutos
    • Abogado junior: 56.17 minutos
    • LPO: 201.00 minutos
    • GPT4-1106: 4.70 minutos
    • GPT4-32k: 2.11 minutos
    • GPT3.5: 1.44 minutos
    • Claude 2.1: 2.05 minutos
    • Claude 2.0: 1.63 minutos
    • Palm2 text-bison: 0.73 minutos
  • Se calculó que Palm2 text-bison, el LLM más rápido, completó la revisión contractual 276 veces más rápido que LPO y 77 veces más rápido que un abogado junior
  • La configuración, prueba, ajuste fino y validación del system prompt del LLM tomó en promedio 16 horas, un nivel similar al tiempo usado para dar instrucciones equivalentes a un abogado junior o a un LPO
  • El costo promedio por contrato mostró una gran diferencia entre profesionales humanos y LLM
    • Abogado senior: 75.92 dólares
    • Abogado junior: 74.26 dólares
    • LPO: 36.85 dólares
    • GPT4-1106: 0.25 dólares
    • GPT4-32k: 1.24 dólares
    • GPT3.5: 0.05 dólares
    • Claude 2.1: 0.02 dólares
    • Claude 2.0: 0.02 dólares
    • Palm2 text-bison: 0.03 dólares
  • El cálculo de costos se basó en el tiempo promedio requerido y la tarifa por hora de los profesionales humanos, y en el número promedio de tokens de entrada y salida y el precio por token para los LLM
    • En Palm2 text-bison, el cálculo se hizo por cantidad de caracteres y no por tokens
  • Los LLM con bajo desempeño en identificación de ubicación de cuestiones pueden tener limitaciones para marcar contratos de forma autónoma, por lo que en trabajo legal la selección del modelo es tan importante como el rendimiento y el costo

1 comentarios

 
GN⁺ 2024-02-07
Opiniones en Hacker News
  • Manejo una startup de generación de contratos legales que convierte contratos redactados por abogados en plantillas, y también probé crear algunas funciones de análisis con GPT para que personas comunes puedan leer contratos y hacer preguntas.
    En la revisión de contratos, GPT fue más fuerte en el análisis de documentos que en la generación de documentos, y este paper también respalda ese punto. Sin embargo, al probar varias startups de revisión de documentos con IA, la mayoría se desmoronaba en cuanto uno empezaba a exigir respuestas concretas. Este paper parece haber tratado más bien de encontrar cláusulas relevantes, no de una conversación del tipo abogado-cliente.
    Como GPT no tiene responsabilidad legal aunque dé una respuesta incorrecta, resulta útil cuando una persona inteligente investiga por su cuenta. Es parecido a cómo antes una persona inteligente podía investigar por su cuenta con Google.
    Sobre la generación de contratos, creo que en la mayoría de los casos ayuda más un repositorio de contratos estándar bien redactados y revisados que hacer que GPT genere cada vez un contrato único desde cero. Los abogados se aferran a los contratos, y también fue muy difícil encontrar abogados que nos redactaran contratos para convertirlos en plantillas. Al final, porque eso reduce una futura fuente de ingresos para ellos y para su comunidad profesional. Entrenar GPT-4 costó cientos de millones de dólares, pero si se hubieran gastado solo 10 millones de dólares en crear un repositorio de contratos bien revisados, habría sido más útil que entrenar un modelo de generación de contratos con el mismo dinero.
    La gente hace preguntas bastante variadas sobre lo que quiere hacer con los documentos, y GPT todavía no lo hacía bien. Parece que, en el futuro cercano, todavía habrá trabajo para abogados.

    • El fenómeno de que los abogados no quieran soltar los contratos también se ve en otras profesiones, y es especialmente marcado en áreas que requieren una gran inversión previa en educación.
      Por ejemplo, hace unos 20 años, al menos donde vivo, los arquitectos tampoco querían crear diseños para venderlos barato a muchas personas. Pensaban que esos diseños reducirían el mercado de productos arquitectónicos. Pero es fácil ver que la mayoría de la gente realmente no necesita un diseño único.
      Al final, al mercado no le importó demasiado, y en cuanto alguien pudo crear una biblioteca de diseños usable y un modelo de negocio, el problema se resolvió solo. Desde el punto de vista de los arquitectos, solo quedaron dos opciones: colaborar y rescatar algo, o perder.
      Creo que los abogados seguirán el mismo camino. Pasarán por una etapa difícil a medida que se automaticen las tareas más fáciles y rentables, el mercado de servicios legales se reducirá, y el trabajo que quede será el más complejo que la automatización no pueda resolver.
    • Hace poco hice un testamento con Willful y el resultado fue bastante decepcionante. La plantilla era demasiado rígida: incluso condiciones que obviamente deberían poder expresarse, como “si ocurre X, entonces Y; si no, Z”, eran difíciles, y la división de bienes no permitía otra cosa que porcentajes sobre el total.
      Sentí que se le daba demasiado peso a temas que no me parecían tan importantes, como el cuidado de las mascotas. Podía volver a modificar el resultado para adaptarlo a mí, pero por un servicio de 150 dólares esperaba más.
    • Siento que con los LLM generando código pasa más o menos lo mismo. Son útiles como punto de partida, pero no más que eso. Por ahora, los programadores todavía tenemos trabajo.
    • La razón por la que la revisión de contratos con IA se desmorona cuando se le piden respuestas concretas podría ser que, en realidad, la revisión final se “subcontrata” a abogados reales de Utah.
      La empresa que tengo en mente da a entender en su material de marketing que es una solución completamente basada en IA, pero parece que en realidad no funciona solo con IA.
    • Se dijo que GPT no tiene responsabilidad legal aunque dé una respuesta incorrecta, pero yo entendía que los abogados tampoco tienen responsabilidad legal simplemente por dar una respuesta incorrecta.
      En casos extremos podría convertirse en un problema ético y recibir sanciones del colegio de abogados, pero ¿no suele tener solo consecuencias reputacionales? ¿Hay situaciones en las que se pueda exigir responsabilidad legal a un abogado por un contrato mal redactado?
  • Entre las áreas en las que los LLM pueden ayudar, el campo legal me parece especialmente prometedor. En 5 a 10 años —aunque viendo este paper, quizá ya estemos casi ahí— creo que podré conversar durante horas con un LLM “abogado” que tenga acceso a mis documentos fiscales, médicos, de seguros y matrimoniales, y recibir asesoría e información personalizada sin pagar 500 dólares la hora.
    Se viene una ola de personas comunes con más conocimiento legal, y eso me entusiasma mucho.

    • No confiaría ciegamente en lo que diga un LLM, pero por lo general estará en lo correcto y, como mínimo, puede darme el vocabulario de exploración necesario para seguir investigando. O puedo seguir haciendo preguntas y profundizar.
      Ya le hice preguntas a un LLM sobre licencias relacionadas con software y sus consecuencias legales, y pude obtener una base para preguntas de proyectos personales sin involucrar a un experto caro.
      Eso sí, si hubiera mucho dinero en juego en la decisión, por supuesto usaría servicios profesionales. En estos temas, “por lo general correcto” no es suficiente.
    • Estamos construyendo algo así ahora mismo.
      Nuestro negocio principal es la generación de documentos legales, y funciona con lógica basada en reglas, no con IA. Como resultado del negocio principal ya tenemos documentos legales de los usuarios, así que estamos en una muy buena posición para crear una función auxiliar de chat con IA relacionada con esos documentos.
      Recientemente desplegamos en producción una IA de recomendación de productos. Una parte es basada en reglas, y GPT-4 genera los textos personalizados de recomendación. Ahora estamos creando una función de chat con IA que ayude a los usuarios a entender varios documentos legales y nuestros servicios. Queremos reemplazar el soporte al cliente de primer nivel con este chat de IA, pero antes de enojarse, quisiera que sepan que el soporte actual de primer nivel es una IA basada en reglas muy mala.
      El sitio web principal en finlandés es https://aatos.app. También tenemos algunos servicios para SE y DK, y recientemente abrimos primero en UK solo el servicio de firma electrónica.
    • También parece posible un LLM que reduzca gastos. Uno puede imaginar un LLM que revise todo el historial de consumo, conozca las leyes, beneficios, asociaciones y promociones vigentes, y sugiera o ejecute cosas como cambiar de proveedor eléctrico o de aseguradora, o comprar al por mayor en otra tienda.
    • No es un problema exclusivo del derecho. Subí mis resultados de análisis de sangre y datos de 23andMe a ChatGPT, y los analizó mejor que mi médico.
    • Creo que muchas startups están construyendo exactamente eso, pero sinceramente no tengo grandes expectativas. Todos siguen atados al límite de tokens, y los métodos típicos para sortearlo, como la generación aumentada por recuperación (RAG) y los grafos de conocimiento, pueden acercarse a lo que uno quiere, pero no lo suficiente como para ser realmente útiles.
  • Voy a reservar mi juicio sobre la posibilidad de aplicar los LLM al ámbito legal hasta que se los pruebe en tareas distintas de la revisión de documentos y contratos. En el área legal de grandes empresas, la revisión de contratos suele tercerizarse a cientos de recién graduados; se parece más a un trabajo de corrección que usa al mínimo las capacidades reales de un abogado, y sirve para aumentar los ingresos de la empresa.
    Los servicios legales que suelen comprar las personas son cosas como casos de familia, casos penales y juicios de menor cuantía. No creo que un LLM del futuro cercano pueda hacerse cargo del análisis específico de hechos y circunstancias necesario para llevar un proceso penal por delitos graves. Tampoco he visto nada que demuestre que un LLM pueda abordar las dinámicas familiares individuales, caso por caso y enredadas que se requieren en un caso de custodia o en un divorcio disputado.
    No hay razón para no aceptar los LLM como herramientas que usan los abogados, pero de ningún modo creo que sea una tecnología lista para incorporarse a la práctica real más allá del trabajo repetitivo de corrección legal.

    • Los humanos tampoco suelen manejar bien dinámicas familiares complejas como las de custodia o divorcio. A juzgar por los resultados, parece que la perspectiva personal y las emociones del juez pesan mucho en estos casos.
      Sin emociones, perspectivas personales y la jurisprudencia construida sobre ellas, no tengo muy claro cómo serían estos casos.
  • Lidero datos e IA en una corredora de seguros comerciales basada en tecnología. Estamos usando GPT-4 para crear una herramienta de análisis contractual profundo especializada en requisitos de seguros, y cuando estaba en Google también creé varias soluciones con LLM para el equipo legal de Google, desde clasificación de patentes hasta apoyo en discovery.
    Los modelos de lenguaje son muy buenos para digerir texto legal y analizar situaciones. Pero muchas aplicaciones legales están vinculadas a decisiones importantes en las que no se puede fallar, como “¿esto está cubierto contractualmente por el programa de seguros actual?”. Por eso estamos construyendo productos con LLM para el ámbito legal bajo estos principios:
    Deben ser herramientas human-in-the-loop usadas junto con expertos. Siempre que sea posible, deben diseñarse como apoyo a la toma de decisiones, no como automatización, y aun así pueden ahorrar muchísimo tiempo.
    Se necesitan transparencia y citas. Si es una herramienta que se usa junto con una persona, debe tener mecanismos para generar confianza. Ya sea resaltando las cláusulas del documento que el LLM consultó o explicando por qué no se proporcionó parte del análisis, es importante citar la evidencia.
    Hay que ajustarla para precisión, no para recall. En muchos casos de uso legales, los falsos positivos y las alucinaciones son especialmente malos, así que ajustar el modelo o el prompt con foco en la precisión ayuda a mitigarlos.

    • ¿Alguna pista sobre cómo hacer que GPT-4 incluya citas? ¿Es algo como usar un prompt del estilo “vuelve a citar literalmente el pasaje que estás citando” y luego ubicarlo en el texto original para resaltarlo?
      Me pregunto si “ajustarlo para precisión” se refiere a prompt engineering o si en realidad significa hacer fine-tuning de GPT-4.
  • Este paper no es que no tenga ningún mérito, pero parece una excusa para hacer afirmaciones exageradas sobre toda una profesión o “industria”. Quizá sea para ganar visibilidad y vender algo después.
    La peor parte es que, como trabajo previo, cita un único documento en preprint. Ese documento en sí trata sobre razonamiento legal general, no sobre revisión de contratos. Por supuesto, parte de LegalBench es “interpretación” y se construyó sobre benchmarks existentes de revisión de contratos, pero podrían haber encontrado papers más relevantes.
    La automatización de revisión de documentos legales, incluidas tareas de preguntas y respuestas, ha sido un área muy activa en procesamiento de lenguaje natural durante unos 20 años, y mucho más desde 2017. Como mínimo, herramientas como Kira y Luminance, aunque no estén basadas en LLM, se usan bastante en equipos legales y estudios jurídicos de todo el mundo. Así que los abogados ya conocen sus límites en la práctica.
    Dicho eso, las herramientas tipo Kira no miden el rendimiento de los modelos más recientes ni usan benchmarks transparentes. En ese sentido, los resultados de benchmark de este paper son un aporte bienvenido para el uso de LLM.
    Pero considerando el alcance limitado de revisar 10 documentos con un único playbook de revisión, no daba para hablar de “implicancias para la industria”. Tiene bastante pose, y muestra más que los autores no conocen bien esa industria que el futuro de la industria de servicios legales.
    Si quieren saber sobre funciones y límites, también recomiendo estas lecturas ligeras pero útiles: https://kirasystems.com/science/, https://zuva.ai/blog/, https://www.atticusprojectai.org/cuad

    • ¿Hay algún paper específico que recomiendes? Los links llevan a blogs con muchos papers.
  • Me pregunto qué argumentos legales inventarán los abogados para debilitar una tecnología que amenaza a su industria.

    • Al contrario, creo que volverse abogado va a ser más caro. Ahora se necesitarán servidores para correr razonamiento de IA, desarrolladores y servicios de terceros.
    • Al menos en Estados Unidos, los abogados controlan el gobierno. Espero que pronto salga una ley que prohíba o restrinja severamente el uso de IA en el campo legal.
      Los argumentos irán desde el riesgo de defensa ineficaz hasta “piensen en los niños”. Usarán cualquier cosa que ayude a proteger el monopolio.
    • No es un argumento forzado; se llama ejercicio no autorizado de la abogacía, y es un delito.
    • El copyright parece ser la principal vía de ataque.
  • Viendo los casos recientes en los que abogados investigaron con ChatGPT y lo usaron para ayudar a redactar escritos judiciales, y les salió mal, no me convence del todo el optimismo de los comentarios acá.

    • La tecnología está bien. La educación y alfabetización de los usuarios generales no técnicos para entender sus fallas y límites es otro tema.
    • Todos ellos fueron idiotas que ni siquiera quisieron pagar GPT-4. Cayeron en alucinaciones.
    • Eso fue un error de principiante. No haber verificado si la jurisprudencia realmente existía.
      Crear un pequeño pipeline de generación→verificación no es trivial, pero tampoco imposible. Los casos que mencionas parecen una combinación de asociados muy flojos y una comprensión muy poor de lo que hace un LLM.
  • En teoría, el lenguaje jurídico debería estar estructurado de forma similar al código. Como tiene una estructura lógica, podría aplicarse a los LLM más fácilmente que otros lenguajes naturales.
    Aunque hubo noticias iniciales de abogados que presentaron jurisprudencia “falsa”, la reestructuración de la profesión jurídica es cuestión de tiempo. En los despachos hay muchas personas que hacen tareas simples, como asistentes, y los LLM pueden hacer ese trabajo. Se les considera trabajadores de cuello blanco, pero desaparecerán.
    Avanzará de una forma similar a la programación. Es como tener un socio junior más que necesita revisión, y puede encargarse del trabajo con documentos estándar.
    No se puede confiar plenamente en ellos, pero tampoco se confía plenamente en un desarrollador junior, ¿no? Aun así, te llevan hasta el 80% del camino.

    • Estoy de acuerdo hasta cierto punto en que avanzará de forma similar a la programación, pero por eso mismo me confunde más. Al menos en HN se ve con frecuencia que la IA va a sacudir la profesión jurídica y dejar sin trabajo a abogados en masa, pero casi no se ve que la industria de la programación vaya a cambiar de la misma manera.
  • Es un espacio de problemas interesante. Hay una teoría jurídica de disrupción cultural que también podría funcionar aquí.
    Supongamos que un servicio de litigio pro se de 99 dólares al mes hace dos cosas: 1) te enseña cómo mover todos tus activos a medios seguros. 2) al mismo tiempo, te permite defenderte por tu cuenta en litigio pro se. El objetivo no es ganar, sino atascar el sistema. Si, después de señalarle a la contraparte que estás legalmente en bancarrota, sigues presentando escritos y haces que todo sea lo más doloroso posible, quizá se den cuenta de que el proceso de apelación tomará 5 años y simplemente se rindan.
    Es cierto que los abogados no quieren entregar documentos legales a servicios de plantillas, pero, sinceramente, podría bastar con ir a los tribunales, recopilar grandes volúmenes de escritos presentados y entrenar con eso. En esa estrategia no se necesitan necesariamente documentos excelentes ni teoría jurídica sólida. Basta con documentos que cumplan los requisitos de presentación del tribunal. Algo como: “Sí, tendremos que tomar declaración a las hijas de su empleada doméstica a 400 dólares la hora, y si tiene algún problema, podemos celebrar una audiencia”. Si suficiente gente hace esto, el sistema legal básicamente se detendrá y el poder volverá a la gente.
    En memoria de Aaron Swartz, quien murió luchando por este tipo de problemas.

  • “En todos los procesos penales, el acusado gozará del derecho a contar con la asistencia de un abogado para su defensa” — Sexta Enmienda de Estados Unidos.
    Si un LLM llega a ser más competente que un abogado humano promedio, ¿esta cláusula seguiría exigiendo la asistencia de un abogado humano?

    • Los gobiernos de todo el mundo harán todo lo posible para que la gente acepte esta propuesta como verdadera y, en particular, para que usen LLM en lugar de abogados humanos en la defensa penal. ¿Por qué será?
      Quizá la característica más importante de un abogado no sea el conocimiento técnico.
    • Los usos son distintos. Un abogado puede encargarse de cosas como la gestión del juicio.
      Un LLM puede ayudar con cuestiones de hechos, etc., y, si se configura correctamente, incluso podría ofrecer garantías de privacidad más fuertes que un abogado. Por supuesto, no parece probable que eso ocurra en la práctica.
    • Irónicamente, tal vez sería mejor hacerle esta pregunta a GPT.
    • Sí. Los LLM no son gratis, y todavía se necesita un experto que verifique sus resultados.
    • Eso le corresponde decidirlo a los tribunales. Es perfectamente razonable suponer que llegará un caso así; la única cuestión es qué tan pronto ocurrirá.