- Un experimento de campo de Harvard Digital Data Design Institute y BCG evaluó cuánto cambia la IA la productividad y la calidad de los trabajadores del conocimiento en 758 consultores
- Las tareas se diseñaron para medir aplicabilidad real al trabajo, más allá de benchmarks simples, e incluían creatividad, pensamiento analítico, redacción y capacidad de persuasión, cercanas al trabajo real de los consultores
- ChatGPT-4 aumentó en tareas adecuadas para IA la velocidad de trabajo en más de 25%, el desempeño según evaluación humana en más de 40% y la tasa de finalización en más de 12%
- No todas las tareas obtienen el mismo efecto; la principal limitación fue una frontera tecnológica irregular donde se separan con claridad las áreas fuertes y débiles
- El uso práctico se divide entre Centaurs, que reparten el trabajo, y Cyborgs, que integran la IA en su flujo de trabajo; hay que evaluar la combinación entre humanos e IA según cada tarea
Experimento de campo con consultores de BCG
- Karim Lakhani, de Harvard Digital Data Design Institute, junto con Boston Consulting Group (BCG), evaluó el impacto de la IA en la productividad y la calidad de los trabajadores del conocimiento
- El experimento incluyó a 758 consultores, equivalentes al 7% del personal de contribución individual de BCG
- Las tareas reflejaban el alcance del trabajo cotidiano de los consultores
-
Creatividad
-
Pensamiento analítico
-
Habilidad de redacción
- Capacidad de persuasión
-
Mejora del desempeño y límites
- En las áreas de tareas donde la IA funciona bien, ChatGPT-4 elevó de forma importante los resultados
- La velocidad de trabajo aumentó en más de 25%
- El desempeño según criterios de evaluación humana aumentó en más de 40%
- La tasa de finalización de tareas aumentó en más de 12%
- En cambio, el rendimiento de la IA no es uniforme en todas las tareas
- En algunos trabajos produce resultados sobresalientes, pero en otros se queda corta
- Esta diferencia se resume como una jagged technological frontier
Dos formas de uso observadas en el trabajo del conocimiento
- Los usuarios de IA se dividieron en dos grandes patrones
- Centaurs: reparten y delegan tareas entre la persona y la IA
- Cyborgs: integran la IA en su propio flujo de trabajo
- Más que pensar en una dicotomía entre usar o no usar IA, lo importante es evaluar qué valor aporta la combinación entre humanos e IA en cada flujo de trabajo
1 comentarios
Opiniones de Hacker News
Estas tareas parecen hechas a la medida de GPT: hacer que proponga 10 ideas de zapatos, segmentación de mercado, un comunicado de prensa y una nota inspiradora para empleados, en áreas como creatividad, pensamiento analítico, escritura y persuasión.
Respuesta de GPT a la primera tarea: https://chat.openai.com/share/db7556f7-6036-4b3d-a61a-9cd253...
Las alucinaciones de GPT dichas con total seguridad son casi indistinguibles del material típico de consultoría de gestión.
El cliente no quiere “10 ideas”, sino “10 ideas valiosas basadas en entender el negocio y el mercado”. Si un consultor de gestión responde a esta pregunta con algo como “zapatos náuticos”, no va a conservar al cliente por mucho tiempo.
Del mismo modo, en ingeniería de software también podrías decir que si pides “escríbeme 10 líneas de código”, no se distingue del código que ChatGPT produce todos los días.
Mi empleador contrató varias veces a McKinsey, conocida por reclutar gente de HYP, y los resultados fueron, siendo generosos, deficientes. Mi experiencia con este tipo de instituciones ha sido en general parecida.
Sé que es solo anecdótico, pero siento que en este tipo de estudios hay mucho sesgo de confirmación.
Este estudio enterró lo importante. Los LLM fueron mejores en algunas tareas, pero en otras en realidad empeoraron el desempeño.
La primera tarea era una tarea generalista, lo que el estudio llama “dentro de la frontera”, así que no sorprende que el rendimiento haya mejorado. Consistía en investigar un ámbito bien definido sin requerir un conocimiento sólido del dominio, algo que encaja con las fortalezas de los LLM. Gran parte del trabajo generalista que hacen los consultores junior al inicio de su carrera, en roles similares a analistas de negocio, también es de este tipo.
Los LLM son fuertes en este tipo de investigación general porque han generalizado mucha información, pero esa misma generalización también es su debilidad. Es como un periodista en un campo de investigación. Cuando lees el periódico sientes que obtienes información valiosa, pero en cuanto lees un artículo sobre un tema que conoces bien, te das cuenta de que el análisis tiene muchas fallas y de que no entienden el tema a tu nivel.
La segunda tarea, “fuera de la frontera”, requería análisis de hojas de cálculo, entrevistas y un análisis más profundo respaldado por evidencia, justo tareas en las que los LLM actuales son débiles. Por eso el grupo sin LLM obtuvo 84.5%, mientras que los usuarios de LLM solo llegaron a 60~70.6%.
La conclusión es que los LLM son excelentes para la investigación generalizada, pero menos adecuados para tareas de análisis especializado.
Cuando hago preguntas de programación, ChatGPT alucina alrededor de un 20%, y como tengo suficiente experiencia puedo darme cuenta. Supongo que cuando le pregunto sobre otros campos también debe haber, como mínimo, esa cantidad de alucinaciones y desinformación.
Esto es gracioso. La capacidad de escritura de GPT-3/4 también es impresionante, pero lo más impactante es cuánta fanfarronería hay en la escritura humana.
El “consultor de negocios” es la cúspide de los roles que requieren ese tipo de escritura inflada, y ChatGPT puede comportarse más como consultor de negocios que los mejores consultores de negocios.
En el trabajo, a veces hay que inflar una idea o unos datos concisos hasta convertirlos en documentos de varias páginas o en un deck de diapositivas para que te tomen en serio. Así los demás reconocen de inmediato que “se le dedicó esfuerzo”.
Tal vez el rol que mejor le queda ahora a ChatGPT sea tomar un texto conciso y expandirlo en un documento mucho más largo y lleno de relleno. Quien lo recibe soportará el documento o las diapositivas interminables, reconocerá que “se hizo el trabajo” y luego lo volverá a meter en ChatGPT para que resuma solo los puntos originales.
Cuando decimos que “los LLM pueden generar texto”, estamos pintando con una brocha tan ancha como una autopista de 10 carriles. Parece que tenemos un vocabulario bastante limitado para describir qué es realmente la escritura y qué categorías y niveles tiene.
Por ejemplo, en correos amables, spam inspiracional estilo LinkedIn y lenguaje corporativo, es divertido —y para mí totalmente previsible— que GPT supere a los humanos desde el primer intento. En cambio, si le pides el siguiente libro de Game of Thrones o literatura bien escrita, se viene abajo: resulta aburrido, genérico, lleno de clichés y de tramas y personajes vacíos.
Ahora necesitamos mapear el terreno de la escritura en un espacio conceptual mejor. En este momento parece que ni siquiera podemos distinguir diferencias equivalentes a las que hay entre la aritmética y el álgebra abstracta.
Los LLM son sorprendentemente buenos en tareas de lenguaje. La mayor parte de lo que antes la gente llamaba procesamiento de lenguaje natural ahora está casi arrasada. Resúmenes, preguntas y respuestas, análisis de sentimiento, etc., están a un nivel realmente asombroso.
También son muy fuertes en tareas generativas donde los límites de los “hechos” no son nítidos y no hace falta que todo encaje densamente como en una novela de Pynchon. Cuentos cortos, artículos de opinión y copies de producto son un amplificador de productividad capaz de sacar 20 ideas como prototipos en un minuto.
Pero su punto actual llega más o menos hasta ahí. Elevan el lenguaje natural a un espacio latente para crear conceptos separables hasta cierto punto, hacen algo parecido a una transformación afín y luego lo bajan de nuevo.
Como computadora es tremendamente impresionante, pero si la pregunta es si de verdad puede reemplazar a un costoso graduado de Penn, probablemente por lo que se está pagando sea otra cosa y no brillantes insights de estrategia de producto.
Algo así como que, aunque cambies un poco un dibujo de un hombre árbol enojado, probablemente siga siendo un buen dibujo de un hombre árbol enojado.
Si la salida parece aceptable es porque una persona llena las grietas con su cerebro humano. La gente reconoce la salida basura, resuelve pequeñas ambigüedades y corrige inconscientemente errores menores de hechos y de lógica.
Pero no metería directamente el resultado de un LLM en otro programa de computadora. Eso excluye la mayoría de las tareas tradicionales de procesamiento de lenguaje natural.
En general coincido en que pueden hacer bastante bien estas tareas, pero su rendimiento todavía no alcanza para correrlos sobre datasets grandes.
Pero enseguida te dicen que no lo uses tal cual porque es “poco ético”.
Esto dice más sobre lo inútiles que son los consultores de BCG.
Quien no tiene experiencia en escritura o edición piensa que los LLM van a revolucionar ese campo. Los escritores y editores reales ven una salida de LLM una sola vez y se dan cuenta de que corregirla lleva casi lo mismo que escribirla desde cero, así que prácticamente no tiene valor.
Del mismo modo, la gente que no sabe programar o que entiende superficialmente el tema, en especial los gerentes que quieren parecer técnicos, ve una salida de LLM y cree que está lista para desplegarse; pero un buen programador ve tantos problemas grandes y chicos que no vale la pena corregirla en lugar de escribirla desde cero.
En un equipo de 20 a 30 ingenieros suele haber solo un ingeniero de esos que te hacen pensar “¿por qué está con nosotros?”, con gran capacidad técnica y muy buen trato con la gente. Pero por más agradable que sea, el trabajo es trabajo, y él solo da pistas sobre cómo debería gestionarse la empresa. También juega videojuegos, tiene familia y una vida, así que no le interesa hacia dónde va la empresa ni la gestión ni las responsabilidades innecesarias. Además, los de arriba lo ven solo como “ingeniero”, no como “manager”.
Cuando el resto de los ingenieros y managers también adoptan la actitud de “no es mi problema”, aparece un vacío raro de comunicación. El ingeniero que trabaja cerca del producto no quiere hablar con el manager por miedo a que le digan “si tanto sabes, hazlo tú”, y el manager no quiere hablar con el ingeniero por miedo a que le digan “si tanto te interesa, hazlo tú”.
En esa distancia cada vez mayor entre managers e ingenieros entran los consultores de management. Gracias a la flexibilidad que les otorga la alta dirección, pueden ir y venir entre ingenieros y managers, hablar con cualquiera y no quedar atados al “entonces hazlo tú”. Entregan un informe y en un mes se llevan el salario anual de un manager o un ingeniero.
Si lo miramos en serio, hay muchas cosas que la empresa sabe que debería hacer, pero nadie dice. Porque decirlas aumenta el trabajo y también el riesgo. Un “buen” consultor de management encuentra esas cosas “que no queremos hacer pero hay que hacer”, se las reporta a la alta dirección, y la dirección crea el sistema para que se hagan. Si alguien necesita un consultor de management, puede contratarme. Les diré 20 formas en las que su empresa es mediocre, y 18 de ellas las generará ChatGPT.
Es gracioso que en cualquier hilo puedas predecir este tipo de comentario. Si se sigue usando “eso dice más sobre [insertar]”, la expresión misma pierde significado. ¿No podrían decir algo con más sentido?
No me sorprende. GPT es aterradoramente bueno y encaja muy bien con la programación.
Le pido a GPT-4 que escriba código y pruebo si funciona, pero rara vez copio y pego ese código tal cual. Lo reescribo yo mismo para que encaje con el contexto del codebase. Aun así, ahorra mucho tiempo cuando no estoy seguro de cómo hacerlo.
A veces no me gustan sus sugerencias, pero eso también sirve. Muchas veces hace que el espacio del problema quede más claro en mi cabeza.
Le di una tarea bastante difícil para la que no podía encontrar respuesta en Google y ni siquiera estaba seguro de que fuera posible. El requisito era: “Dado un objeto de Python, dame una lista de las funciones que recibieron ese objeto como argumento. No se puede modificar el código existente; solo se puede cambiar la estructura del objeto”.
Al principio me dio ideas que no encajaban bien, como modificar funciones, envolverlas con decorators o inspeccionar el stack actual, pero después de varios intercambios propuso resolverlo interceptando el tracer de Python, y efectivamente funcionó.
Lo sorprendente es que no creo que haya visto algo así en sus datos de entrenamiento, y aun así ensambló las piezas. Fue casi de nivel humano. Cuando le pregunté, también explicó con facilidad la limitación de que podía interferir con debuggers.
Los ejemplos de la página 10 del original son de este estilo: proponer 10 o más ideas de zapatos nuevos dirigidos a mercados o deportes desatendidos, segmentar el mercado de la industria del calzado según los usuarios, redactar un borrador de comunicado de prensa para promocionar el producto, escribir un memo inspirador para empleados explicando por qué es mejor que los productos de la competencia.
Personalmente, me parece que tiene muy poco valor real.
No digo que tú seas ese tipo de programador, pero definitivamente hace posible a ese tipo de programador.
Como exconsultor, me surge la pregunta obvia: ¿qué pasaría si se elimina por completo al consultor y GPT-4 trabaja directamente para el cliente?
Para que un cliente encargue trabajo a un consultor, tiene que explicar los requisitos, revisar los resultados, dar feedback y participar en algunas reuniones.
Pero si GPT-4 vuelve a los consultores mucho mejores, parece que también podría reemplazar su trabajo. Si a eso se suma la reducción de costos de comunicación por no trabajar con un grupo externo, ¿por qué el cliente no eliminaría el costo y la carga de gestión de consultores externos y se quedaría directamente con el beneficio?
Sobre todo si el cliente ya es experto en el dominio y solo necesita más manos. Por ejemplo, un brand manager de marketing conoce bien su producto y su marketing, pero puede trabajar con consultores de marketing porque necesita más recursos por limitaciones de personal interno.
Me pregunto si BCG pensó hasta las últimas consecuencias lo que implica participar en este estudio. De “ayuda a que los consultores ayuden mejor a los clientes” a “ayuda directamente a los clientes y demuestra que no necesitan tanto a los consultores” parece haber un paso muy corto.
Especialmente si el cliente contrata a un pasante y le da GPT-4.
Desde el punto de vista de un CEO, puede llamarlos, pagarles mucho dinero para que hagan planes y estrategias, y luego, si sale bien, llevarse el mérito; si sale mal, decir “trabajé estrechamente con los expertos de McKinsey, así que no es mi culpa”.
HN es pésimo prediciendo. Hace apenas unos meses abundaban los comentarios que afirmaban con total seguridad que los LLM no eran más que loros estocásticos y que no lograrían nada.
“No puedo quitarme de la cabeza que el próximo invierno de la IA está a la vuelta de la esquina”, sí, claro.
[0] https://news.ycombinator.com/item?id=23886325
Y si lees el artículo, el nivel de los resultados del que hablamos es casi exactamente ese: 10 o más ideas de zapatos nuevos para mercados o deportes desatendidos, segmentación del mercado de la industria del calzado, comunicados de prensa para promocionar productos, memos inspiradores para empleados sobre por qué son mejores que la competencia, y cosas por el estilo.
Además, en la segunda tarea, el grupo sin LLM lo hizo mucho mejor.
Si hice una predicción absurdamente mala, eso significa que mi modelo sobre el tema estaba desalineado y necesita corregirse.
Pero si sigo prediciendo sin corregir el modelo en absoluto, hay un problema grande.
Con el tiempo, mucho trabajo de oficina se optimizará con servicios como GPT.
Tenía suficiente sensibilidad técnica como para saber que muchas de las tareas de oficina que hago son repetibles y se pueden manejar con scripts, pero no tanta como para escribir los scripts yo mismo. Gracias a ChatGPT pude crearlos, y me tomó unas 15 a 20 horas dejarlos funcionando perfectamente.
Sabía apenas un poco de scripting en Python y no conocía en absoluto cosas como pandas o xlswriter, pero pude crear algo que me ahorra 20 a 25 horas por semana.
En HN hay mucha gente que programa bien, así que creo que subestiman el mundo que servicios como ChatGPT abren para quienes no programan. Por otro lado, también puede hacer que la gente sin curiosidad aprenda menos. Antes habría buscado en Google y armado algo para aprender a detener varios servicios de snapd con un script; ahora se lo pregunto a ChatGPT y en menos de un minuto recibo un script que funciona.
Hay dos cosas que vale la pena señalar en el resumen
Dice “18 tareas de consultoría realistas dentro de la frontera de las capacidades de la IA”. Es decir, eligieron deliberadamente tareas que GPT-4 podía hacer. Como hay muchas tareas que GPT-4 no puede hacer, incluso al decir que el desempeño aumentó mucho, hay que ponerlo en el contexto de que se limita a tareas que le quedan bien a GPT-4
También dice que “los participantes con desempeño por debajo del promedio mejoraron un 43% respecto de su propia puntuación, y los de desempeño por encima del promedio, un 17%”. Aunque solo eligieron tareas especialmente adecuadas para GPT-4, la mejora de quienes estaban por encima del promedio fue del 17%. Si se observaran aumentos así en general, seguiría siendo impresionante, pero creo que 17% es mucho menos de lo que algunos intentan vender
Quienes están por encima del promedio confían en sus propias habilidades, por lo que es más probable que modifiquen mucho más la salida de GPT. Por eso el grupo por debajo del promedio pudo producir el entregable más rápido y, como esta prueba tenía límite de tiempo, la velocidad probablemente fue importante
ChatGPT es muy bueno extendiéndose con textos largos, y los mensajes de marketing e inspiración son, por naturaleza, verbosos. Es decir, las tareas estaban hechas a la medida de ChatGPT sin ayuda, así que quienes tenían alto desempeño estaban más bien en desventaja
Un pequeño aumento de eficiencia se convierte en una gran ventaja en el crecimiento a largo plazo. Incluso 17% es una mejora enorme