- Si la IA generativa no funciona con datos confiables, los resultados de los análisis también se vuelven difíciles de confiar; por eso, la gestión de datos pasó de ser una tarea de soporte técnico a una función estratégica central
- Desde la etapa inicial en la que los desarrolladores de aplicaciones también se encargaban de la estructura de datos, los roles se fueron diferenciando en diseñadores/administradores de bases de datos, CIO y CDO; la integridad de los datos y una comprensión coherente en toda la empresa se volvieron desafíos principales
- En los datos estructurados, el modelo de datos y la base de datos se modifican directamente, pero en un entorno de IA generativa se ejerce control indirecto seleccionando y depurando el texto que entra al LLM
- Para el texto no estructurado se necesitan ontologías/taxonomías en lugar de modelos de datos tradicionales, y hay que combinarlas con el modelo lógico de datos empresarial (ELDM) y actualizarlas continuamente
- A medida que los datos se distribuyen entre múltiples sistemas, PCs e Internet, la centralización física se volvió imposible; por eso cobra importancia la centralización semántica, que integra el significado a nivel empresarial mediante el ELDM
La gestión de datos comenzó en el desarrollo de aplicaciones
- En los primeros sistemas informáticos, los desarrolladores de aplicaciones definían los datos que usaría el sistema y su estructura, además de reunir requisitos, seguir metodologías, programar y probar
- El diseño de datos no era una función empresarial independiente, sino una de varias tareas incluidas en el proceso de desarrollo
Procesamiento de transacciones y aparición de roles especializados en bases de datos
- Con la expansión de los sistemas de procesamiento de transacciones, hubo que reflejar en el diseño de bases de datos el tiempo de respuesta, la disponibilidad del sistema y la integridad de la ejecución de transacciones
- Con la aparición del diseñador de bases de datos, especializado en abordar estos requisitos, la gestión de datos empezó a reconocerse como una tarea independiente
- A medida que crecieron rápidamente las bases de datos de procesamiento de transacciones, se volvió necesario contar con un administrador de bases de datos que controlara y coordinara múltiples bases de datos
Problemas de integridad de datos y data warehouse
- Al almacenarse repetidamente los mismos elementos de datos en numerosas aplicaciones interconectadas, surgió el problema de que tuvieran valores diferentes según la ubicación
- El problema de las empresas pasó de tener datos a determinar en qué datos confiar
- Agregar aplicaciones y tecnología no resolvía los problemas de integridad; al contrario, los ampliaba y aceleraba
- Se hizo necesaria una solución arquitectónica, no una corrección técnica: separar los datos operativos de los datos analíticos. Como resultado surgió el data warehouse
Modelos de datos y entornos de datos estructurados
- Para transformar datos operativos en datos analíticos y en un data warehouse, se necesita un modelo de datos que abstraiga los tipos de datos existentes o los que se necesitarán en el futuro
- Los sistemas operativos y los data warehouses están compuestos por entornos de datos estructurados, donde el formato de cada registro es el mismo y solo cambia el contenido
- Los datos estructurados de aplicaciones, bases de datos y bases de datos de procesamiento de transacciones se gestionan con sistemas de gestión de bases de datos (DBMS)
- Cuando las fallas de los sistemas transaccionales empezaron a afectar directamente operaciones reales y clientes, como cajeros automáticos y sistemas de reserva aérea, aumentó el valor de contar con sistemas precisos y estables y una buena gestión de datos
Tareas del administrador de datos estructurados
- Después de construir el modelo de datos, lo mantiene y modifica continuamente según cambios económicos, competitivos, tecnológicos, legales y de mercado
- En el diseño de bases de datos se siguen los principios de normalización, pero se aplica el nivel necesario de desnormalización para el rendimiento del procesamiento de transacciones
- El administrador de datos equilibra los objetivos del sistema y los requisitos de rendimiento entre la normalización y la desnormalización
- Escribe el DDL que define la base de datos con base en el modelo de datos
- Realiza planificación de capacidad para prever cuándo los equipos de procesamiento de transacciones llegarán a sus límites de capacidad
- Supervisa continuamente la actividad de la base de datos y el crecimiento de los datos
- Cuando se detecta un problema, usa un método de control directo, accediendo directamente al modelo de datos o a la base de datos correspondiente para corregirlo
Expansión de los datos no estructurados/de texto
- En las empresas existe una amplia variedad de datos no estructurados/de texto, además de datos estructurados, y algunas estimaciones señalan que hasta el 90% de los datos empresariales son texto
- Como una parte considerable de la información empresarial importante existe en forma de texto, la organización de gestión de datos también debe gestionarla
- Los datos estructurados y los datos de texto difieren fundamentalmente en su estructura y en sus métodos de gestión
Ontologías y taxonomías en entornos de texto
- En entornos de texto, es difícil aplicar tal cual un modelo tradicional de datos estructurados
- En el entorno de texto, el rol que cumple el modelo de datos en los datos estructurados lo desempeña la ontología/taxonomía (ontology/taxonomy)
- Ambos modelos cumplen roles equivalentes, pero su estructura y sus técnicas de gestión son muy diferentes
- Aplicar sin cambios al texto las técnicas de modelado y gestión de datos estructurados no es adecuado y casi no produce resultados prácticos
Selección y depuración del texto de entrada para el LLM
- En un entorno de IA generativa, la tarea más importante de gestión de datos es revisar el texto original antes de que entre al LLM
- Hay que eliminar el texto innecesario que no esté relacionado con el negocio de la empresa para que no entre al LLM
- Eliminar texto innecesario reduce la cantidad de datos que deben procesarse cada vez que se ejecuta una consulta, lo que permite reducir costos
- Al dejar solo texto relacionado con el negocio, queda más claro el alcance de lo que el LLM representa y maneja
ELDM y conexión entre datos estructurados y no estructurados
- En un entorno de IA generativa, el administrador de datos debe combinar la ontología/taxonomía con el ELDM (Enterprise Logical Data Model) de toda la empresa
- El ELDM se usa para integrar el modelo tradicional de datos estructurados con la ontología/taxonomía del entorno de texto
- Cuando cambian los requisitos de negocio de la empresa, la ontología/taxonomía también debe actualizarse en consecuencia
Recopilación de texto externo y mantenimiento continuo
- Primero hay que seleccionar un amplio rango de texto original desde fuentes como Internet
- Luego sigue un proceso de selección en dos etapas, en el que se vuelven a filtrar, del texto seleccionado, los datos relacionados con el negocio de la empresa
- Como el entorno de negocio y la situación mundial cambian continuamente, la ontología/taxonomía debe supervisarse y gestionarse de forma constante
- Se requiere mantenimiento iterativo para que las condiciones cambiantes y la taxonomía sigan alineadas
Control indirecto sobre el LLM
- Los administradores de datos estructurados pueden cambiar directamente el modelo de datos y la base de datos, pero en un entorno de IA generativa no pueden controlar directamente el LLM de la misma manera
- El medio para controlar los resultados de la IA generativa es gestionar qué texto se ingresa al LLM
- Por lo tanto, la gestión de datos para IA generativa se acerca más a un control indirecto mediante la selección y depuración de los datos de entrada que a una modificación directa
Cambios en el rol de la gestión de datos dentro de la organización empresarial
- Al principio, la gestión de datos era una de varias tareas realizadas por los desarrolladores de sistemas, sin una organización o puesto empresarial separado
- A medida que el procesamiento de transacciones cobró importancia, el diseño de bases de datos se separó como una tarea independiente y surgió el rol de diseñador de bases de datos
- Con el rápido aumento de las bases de datos y de los elementos de datos que debían gestionarse, se amplió el rol del administrador de bases de datos
- A medida que crecieron los problemas de inconsistencia entre los datos de múltiples sistemas, apareció el CIO (Chief Information Officer), encargado de la integración de información a nivel empresarial
- Al surgir la necesidad de integrar datos estructurados y datos de texto para comprender los datos empresariales de forma integral, el rol evolucionó hacia el CDO (Chief Data Officer)
- Cuanto más diversas son las formas de los datos, más aumentan al mismo tiempo la complejidad e importancia de su gestión, así como las oportunidades y desafíos de uso
De la centralización física a la centralización semántica
- Para comprender de manera coherente los datos y su significado en toda la empresa, se necesita un sistema centralizado de comprensión de datos
- En la computación temprana, la centralización significaba centralización física: reunir las bases de datos en grandes mainframes
- Más adelante, al distribuirse los datos en múltiples ubicaciones como computadoras personales, Internet y sistemas empresariales, la centralización física se volvió imposible
- Cuanto más se distribuyen los datos, mayor es la necesidad de coordinar que en Internet y dentro de la empresa se entienda el mismo objeto con el mismo significado
- El objetivo de la centralización se desplaza desde la ubicación donde se almacenan los datos hacia el significado y la definición de los datos
- El ELDM se usa como medio para mantener centralmente el significado común de los datos a nivel empresarial, aunque los datos existan en múltiples ubicaciones físicas
Aún no hay comentarios.