1 puntos por GN⁺ 2024-05-17 | 1 comentarios | Compartir por WhatsApp
  • Slack no desarrolla modelos de IA generativa con datos de clientes, pero para modelos predictivos como recomendaciones de emoji o de canales sí pueden analizarse mensajes, contenido, archivos e información de uso
  • Los modelos globales están diseñados para no reproducir partes de los datos de clientes, y existen controles para que el personal no pueda acceder al contenido subyacente durante el desarrollo de IA/ML o los procesos de análisis
  • Los clientes pueden solicitar que los datos de su workspace u organización queden excluidos del entrenamiento de los modelos globales de Slack, y aun después de la exclusión pueden seguir usando los beneficios de los modelos de ML entrenados globalmente
  • Las recomendaciones de canales, resultados de búsqueda, autocompletado y recomendaciones de emoji funcionan usando modelos externos, puntajes numéricos, cantidad de interacciones pasadas y frases públicas, de una forma que reduce la exposición de datos de clientes
  • Las funciones de IA generativa de Slack usan LLM de terceros, pero los datos de clientes permanecen dentro del límite de confianza de Slack y no se usan para entrenar modelos de IA generativa sin un opt-in explícito

Principios de uso de datos para AI/ML en Slack

  • Los principios de desarrollo de producto de Slack están centrados en la privacidad y seguridad de los datos de clientes
  • El ML y la IA se usan como herramientas para mejorar los productos de Slack
  • No desarrollan modelos de IA generativa con datos de clientes
  • Para desarrollar modelos predictivos, como recomendaciones de emoji o de canales, pueden analizar los siguientes datos
    • Datos de clientes enviados a Slack: mensajes, contenido, archivos, etc.
    • Otra información definida en la política de privacidad y en los contratos con clientes: incluida la información de uso

Modelos globales y controles de acceso

  • Slack no construye ni entrena modelos de uso amplio para todos los clientes de una manera que permita reproducir partes de los datos de clientes
  • Durante el desarrollo de modelos de IA/ML o el análisis de datos de clientes, el personal de Slack no puede acceder al contenido subyacente
  • Existen varias medidas técnicas para proteger la confidencialidad y la seguridad de los datos de clientes
  • Los clientes pueden hacer opt-out para que sus datos de clientes no se usen en el entrenamiento de los modelos globales de Slack
    • Los datos de clientes de un workspace con opt-out solo se usan para mejorar la experiencia de ese workspace
    • Se pueden seguir usando los beneficios de los modelos de ML entrenados globalmente
    • Los Owners de la organización o del workspace, o el Primary Owner, deben enviar a feedback@slack.com la URL del Workspace/Org con el asunto Slack Global model opt-out request
    • Slack responderá una vez procesada la solicitud para confirmar si se completó

Mejora del servicio con datos de clientes y otra información

  • Los equipos de producto y análisis de Slack pueden usar datos de clientes y otra información para desarrollar, actualizar y mejorar el servicio
  • Esta personalización y mejora es posible al estudiar y entender cómo interactúan los usuarios con Slack
  • Las obligaciones de confidencialidad del contrato con clientes de Slack y de la Privacy Policy aplican en cada escenario
  • Los clientes son dueños de sus datos de clientes
  • Slack agrega y separa los datos de clientes para que, aunque se usen en actualizaciones del servicio, terceros no puedan identificar a un cliente o persona específica como fuente de una mejora
    • Esto no incluye como terceros a las afiliadas o subencargados de tratamiento de Slack

Cómo se protegen los datos en funciones predictivas

  • Recomendaciones de canales

    • Pueden recomendar unirse a nuevos canales públicos dentro de la empresa
    • Las recomendaciones se basan en membresía de canales, actividad y superposición temática
    • El modelo aprende de recomendaciones pasadas y de si el usuario se unió o no al canal
    • Un modelo externo no entrenado con mensajes de Slack evalúa la similitud temática y produce un puntaje numérico
    • El modelo global hace la recomendación usando solo ese puntaje numérico y datos no pertenecientes a clientes
  • Resultados de búsqueda

    • El modelo de ML de búsqueda identifica resultados relevantes para una consulta específica y ayuda al usuario a encontrar la información que quiere
    • Se basa en resultados de búsquedas pasadas y en historial de interacción previo
    • Está diseñado para que el modelo no pueda reproducir consultas de búsqueda ni resultados
  • Autocompletado

    • Puede autocompletar consultas de búsqueda u otros textos
    • Por ejemplo, si un usuario escribe unas pocas letras iniciales de Customer Support, completa esa frase
    • Las sugerencias se generan localmente y se toman de frases comunes de mensajes públicos dentro del workspace del usuario
    • El algoritmo que elige posibles sugerencias aprende globalmente de casos anteriores en los que una sugerencia fue mostrada y aceptada
    • Usa reglas que puntúan la similitud entre el texto ingresado y la sugerencia, y al algoritmo solo entran puntajes numéricos y cantidades de interacciones pasadas
  • Recomendaciones de emoji

    • Puede sugerir emojis de reacción con base en el contenido y el sentimiento del mensaje, el uso previo de emojis y la frecuencia con que el equipo usa ciertos emojis en contextos específicos
    • Si en un canal determinado es común reaccionar con 🎉 a mensajes de felicitación, podría sugerir 🎉 también para un mensaje nuevo con tono positivo similar
    • Un modelo externo no entrenado con mensajes de Slack puede clasificar el sentimiento del mensaje
    • El modelo de Slack solo considera la frecuencia con que mensajes de cierto sentimiento y ciertos emojis se relacionan dentro de ese workspace para sugerir emojis

Tratamiento de datos de clientes en IA generativa

  • La IA generativa es una categoría de sistemas de IA capaces de generar contenido como texto en respuesta a prompts ingresados por el usuario
  • Esta categoría incluye los modelos de lenguaje de gran escala (LLM)
  • AI in Slack usa IA generativa y aprovecha LLM de terceros
  • A menos que el cliente dé un consentimiento explícito de opt-in, los datos de clientes no se usan para entrenar modelos de IA generativa
  • AI in Slack usa LLM ya existentes, y estos modelos no se actualizan con datos de clientes después de una solicitud ni conservan datos de clientes de otra manera
  • Esos modelos están alojados en infraestructura de proveedores de nube como AWS
  • Los datos de clientes permanecen dentro del límite de confianza de Slack, y los proveedores de LLM no pueden acceder a esos datos
  • Las notificaciones sobre cambios de subencargados de tratamiento pueden recibirse en la Trust and Compliance webpage

Fuentes de las respuestas de búsqueda de Slack AI

  • La función de búsqueda de AI in Slack obtiene las fuentes de sus respuestas de funciones internas de Slack y de documentos conectados
  • Las fuentes de búsqueda incluyen lo siguiente
    • Funciones de Slack: canvases, huddles canvas notes, clip transcripts, text snippets
    • Archivos subidos a Slack: PDF, correo electrónico, docx, pptx, Keynote
    • Documentos conectados de Google Drive: Docs, Slides
    • Documentos de Sharepoint/OnDrive: Word, Powerpoint
    • Apps asociadas de almacenamiento de archivos como Box: si están instaladas
  • El usuario debe estar autenticado mediante una integración con Slack para poder acceder a esos archivos
  • Los administradores pueden desactivar todos los resultados de archivos o configurar que no se usen archivos alojados externamente como fuente
  • La guía relacionada puede consultarse en el Help Center

1 comentarios

 
GN⁺ 2024-05-17
Opiniones de Hacker News
  • Contacté al equipo de soporte para optar por no participar, y la respuesta decía que la solicitud se había completado.
    Slack explicó que tiene modelos de machine learning a nivel de plataforma, como recomendaciones de canales/emojis y resultados de búsqueda, pero que no los crea ni entrena de una forma que pueda aprender, memorizar o reproducir datos de clientes.
    Slack AI es un add-on de compra aparte, no entrena LLM con datos de clientes y usa un LLM alojado dentro de la infraestructura de AWS de Slack, por lo que los datos no se comparten con proveedores externos de LLM.
    Enlaces a la política: https://slack.com/trust/data-management/privacy-principles, https://slack.engineering/how-we-built-slack-ai-to-be-secure...

    • Al final suena como “alimentamos nuestra IA con tus datos, pero no los compartimos con otros”.
      Aunque seguramente solo hasta la próxima actualización de los términos de uso.
    • Activarlo silenciosamente por defecto, sin poner siquiera una opción fácil de opt-out en el panel de administración de Slack, y aun así fingir que les importa la privacidad de los clientes, se ve totalmente desganado.
    • Creo que el proceso era: “Si quieres excluir los datos de clientes de los modelos globales de Slack, el Org/Workspace Owner o Primary Owner debe enviar a feedback@slack.com la URL del Workspace/Org con el asunto ‘Slack Global model opt-out request’”.
      Supongo que eso hiciste, ¿no?
    • Recibí la misma respuesta enlatada y, cuando pedí más detalles, no contestaron nada.
  • Si la estructura es: “puedes hacer opt-out para que tus datos de cliente no se usen en el entrenamiento del modelo global de Slack. Aunque hagas opt-out, los datos del workspace solo se usarán para mejorar la experiencia de ese workspace, y seguirás recibiendo los beneficios del modelo global de entrenamiento”, entonces me pregunto por qué alguien no haría opt-out.
    Claro, excepto quienes no saben que tienen que hacerlo; parece una opción que solo trae desventajas.

    • No entiendo cómo las empresas creen que, si le ponen IA al comunicado de prensa, a los clientes les va a parecer bien que raspen comunicaciones privadas de un servicio pagado, sin permiso, a escala industrial, para monetizarlas.
    • No parece que tengan intención de hacerlo fácil.
      Los usuarios individuales no parecen tener voz sobre cómo se usan sus datos y tienen que contactar al Workspace Owner.
      Cuando lo haga, más bien voy a pedir que evalúen una plataforma alternativa.
    • Como suele pasar con la privacidad en internet, si fuera fácil, todos habrían hecho opt-out.
      Al final se convierte en un whack-a-mole de opt-outs; el método es una consulta común y corriente, y parece que incluso si haces opt-out igual siguen entrenando.
    • La frase “ofrecemos a los clientes opciones” me recuerda a un chiste al estilo de Guía del autoestopista galáctico.
      Tal vez dejen una pequeña pista en algún lugar casi invisible, por ahí en la página 300 de los términos.
    • Puede que quieras el mejor modelo global.
      Si ves no hacer opt-out como “ayudar a crear un producto mejor”, y ya es un producto por el que pagas, si puedes hacer que la próxima versión sea mejor sin invertir tiempo adicional, ¿por qué no hacerlo?
      Obtienes un producto mejor al mismo precio, y la empresa obtiene un producto más fácil de vender.
      Puede que sea un trato en el que la empresa gane más, pero que una parte gane más no significa que la otra pierda.
      La historia cambia si valoras mucho la privacidad de los datos o crees que permitir el entrenamiento realmente crea un riesgo de exposición de información privada; en ese caso, como existe la opción de detenerlo, cada quien puede medir el valor entre “mejor producto” y “riesgo estimado de exposición de información privada”.
  • La frase “los modelos que se usarán ampliamente para todos los clientes no se crean ni entrenan de una forma que pueda aprender, memorizar o reproducir parte de los datos de clientes” tiene tantos matices sutiles y redacción de descargo de responsabilidad que genera más desconfianza que confianza.
    Solo aplica a modelos usados “ampliamente para todos los clientes”, así que si no se usan ampliamente o se usan solo para algunos clientes, toda la oración deja de aplicar.
    Lógicamente, suena como si eso implicara que en esos casos los datos podrían filtrarse, lo cual es bastante malo.
    Esa frase debe corregirse, y quien la escribió es un riesgo.

    • Más que “quien la escribió es un riesgo”, suena a que la redactaron así a propósito para evadir responsabilidad.
    • Unos párrafos más abajo dicen “puedes hacer opt-out para que tus datos de cliente no se usen en el entrenamiento de modelos globales de Slack”, así que es todavía más raro.
      Es decir, los datos de clientes no se usan para entrenar “modelos usados ampliamente para todos los clientes de esa forma”, pero sí ayudan al entrenamiento de modelos globales.
    • El problema está en quien tomó la decisión real que hizo que el equipo legal tuviera que bailar alrededor de ese descargo.
      Aunque ese problema es más grande para nosotros que para ellos.
    • Me imagino canales o chats privados de Slack empresarial con información que no existe en ningún lugar de internet, y que eso entra al modelo.
      Si alguien hace una pregunta conversacional sobre una situación muy específica, parece posible que salga información confidencial, aunque no se atribuya al nombre del cliente.
      Tampoco es como si no se le pudiera preguntar a un LLM cómo diseñaría algo una empresa específica o arbitraria de una industria concreta.
    • La redacción parece lo más clara posible, y creo que en los bullet points dan ejemplos más detallados.
      Dicen que el modelo de recomendación de canales aprende de recomendaciones anteriores y de si los usuarios entraron a los canales recomendados, pero que separan los datos de clientes y el modelo para proteger la privacidad.
      Explican que usan un modelo externo no entrenado con mensajes de Slack para evaluar similitud temática y generar una puntuación numérica, y que el modelo global recomienda usando solo esa puntuación y datos que no son de clientes.
      En búsqueda, dicen que tampoco entrenan con las consultas ni con el texto de los resultados en sí, sino con información contextual por equipo, como cuántas veces se hizo clic en un mensaje desde la búsqueda o el solapamiento de palabras entre la consulta y el mensaje recomendado.
      Las sugerencias de autocompletado se toman de frases comunes en mensajes públicos del workspace; a nivel global entrenan con completados sugeridos y aceptados anteriormente, pero el algoritmo solo usa puntuaciones y conteos de interacciones pasadas.
      Las recomendaciones de emojis también funcionan con un modelo externo no entrenado con mensajes de Slack para clasificar emociones, y solo consideran la frecuencia con que los mensajes con esa emoción y un emoji específico se usan juntos en ese workspace.
  • En resumen, para excluir los datos del modelo global, hay que hacer opt-out.
    Al mismo tiempo, dicen de forma ambigua que “los datos no se filtran entre workspaces”, lo que resulta muy confuso.
    Hay que usar herramientas en las que los datos “no puedan filtrarse”, no donde “no se filtrarán”.

    • ¿No están todas las herramientas, por naturaleza, en un estado donde los datos pueden filtrarse con una sola llamada a la API?
    • La mayoría de los SaaS son multi-tenant, así que desde hace décadas ya vivimos en un mundo de “puede filtrarse, pero no se filtrará”.
    • Me pregunto cuál es la diferencia entre “will not” y “cannot” en el lenguaje legal.
  • La frase “Al desarrollar modelos de AI/ML o analizar datos de clientes, Slack no puede acceder al contenido subyacente. Existen diversas medidas técnicas para impedirlo” resulta confusa.
    “No puede” es una expresión fuerte; me pregunto cómo es posible que el modelo de IA sí pueda acceder a los datos, pero Slack, Inc. como tal no.
    Si no se me escapa nada, parece más cercano a “no lo hace” que a “no puede”.

    • La palabra “Slack” aquí es interesante.
      Probablemente se refiera a “empleados de Slack”, pero “Slack” puede incluir todos los activos, representantes, sistemas, computadoras, servidores, modelos de IA, etc., de la empresa.
      Incluso si Signal dijera “no podemos acceder al contenido de los usuarios”, sonaría como una frase inestable y optimista.
      Cuando uno oye “no puede”, tiende a entender que nadie dentro de la empresa puede hacerlo dentro del marco legal.
      Un empleado de Slack podría desactivar esas medidas técnicas, y un empleado de Signal también podría hacer que una actualización de la app redirija todos los mensajes a otro servidor.
      Una mejor formulación sería: “los empleados de Slack no acceden al contenido subyacente”.
    • En el white paper enlazado en el mismo comentario se dice que el acceso se aprovisiona con privilegios mínimos y permisos basados en roles, que solo se pueden tratar los datos razonablemente necesarios para el trabajo actual, y que todo acceso a producción se revisa al menos trimestralmente.
      Entonces parece muy claro que sí hay acceso posible.
    • Desde la perspectiva de un ingeniero que ha construido sistemas que manejan datos sensibles, esta frase parece referirse a listas de control de acceso, al sistema que aprovisiona esas listas de control de acceso y a las políticas que sigue ese sistema.
      Por ejemplo, un job batch de entrenamiento de modelos puede ejecutarse como un usuario del sistema que accede a datos anotados como “interacciones”, pero no tener permisos para acceder a datos de “contenido”, como el cuerpo de los mensajes o el texto de las consultas de usuarios.
      Si el job de entrenamiento enviara una RPC para obtener ese contenido, sería rechazado, igual que cuando alguien intenta acceder al DM de otra persona sin iniciar sesión.
      En una empresa grande, los ingenieros o product managers no deciden las listas de control de acceso a voluntad; solicitan a algún sistema los permisos de acceso para jobs batch, y quienes operan ese sistema también siguen las políticas de la empresa.
      Es parecido a que un empleado bancario maneje números de cuenta, pero no pueda transferirse dinero en secreto a su cuenta personal, o al menos sería descubierto.
      Esta frase se acerca más a decir que, a nivel del sistema, no es posible que algún PM de Slack ignore las políticas para mejorar los OKR de su equipo y entrene en secreto con datos de clientes que otro equipo no usa.
      Por supuesto, la analogía no es perfecta.
      El empleado bancario se parece más a un agente de soporte de Slack que podría ver mensajes en nombre del cliente tras su consentimiento, y es muy probable que no exista una forma real de canalizar el acceso limitado concedido a una persona hacia un job de entrenamiento de modelos.
      En una empresa madura, también debería estar bloqueado que un empleado use su acceso a datos personales para entrenar un modelo en una notebook arbitraria y luego lo despliegue en producción.
      Aunque en una startup quizá sí funcionen así.
    • Toda empresa que promete cifrado de extremo a extremo también termina siendo, en el fondo, una promesa de meñique.
      Lo mismo aplica para Telegram o WhatsApp.
  • Sería útil reunir una lista de empresas que hacen este tipo de cosas para poder evitarlas.
    Si conocen otras empresas que entrenen con datos de clientes sin un opt-out fácil y muy visible, sería bueno que las dejen abajo.

    • Synology actualizó esta política en marzo.
      Antes decía que la información obtenida en solicitudes de soporte técnico se usaba solo para resolver problemas y que, tras eliminar datos personales, algunos detalles técnicos podían utilizarse para generar reportes de bugs.
      El nuevo texto dice que, tras eliminar datos personales, cierta información técnica puede usarse para generar reportes de bugs, y que información técnica anonimizada puede enviarse a Microsoft Azure para mejorar la experiencia de soporte técnico usando servicios de OpenAI.
      Dicen que excluirán información de identificación personal como nombre, número de teléfono, dirección, correo electrónico, dirección IP y número de serie del producto.
      Antes simplemente borraba los correos sobre actualizaciones de la política de privacidad, pero ahora adquirí la costumbre de revisar el diff para ver si metieron frases como estas.
    • Si los datos están almacenados en una base de datos que la empresa puede leer y acceder libremente, es decir, si no hay cifrado de extremo a extremo, tarde o temprano esa empresa cambiará sus términos de uso para poder usar esos datos en entrenamiento de IA.
      El incentivo es demasiado fuerte como para resistirse.
      https://twitter.com/kepano/status/1688610782509211648
      https://twitter.com/kepano/status/1682829662370557952
    • Probablemente sea más fácil hacer una lista de empresas que no hacen esto.
      La lista está vacía.
    • Hasta que existan protecciones y cada persona pueda decidir cómo se usan sus datos y si recibe compensación, una forma de resistir es no publicar en internet nada útil ni preciso.
  • No sé cómo esto puede ser compatible con la ley europea del derecho al olvido
    De hecho, me pregunto cuál de estos modelos de IA puede respetar ese derecho
    Si un usuario solicita la eliminación, ¿vuelven a entrenar todo el modelo? No creo que sea así

    • La estafa de “IA” que está ocurriendo ahora parece el procedimiento complejo definitivo para ocultar un montón de maniobras
      Ya no existe el copyright; dicen que no es robar, sino transformar; que hay que hacer opt-out antes de que entrenen el modelo con todo internet, y aun así parece que no lo harán
      Dicen que no se perderán empleos en absoluto, mientras todas las empresas despiden de inmediato al 15% y obligan a volver a la oficina para obtener todavía más datos de los autos
      Lo venden como “un raro truco” para convertirte en el programador productivo definitivo, pero en realidad parece que prefieren vendérselo a personas antes que crear ellos mismos un producto rentable
      Lo más grave y peligroso es que la información sea censurada en el nivel más bajo antes incluso de llegar a las manos o a los ojos de la gente
    • El machine unlearning es un campo que sí existe, y se puede ver [0] como material introductorio
      [0] https://ai.stanford.edu/~kzliu/blog/unlearning
    • No creo que esa sea la interpretación actual del GDPR y normas similares
      Entiendo que, si el modelo ya fue entrenado, no es necesario eliminarlo por una solicitud de derecho al olvido, pero hay mucha incertidumbre legal
      A juzgar por fallos recientes sobre el GDPR, probablemente siga siendo una infracción por el hecho de que sea opt-out y no opt-in
      Supongo que estarán filtrando todos los datos generados en el EEE
  • Para mensajería de equipo, de verdad hay que usar soluciones autoalojadas como Matrix/Element
    Está bien no querer tener equipos propios dentro de la empresa, pero la solución es operar una alternativa cifrada de extremo a extremo para que el proveedor de hosting no pueda acceder a los datos
    cryptpad.fr también es un software excelente

    • Puedes revisar Campfire
      Funciona recibiendo el código fuente (Ruby on Rails) y desplegándolo donde quieras; nosotros lo corremos en un droplet de DigitalOcean
    • Zulip(https://zulip.com/) parece una excelente alternativa autoalojada basada en Python a Slack/Teams
  • Los incentivos para hacer este tipo de cosas son enormes para Slack, Google, Microsoft y todos los demás proveedores de herramientas SaaS
    Si las empresas quieren evitar ser convertidas en commodity por los proveedores, al final tienen que controlar sus propios datos y su estrategia de IA
    Eso probablemente significa desactivar funciones pequeñas, caras y capaces de arruinar el negocio, crear una base de conocimiento central con buen control de acceso y gobernanza, y luego conectar el LLM de cualquier proveedor, sea open source o una caja negra

    • “Convertidas en commodity por los proveedores” era justo la expresión que estaba buscando
      Por eso quería que la empresa usara Mattermost autoalojado en lugar de Slack
    • Sin duda es riesgo moral y también una oportunidad
      Como referencia, Windows 11 sincroniza archivos con los servidores de Microsoft por defecto
  • Creo que terminará siendo algo como “solo lo usaremos para elegir emojis, y un poquito también para una divertida herramienta interna de recomendación de acciones
    Es decir, una herramienta que recomienda acciones interesantes para comprar, basada en los pensamientos internos en tiempo real y anonimizados de cientos de miles de empresas tecnológicas