1 puntos por GN⁺ 2024-01-29 | 1 comentarios | Compartir por WhatsApp
  • Desde v1.62 del navegador de escritorio de Brave, el LLM predeterminado de Leo, el asistente de navegador con IA centrado en la privacidad, cambia a Mixtral 8x7B
  • Mixtral 8x7B es un LLM de código abierto presentado por Mistral AI en diciembre, y se integró en Leo porque su velocidad, rendimiento y carácter de modelo abierto encajan con la dirección del producto de Brave
  • Brave explica que Mixtral 8x7B supera a ChatGPT 3.5, Claude Instant y Llama 2, entre otros, según el LMSYS Chatbot Arena Leaderboard, y que también muestra mejoras en reducción de alucinaciones y sesgos en el benchmark BBQ
  • Tanto Leo gratis como Premium por 15 dólares al mes ofrecen Mixtral 8x7B por defecto, pero la versión gratuita tiene límites de uso más estrictos y Premium ofrece límites más altos
  • Leo procesa las solicitudes de forma anónima mediante un proxy inverso, no guarda las conversaciones ni las usa para entrenar modelos, y puede usarse desde la barra de direcciones o la barra lateral sin app aparte

El modelo predeterminado de Leo cambia a Mixtral 8x7B

  • Brave reemplazó el modelo de lenguaje grande predeterminado de Leo por Mixtral 8x7B junto con la actualización v1.62 del navegador de escritorio
  • Leo es el asistente de navegador con IA centrado en la privacidad de Brave, que permite usar funciones de IA directamente dentro del navegador
  • Además del cambio de modelo, esta actualización incluye onboarding más claro, control de contexto, formato de entrada y respuesta, y mejoras generales de la interfaz

Por qué eligieron Mixtral 8x7B

  • Mixtral 8x7B es un LLM de código abierto presentado por Mistral AI en diciembre, y su uso creció rápidamente en la comunidad de desarrolladores por su velocidad y rendimiento
  • Según el LMSYS Chatbot Arena Leaderboard, muestra un rendimiento superior al de ChatGPT 3.5, Claude Instant y Llama 2, entre otros
  • Según el benchmark BBQ, también mejora en reducción de alucinaciones y sesgos
  • Sus funciones principales son las siguientes
    • Manejo de contexto más amplio
    • Interacción en inglés, francés, alemán, italiano y español
    • Generación de código

Uso de Mixtral dentro de los productos de Brave

  • Brave ya usa Mixtral en Code LLM, la función para consultas de programación de Brave Search
  • El rendimiento de Mixtral y su carácter de código abierto están alineados con la intención de Brave de apoyar modelos abiertos y la comunidad open source
  • Brian Bondy, CTO y cofundador de Brave, señaló que Leo ya fue adoptado por decenas de miles de usuarios gratuitos y suscriptores de pago, y que espera una adopción aún mayor con la incorporación de Mixtral
  • Arthur Mensch, CEO de Mistral AI, valoró positivamente que Mixtral se use en CodeLLM de Brave Search y en Brave Leo

Opciones de modelo en gratis y Premium

  • Leo permite elegir entre varios modelos según las necesidades y el presupuesto
  • Mixtral 8x7B se ofrece como LLM predeterminado tanto en la versión gratuita como en Premium
  • Ambos planes también son compatibles con Claude Instant de Anthropic y Llama 2 13B de Meta
  • Las condiciones de uso de Leo gratis son las siguientes
    • Mixtral 8x7B y Claude Instant tienen límites de uso más estrictos
    • Llama 2 13B tiene un límite de uso más alto
    • Cuando se alcanza el límite de uso de Mixtral, es posible volver a Llama 2, la experiencia anterior de Leo, para seguir usando la IA
  • Leo Premium cuesta 15 dólares al mes y ofrece Mixtral 8x7B, Claude Instant y Llama 2 13B con límites de uso más altos

Cómo protege la privacidad

  • El chat de Leo está diseñado con privacidad, anonimato y seguridad como base
  • Los chats no se registran ni se usan para entrenar modelos, y no se necesita cuenta ni inicio de sesión para usarlo
  • Sus mecanismos de protección de la privacidad son los siguientes
    • Proxy inverso: todas las solicitudes se procesan por proxy a través de un servidor de anonimización para evitar vincular la solicitud con la dirección del usuario
    • Descarte inmediato de respuestas: las respuestas de Leo se descartan justo después de generarse y las conversaciones no se almacenan en los servidores de Brave
    • No recolección de identificadores: no recopila identificadores como direcciones IP que puedan vincularse al usuario
    • Sin retención por parte de terceros proveedores: ni el modelo de IA ni los proveedores externos de modelos conservan datos personales
    • No requiere cuenta: Leo puede usarse sin crear una cuenta de Brave
    • Tokens de suscripción no vinculables: al suscribirse a Leo Premium, la suscripción se valida con tokens que no permiten vincular la información de compra con el uso del producto

Cómo se usa y dónde está disponible

  • Leo está integrado en el navegador y puede usarse sin aplicaciones ni extensiones adicionales
  • Los usuarios de Brave en escritorio pueden escribir una pregunta en la barra de direcciones y luego hacer clic en “Ask Leo”, o abrir Leo desde Brave Sidebar
  • Se accede a las funciones de IA a través de la barra lateral tipo chat junto a la página web o desde la barra de direcciones
  • En el contexto de la página admite las siguientes tareas
    • Resúmenes en tiempo real de páginas web o videos
    • Responder preguntas sobre el contenido
    • Generar contenido nuevo
    • Traducir páginas
    • Analizar páginas
    • Reescribir oraciones
    • Ayuda para escribir código
  • Leo está disponible para usuarios de Brave en escritorio desde noviembre, y esa versión es la 1.60
  • Leo para Android e iOS estará disponible pronto

1 comentarios

 
GN⁺ 2024-01-29
Opiniones en Hacker News
  • Para ejecutar Mixtral 8x7B localmente, puedes usar llama.cpp y, junto con bibliotecas/interfaces compatibles como text-generation-webui, usar https://huggingface.co/TheBloke/Nous-Hermes-2-Mixtral-8x7B-S...
    Incluso la versión más pequeña con cuantización de 2 bits necesita 20 GB de RAM y se puede hacer offloading a la VRAM de una buena GPU 4090
    La versión con cuantización de 4 bits es el modelo más grande que apenas cabe en un sistema de 32 GB, y usa alrededor de 29~31 GB
    La de 6 bits usa 41 GB y la de 8 bits 52 GB, así que se necesita un sistema de 64 GB; para hacer offloading a VRAM de modelos con mayor precisión se requieren varias GPU con memoria compartida
    He probado modelos 7B y 13B, pero todavía no he experimentado con este ni con otros modelos grandes

    • Si quieres más rendimiento relacionado con código, también puedes probar el fine-tuning dolphin-mixtral: https://huggingface.co/TheBloke/dolphin-2.7-mixtral-8x7b-GGU...
    • En lugar de varias GPU, quizá baste una máquina potente con Apple Silicon
      Probé dolphin mixtral de 4 bits en una MacBook M3 con 36 GB de RAM y la inferencia fue muy rápida
    • 2 bits es bastante malo, así que es difícil recomendarlo para usos serios
    • Prefiero koboldcpp sobre llama.cpp
      Es más fácil ejecutar un modelo más grande que la VRAM repartiéndolo entre GPU/CPU
    • Al hablar de requisitos de memoria, también hay que considerar la longitud de secuencia
      Mixtral admite 32,000 tokens, así que esa parte puede representar una proporción bastante grande de la memoria usada
  • Brave merece elogios por esta función y por otras funciones de privacidad
    Usa un esquema de tokens de suscripción no vinculables, así que al suscribirte a Leo Premium se emite un token que valida la suscripción al usar Leo, y Brave no puede vincular la información de pago con el historial de uso del producto
    El correo usado para crear la cuenta tampoco queda vinculado con el uso cotidiano de Leo, por lo que es un enfoque bastante particular de credenciales privadas

    • Muy interesante; me gustaría incorporarlo en mi app
      Me pregunto si alguien sabe exactamente cómo funciona esto sin usar claves foráneas
  • Parece que me perdí el primer anuncio de Leo, pero se ve interesante, y me gusta el diseño que toma en cuenta la privacidad
    Que no guarde el historial de chat es justo lo que quería

  • Me pregunto cuáles son los buenos proveedores de API que ofrecen Mixtral
    Solo conozco OctoAI, que parece estar bien, y me gustaría conocer alternativas

    • El creador del modelo también opera su propia plataforma, donde se pueden usar este modelo y otros vía API: https://console.mistral.ai/
    • Acabo de descubrir Groq, y dicen que da 485.08 tokens/segundo en mixtral 8x7B-32k
      No sé el precio, pero parece que hay que enviar un correo a api@groq.com
    • OpenRouter suele ser una buena opción, y lo mejor es que ofrece una API unificada para todos los LLM
      El precio también es el mismo que el del proveedor original
      Eso sí, para los modelos de OpenAI/Anthropic tuvieron que activar filtrado de entrada/salida por exigencias de esas empresas
    • Aunque ya son servicios conocidos, estoy usando bastante bien Anyscale Endpoints
      Es muy rápido y, con la configuración predeterminada, maneja 10 tareas en paralelo
      Together.ai también se vio bien en las pruebas iniciales, pero todavía no lo he usado a gran escala
    • Probé tanto la API comercial de Mistral como la de AnyScale con mixtral-8-7b, y ambas fueron fáciles de usar
      También ejecuto una versión con cuantización de 3 bits de mixtral-8-7b en un sistema M2 Pro con 32 GB de memoria, y es bastante rápida
      Es bueno que haya varias opciones
  • Durante la última semana probé las versiones en poe y chat.groq.com
    Es mucho mejor que llama 70b

  • Me parece interesante que hayan permitido hacer consultas a LLM directamente desde la barra de direcciones
    Me pregunto si más adelante crearán una heurística para decidir si enviar la consulta directamente al LLM o usar el proveedor de búsqueda predeterminado

  • Al usar mistral después de gpt4, se siente como pasar de ver una pantalla Retina a volver a una pantalla de baja resolución
    Uno no deja de pensar: “pero GPT4 sí podría hacer esto”

    • Me pregunto si probaste mixtral
  • Estoy ejecutando Mixtral localmente con ollama

  • Me pregunto si hay alguna buena extensión de Chrome que resuma páginas con IA
    Probé algunos de los primeros resultados de Google y funcionan bien, pero estaban inflados con demasiadas funciones innecesarias