- Desde v1.62 del navegador de escritorio de Brave, el LLM predeterminado de Leo, el asistente de navegador con IA centrado en la privacidad, cambia a Mixtral 8x7B
- Mixtral 8x7B es un LLM de código abierto presentado por Mistral AI en diciembre, y se integró en Leo porque su velocidad, rendimiento y carácter de modelo abierto encajan con la dirección del producto de Brave
- Brave explica que Mixtral 8x7B supera a ChatGPT 3.5, Claude Instant y Llama 2, entre otros, según el LMSYS Chatbot Arena Leaderboard, y que también muestra mejoras en reducción de alucinaciones y sesgos en el benchmark BBQ
- Tanto Leo gratis como Premium por 15 dólares al mes ofrecen Mixtral 8x7B por defecto, pero la versión gratuita tiene límites de uso más estrictos y Premium ofrece límites más altos
- Leo procesa las solicitudes de forma anónima mediante un proxy inverso, no guarda las conversaciones ni las usa para entrenar modelos, y puede usarse desde la barra de direcciones o la barra lateral sin app aparte
El modelo predeterminado de Leo cambia a Mixtral 8x7B
- Brave reemplazó el modelo de lenguaje grande predeterminado de Leo por Mixtral 8x7B junto con la actualización v1.62 del navegador de escritorio
- Leo es el asistente de navegador con IA centrado en la privacidad de Brave, que permite usar funciones de IA directamente dentro del navegador
- Además del cambio de modelo, esta actualización incluye onboarding más claro, control de contexto, formato de entrada y respuesta, y mejoras generales de la interfaz
Por qué eligieron Mixtral 8x7B
- Mixtral 8x7B es un LLM de código abierto presentado por Mistral AI en diciembre, y su uso creció rápidamente en la comunidad de desarrolladores por su velocidad y rendimiento
- Según el LMSYS Chatbot Arena Leaderboard, muestra un rendimiento superior al de ChatGPT 3.5, Claude Instant y Llama 2, entre otros
- Según el benchmark BBQ, también mejora en reducción de alucinaciones y sesgos
- Sus funciones principales son las siguientes
- Manejo de contexto más amplio
- Interacción en inglés, francés, alemán, italiano y español
- Generación de código
Uso de Mixtral dentro de los productos de Brave
- Brave ya usa Mixtral en Code LLM, la función para consultas de programación de Brave Search
- El rendimiento de Mixtral y su carácter de código abierto están alineados con la intención de Brave de apoyar modelos abiertos y la comunidad open source
- Brian Bondy, CTO y cofundador de Brave, señaló que Leo ya fue adoptado por decenas de miles de usuarios gratuitos y suscriptores de pago, y que espera una adopción aún mayor con la incorporación de Mixtral
- Arthur Mensch, CEO de Mistral AI, valoró positivamente que Mixtral se use en CodeLLM de Brave Search y en Brave Leo
Opciones de modelo en gratis y Premium
- Leo permite elegir entre varios modelos según las necesidades y el presupuesto
- Mixtral 8x7B se ofrece como LLM predeterminado tanto en la versión gratuita como en Premium
- Ambos planes también son compatibles con Claude Instant de Anthropic y Llama 2 13B de Meta
- Las condiciones de uso de Leo gratis son las siguientes
- Mixtral 8x7B y Claude Instant tienen límites de uso más estrictos
- Llama 2 13B tiene un límite de uso más alto
- Cuando se alcanza el límite de uso de Mixtral, es posible volver a Llama 2, la experiencia anterior de Leo, para seguir usando la IA
- Leo Premium cuesta 15 dólares al mes y ofrece Mixtral 8x7B, Claude Instant y Llama 2 13B con límites de uso más altos
Cómo protege la privacidad
- El chat de Leo está diseñado con privacidad, anonimato y seguridad como base
- Los chats no se registran ni se usan para entrenar modelos, y no se necesita cuenta ni inicio de sesión para usarlo
- Sus mecanismos de protección de la privacidad son los siguientes
- Proxy inverso: todas las solicitudes se procesan por proxy a través de un servidor de anonimización para evitar vincular la solicitud con la dirección del usuario
- Descarte inmediato de respuestas: las respuestas de Leo se descartan justo después de generarse y las conversaciones no se almacenan en los servidores de Brave
- No recolección de identificadores: no recopila identificadores como direcciones IP que puedan vincularse al usuario
- Sin retención por parte de terceros proveedores: ni el modelo de IA ni los proveedores externos de modelos conservan datos personales
- No requiere cuenta: Leo puede usarse sin crear una cuenta de Brave
- Tokens de suscripción no vinculables: al suscribirse a Leo Premium, la suscripción se valida con tokens que no permiten vincular la información de compra con el uso del producto
Cómo se usa y dónde está disponible
- Leo está integrado en el navegador y puede usarse sin aplicaciones ni extensiones adicionales
- Los usuarios de Brave en escritorio pueden escribir una pregunta en la barra de direcciones y luego hacer clic en “Ask Leo”, o abrir Leo desde Brave Sidebar
- Se accede a las funciones de IA a través de la barra lateral tipo chat junto a la página web o desde la barra de direcciones
- En el contexto de la página admite las siguientes tareas
- Resúmenes en tiempo real de páginas web o videos
- Responder preguntas sobre el contenido
- Generar contenido nuevo
- Traducir páginas
- Analizar páginas
- Reescribir oraciones
- Ayuda para escribir código
- Leo está disponible para usuarios de Brave en escritorio desde noviembre, y esa versión es la 1.60
- Leo para Android e iOS estará disponible pronto
1 comentarios
Opiniones en Hacker News
Para ejecutar Mixtral 8x7B localmente, puedes usar llama.cpp y, junto con bibliotecas/interfaces compatibles como text-generation-webui, usar https://huggingface.co/TheBloke/Nous-Hermes-2-Mixtral-8x7B-S...
Incluso la versión más pequeña con cuantización de 2 bits necesita 20 GB de RAM y se puede hacer offloading a la VRAM de una buena GPU 4090
La versión con cuantización de 4 bits es el modelo más grande que apenas cabe en un sistema de 32 GB, y usa alrededor de 29~31 GB
La de 6 bits usa 41 GB y la de 8 bits 52 GB, así que se necesita un sistema de 64 GB; para hacer offloading a VRAM de modelos con mayor precisión se requieren varias GPU con memoria compartida
He probado modelos 7B y 13B, pero todavía no he experimentado con este ni con otros modelos grandes
Probé dolphin mixtral de 4 bits en una MacBook M3 con 36 GB de RAM y la inferencia fue muy rápida
Es más fácil ejecutar un modelo más grande que la VRAM repartiéndolo entre GPU/CPU
Mixtral admite 32,000 tokens, así que esa parte puede representar una proporción bastante grande de la memoria usada
Brave merece elogios por esta función y por otras funciones de privacidad
Usa un esquema de tokens de suscripción no vinculables, así que al suscribirte a Leo Premium se emite un token que valida la suscripción al usar Leo, y Brave no puede vincular la información de pago con el historial de uso del producto
El correo usado para crear la cuenta tampoco queda vinculado con el uso cotidiano de Leo, por lo que es un enfoque bastante particular de credenciales privadas
Me pregunto si alguien sabe exactamente cómo funciona esto sin usar claves foráneas
Parece que me perdí el primer anuncio de Leo, pero se ve interesante, y me gusta el diseño que toma en cuenta la privacidad
Que no guarde el historial de chat es justo lo que quería
Es lo mismo que no poder verificar las afirmaciones de no logs de los servicios de VPN
https://www.spacebar.news/p/stop-using-brave-browser
Me pregunto cuáles son los buenos proveedores de API que ofrecen Mixtral
Solo conozco OctoAI, que parece estar bien, y me gustaría conocer alternativas
No sé el precio, pero parece que hay que enviar un correo a api@groq.com
El precio también es el mismo que el del proveedor original
Eso sí, para los modelos de OpenAI/Anthropic tuvieron que activar filtrado de entrada/salida por exigencias de esas empresas
Es muy rápido y, con la configuración predeterminada, maneja 10 tareas en paralelo
Together.ai también se vio bien en las pruebas iniciales, pero todavía no lo he usado a gran escala
También ejecuto una versión con cuantización de 3 bits de mixtral-8-7b en un sistema M2 Pro con 32 GB de memoria, y es bastante rápida
Es bueno que haya varias opciones
Durante la última semana probé las versiones en poe y chat.groq.com
Es mucho mejor que llama 70b
Me parece interesante que hayan permitido hacer consultas a LLM directamente desde la barra de direcciones
Me pregunto si más adelante crearán una heurística para decidir si enviar la consulta directamente al LLM o usar el proveedor de búsqueda predeterminado
Al usar mistral después de gpt4, se siente como pasar de ver una pantalla Retina a volver a una pantalla de baja resolución
Uno no deja de pensar: “pero GPT4 sí podría hacer esto”
Estoy ejecutando Mixtral localmente con ollama
Me pregunto si hay alguna buena extensión de Chrome que resuma páginas con IA
Probé algunos de los primeros resultados de Google y funcionan bien, pero estaban inflados con demasiadas funciones innecesarias
https://kagi.com/summarizer/index.html
https://help.kagi.com/kagi/api/summarizer.html
O puedes usar la extensión de navegador de Kagi Search (Chrome/Firefox) para acceder directamente desde la extensión a Muriel, su modelo más avanzado