- Nativ es una app open source con licencia MIT que descarga y ejecuta modelos de IA abiertos en Macs con Apple Silicon, sin cuentas, suscripciones ni nube
- Ofrece modelos de Google, Cohere, Liquid AI y otros; recomienda modelos adecuados para el hardware de tu Mac y genera todas las respuestas de forma local
- En el chat admite streaming, Markdown, resaltado de código e ingreso de imágenes, y permite consultar en tiempo real el estado de rendimiento, como tokens por segundo y presión de memoria
- Está optimizada para MLX-VLM y la memoria unificada y Metal de la serie M, y procesa tareas de lenguaje, visión, video, código y audio
- El servidor local de modelos puede conectarse con Pi, Codex, Claude Code, Hermes y OpenCode, y también está disponible todo el código de la app y del cargador de modelos
Ejecución de modelos locales optimizada para Mac
- Es una app universal para macOS compatible con Apple Silicon M1 o superior que ejecuta modelos reales en la Mac, sin nube ni una capa de conversión adicional
- Permite elegir modelos abiertos de Google, Cohere y Liquid AI desde una biblioteca seleccionada, y también recibir recomendaciones de modelos adecuados para el hardware
- La interfaz de chat ofrece las siguientes funciones
- Respuestas por streaming y métricas de rendimiento por mensaje
- Markdown y resaltado de sintaxis de código
- Ingreso de imágenes
- Con la medición de rendimiento en tiempo real, permite consultar tokens por segundo, presión de memoria, estado térmico y tiempo hasta generar el primer token
- Basada en MLX-VLM, está ajustada para la memoria unificada y Metal de la serie M
- Admite chat con LLM, generación de captions para imágenes, resumen de videos, autocompletado de código, conversión y generación de voz
- No requiere cuentas, créditos ni suscripciones, y no vende datos de usuarios
Integración con herramientas de desarrollo y principios open source
- A través del endpoint local único de Nativ, se pueden conectar agentes de programación existentes con modelos locales ejecutándose en la Mac
- Pi
- Codex
- Claude Code
- Hermes
- OpenCode
- Publica todo el código, incluida la app de escritorio, el cargador de modelos y los gráficos de medición de rendimiento, para que se pueda revisar, hacer fork y enviar Pull Requests
- Se distribuye bajo licencia MIT, sin roadmap de VC, niveles empresariales ni dark patterns que conviertan los prompts en datos de entrenamiento
- La biblioteca completa de modelos se puede consultar en Hugging Face
1 comentarios
Opiniones de Hacker News
Esta app con licencia MIT fue creada por Prince Canuma, quien mantiene la popular biblioteca MLX-VLM. MLX-VLM se ha usado durante mucho tiempo como dependencia en herramientas como LM Studio, ya que puede ofrecer inferencia más rápida que llama.cpp en dispositivos Apple.
El ecosistema MLX es más pequeño que CUDA, pero agrega soporte muy rápido para modelos nuevos, en especial modelos multimodales como visión, reconocimiento de voz, síntesis de voz y generación de video. También vale la pena ver mlx-audio-swift, y no sorprendería que esos modelos se integren en esta UI.
Aunque la landing page pueda mostrar rastros de vibe coding, la mayor parte de la app está escrita en Swift, así que parece relativamente fácil portar este stack de inferencia a iPad y iPhone.
blaizzyen el dominio, porque el trabajo de Prince Canuma relacionado con MLX siempre ha sido de una calidad especialmente alta.mlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16para clonación de voz.Para soportar samplers modernos, se puede empezar revisando paper 1, paper 2 y paper 3.
Siento que se está abusando del término frontera. Pensaba que se refería a modelos de primer nivel, como Fable hoy, pero esos modelos requieren muchísima RAM y GPUs caras, así que parecen difíciles de autoalojar.
El gráfico de Artificial Analysis lo hace intuitivo. Por ejemplo, como no hay un modelo tan inteligente como DeepSeek V4 Pro que además sea más barato, puede considerarse un modelo de frontera. Una solución en la frontera de Pareto es la mejor en su categoría: no puede reemplazarse por una alternativa mejor sin sacrificar algo más.
Cada vez que uso Gemma 4 12B, me queda la sensación de que, pese a ser pequeño, inteligente y eficiente, la energía de la industria de IA va en una dirección totalmente equivocada. Si el presupuesto de investigación se concentrara en mejorar modelos que corran en sistemas con 16 GB de memoria unificada, podrían lograrse avances importantes.
Qwen 3.6 y el modelo ajustado de 27B de BottleCap también son buenos, pero el desempeño sorprendente de los modelos Gemma 4 pequeños no es suficientemente conocido. Aunque parece inapropiado que este sitio use el término frontera para Qwen 3.6 27B, en términos de rendimiento no está tan alejado.
Me sorprendió que la página principal lo presente como si no existieran apps ya establecidas como LM Studio. A primera vista no queda claro qué lo diferencia, y tampoco se menciona Open WebUI.
Llevo semanas ejecutando DeepSeek V4 Flash localmente en una MacBook Pro con Open WebUI y DS4.
Ahora frontera se volvió una palabra abusada, como
load-bearingpara quienes usan Claude Code. En especial, esta app no puede ejecutar localmente en una Mac los verdaderos modelos de punta, así que ojalá dejen de usarla.No me gustan las frases de marketing como “por qué somos open source cuando nadie más lo hace”. Yo uso oMLX, que es open source y parece ofrecer todas las funciones de Nativ.
Me gustaría que lo compararan correctamente con competidores open source existentes, en vez de tratarlos como si no existieran.
Me da curiosidad para qué se usan realmente los modelos locales pequeños. Ya se volvieron bastante capaces, pero todavía cuesta confiarles trabajo real más allá de algunos proyectos de juguete hechos por diversión.
Me pregunto si de verdad los usan como agentes de programación o si principalmente son para otros usos.
Le cuesta escribir desde cero código que requiere conocimiento especializado, como un motor de inferencia de alto rendimiento para GPU Blackwell, pero para PR comunes que agregan casos de uso a proyectos existentes está a un nivel similar a Sonnet. Requiere una configuración correcta, como los valores recomendados de temperature y top-p, una cuantización no excesiva y al menos 150 mil tokens de contexto.
El agente objetivo usa DeepSeek V4 Flash; el modelo local es lento para usarse como agente de chat, pero funciona bastante bien para la extracción de memoria y reduce el uso de API en cada turno de conversación.
--help, Markdown y escribir README. Si fallan, basta con revertir congit restoreo rechazar el PR y pasárselo de nuevo a un modelo mejor.Me pregunto qué tiene de mejor frente a LM Studio y si también ejecuta modelos MTP. Hasta donde sé, los modelos MTP están en formato GGUF.
Probé MLX con Rapid MLX, pero Qwen se cortaba constantemente y repetía lo mismo. Al pasarme a llama.cpp, la generación de tokens con MTP fue más rápida y el modelo también fue más estable.
Me da curiosidad qué resultados han obtenido otros al comparar MLX y llama.cpp.
En los modelos que probé, a veces el rendimiento de GGUF en llama.cpp era mejor. El MTP de Gemma 4 no aportó mucho valor, pero en Qwen 3.6 MoE sí hubo una diferencia medible, y en hardware más reciente podría ser más significativa.
Me pregunto cuál sería una especificación intermedia razonable de Mac para este uso. Estoy entre una M5 Pro de 64 GB y una M5 Air barata más pagar tokens en la nube.
En lugar de gastar 2,000–3,000 dólares más para correr localmente modelos de menor rendimiento, se puede comprar una cantidad considerable de tokens en la nube.
Me pregunto por qué no ejecutar DeepSeek V4 sobre ds4. Creo que los resultados serían bastante buenos.