1 puntos por GN⁺ 4 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Nativ es una app open source con licencia MIT que descarga y ejecuta modelos de IA abiertos en Macs con Apple Silicon, sin cuentas, suscripciones ni nube
  • Ofrece modelos de Google, Cohere, Liquid AI y otros; recomienda modelos adecuados para el hardware de tu Mac y genera todas las respuestas de forma local
  • En el chat admite streaming, Markdown, resaltado de código e ingreso de imágenes, y permite consultar en tiempo real el estado de rendimiento, como tokens por segundo y presión de memoria
  • Está optimizada para MLX-VLM y la memoria unificada y Metal de la serie M, y procesa tareas de lenguaje, visión, video, código y audio
  • El servidor local de modelos puede conectarse con Pi, Codex, Claude Code, Hermes y OpenCode, y también está disponible todo el código de la app y del cargador de modelos

Ejecución de modelos locales optimizada para Mac

  • Es una app universal para macOS compatible con Apple Silicon M1 o superior que ejecuta modelos reales en la Mac, sin nube ni una capa de conversión adicional
  • Permite elegir modelos abiertos de Google, Cohere y Liquid AI desde una biblioteca seleccionada, y también recibir recomendaciones de modelos adecuados para el hardware
  • La interfaz de chat ofrece las siguientes funciones
    • Respuestas por streaming y métricas de rendimiento por mensaje
    • Markdown y resaltado de sintaxis de código
    • Ingreso de imágenes
  • Con la medición de rendimiento en tiempo real, permite consultar tokens por segundo, presión de memoria, estado térmico y tiempo hasta generar el primer token
  • Basada en MLX-VLM, está ajustada para la memoria unificada y Metal de la serie M
  • Admite chat con LLM, generación de captions para imágenes, resumen de videos, autocompletado de código, conversión y generación de voz
  • No requiere cuentas, créditos ni suscripciones, y no vende datos de usuarios

Integración con herramientas de desarrollo y principios open source

  • A través del endpoint local único de Nativ, se pueden conectar agentes de programación existentes con modelos locales ejecutándose en la Mac
    • Pi
    • Codex
    • Claude Code
    • Hermes
    • OpenCode
  • Publica todo el código, incluida la app de escritorio, el cargador de modelos y los gráficos de medición de rendimiento, para que se pueda revisar, hacer fork y enviar Pull Requests
  • Se distribuye bajo licencia MIT, sin roadmap de VC, niveles empresariales ni dark patterns que conviertan los prompts en datos de entrenamiento
  • La biblioteca completa de modelos se puede consultar en Hugging Face

1 comentarios

 
GN⁺ 4 시간 전
Opiniones de Hacker News
  • Esta app con licencia MIT fue creada por Prince Canuma, quien mantiene la popular biblioteca MLX-VLM. MLX-VLM se ha usado durante mucho tiempo como dependencia en herramientas como LM Studio, ya que puede ofrecer inferencia más rápida que llama.cpp en dispositivos Apple.
    El ecosistema MLX es más pequeño que CUDA, pero agrega soporte muy rápido para modelos nuevos, en especial modelos multimodales como visión, reconocimiento de voz, síntesis de voz y generación de video. También vale la pena ver mlx-audio-swift, y no sorprendería que esos modelos se integren en esta UI.
    Aunque la landing page pueda mostrar rastros de vibe coding, la mayor parte de la app está escrita en Swift, así que parece relativamente fácil portar este stack de inferencia a iPad y iPhone.

    • Hoy en Hugging Face ya están disponibles versiones MLX de casi todos los modelos populares. Por ejemplo, desde la página principal de Qwen 3.6 35B-A3B, basta seguir los enlaces de cuantización y elegir una variante MLX popular y con buena reputación.
    • Me alegró ver blaizzy en el dominio, porque el trabajo de Prince Canuma relacionado con MLX siempre ha sido de una calidad especialmente alta.
    • En el repositorio de GitHub se indica que pronto se agregará soporte para modelos solo de audio y solo de generación de imágenes. Prince Canuma responde muy rápido en X y en issues de GitHub, y yo uso casi a diario mlx-audio y mlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16 para clonación de voz.
    • La primera pregunta que me vino a la mente fue en qué se diferencia de Unsloth.
    • mlx-vlm, al igual que vllm o sglang, tiene un soporte pésimo para samplers modernos, así que cambiarse podría ser incluso perjudicial. Soy uno de los autores del paper de min_p, y si min_p es lo mejor disponible cuando llama.cpp soporta top-n-sigma, que es mucho mejor, entonces no hay razón para migrar aunque sea más rápido.
      Para soportar samplers modernos, se puede empezar revisando paper 1, paper 2 y paper 3.
  • Siento que se está abusando del término frontera. Pensaba que se refería a modelos de primer nivel, como Fable hoy, pero esos modelos requieren muchísima RAM y GPUs caras, así que parecen difíciles de autoalojar.

    • Aquí parece referirse a la frontera de Pareto, el conjunto de mejores soluciones en un problema de optimización multiobjetivo. Si se consideran inteligencia y precio, un modelo está en la frontera cuando no existe otro que ofrezca igual o mayor inteligencia por menos precio, ni otro más inteligente por el mismo precio o menos.
      El gráfico de Artificial Analysis lo hace intuitivo. Por ejemplo, como no hay un modelo tan inteligente como DeepSeek V4 Pro que además sea más barato, puede considerarse un modelo de frontera. Una solución en la frontera de Pareto es la mejor en su categoría: no puede reemplazarse por una alternativa mejor sin sacrificar algo más.
    • No me convence este uso porque genera confusión, pero en general puede haber varias fronteras, y creo que la frontera de los modelos locales pequeños con pesos abiertos es la más importante e interesante.
      Cada vez que uso Gemma 4 12B, me queda la sensación de que, pese a ser pequeño, inteligente y eficiente, la energía de la industria de IA va en una dirección totalmente equivocada. Si el presupuesto de investigación se concentrara en mejorar modelos que corran en sistemas con 16 GB de memoria unificada, podrían lograrse avances importantes.
      Qwen 3.6 y el modelo ajustado de 27B de BottleCap también son buenos, pero el desempeño sorprendente de los modelos Gemma 4 pequeños no es suficientemente conocido. Aunque parece inapropiado que este sitio use el término frontera para Qwen 3.6 27B, en términos de rendimiento no está tan alejado.
    • La frontera se define como una combinación óptima en varias dimensiones, como cantidad de parámetros, desempeño por tarea, velocidad de generación de tokens en el mismo hardware y requisitos de memoria activa. Entre las opciones actuales, un modelo pertenece a la frontera si mejorar una métrica obliga a empeorar al menos otra.
    • La frontera es una curva y se refiere al frente de Pareto.
    • La brecha entre open source y la frontera se está reduciendo con modelos como Kimi K3, pero Kimi K3 tiene más de 2 billones de parámetros. Modelos como Gemma 4, que sí pueden correr realmente en una Mac común, no están en la misma categoría.
  • Me sorprendió que la página principal lo presente como si no existieran apps ya establecidas como LM Studio. A primera vista no queda claro qué lo diferencia, y tampoco se menciona Open WebUI.
    Llevo semanas ejecutando DeepSeek V4 Flash localmente en una MacBook Pro con Open WebUI y DS4.

    • LM Studio es software cerrado construido sobre código que el desarrollador de Nativ publicó.
    • LM Studio hace lo mismo, pero no es open source. Así que Nativ sí ofrece una diferencia adicional.
    • La frase “otras apps locales de IA que has escuchado nombrar son shells propietarios sobre motores open source que no poseen” es una forma indirecta de apuntar a LM Studio.
    • Me da curiosidad la configuración de tu MacBook. En mi Strix Halo, DeepSeek V4 Flash es demasiado lento para usarlo con agentes.
  • Ahora frontera se volvió una palabra abusada, como load-bearing para quienes usan Claude Code. En especial, esta app no puede ejecutar localmente en una Mac los verdaderos modelos de punta, así que ojalá dejen de usarla.

  • No me gustan las frases de marketing como “por qué somos open source cuando nadie más lo hace”. Yo uso oMLX, que es open source y parece ofrecer todas las funciones de Nativ.
    Me gustaría que lo compararan correctamente con competidores open source existentes, en vez de tratarlos como si no existieran.

    • Probablemente intentaban decir por qué opciones como LM Studio no son open source.
  • Me da curiosidad para qué se usan realmente los modelos locales pequeños. Ya se volvieron bastante capaces, pero todavía cuesta confiarles trabajo real más allá de algunos proyectos de juguete hechos por diversión.
    Me pregunto si de verdad los usan como agentes de programación o si principalmente son para otros usos.

    • En OpenCode he llegado a desplegar en producción código generado por Qwen3.6 27B. No tiene un rango de conocimiento tan amplio como Opus, pero si puede inferir por completo los cambios solo con el prompt y el código alrededor, funciona muy bien.
      Le cuesta escribir desde cero código que requiere conocimiento especializado, como un motor de inferencia de alto rendimiento para GPU Blackwell, pero para PR comunes que agregan casos de uso a proyectos existentes está a un nivel similar a Sonnet. Requiere una configuración correcta, como los valores recomendados de temperature y top-p, una cuantización no excesiva y al menos 150 mil tokens de contexto.
    • Uso Gemma 4 localmente para la extracción de grafos de memoria de un agente personal. Divide los mensajes en temas, fuentes, hechos, entidades, etc., y los incorpora a un grafo para búsquedas con NLEmbeddings.
      El agente objetivo usa DeepSeek V4 Flash; el modelo local es lento para usarse como agente de chat, pero funciona bastante bien para la extracción de memoria y reduce el uso de API en cada turno de conversación.
    • No los uso como agentes de programación, pero son muy útiles para transformación de texto, resúmenes y extracción de información. Si ya pagas una suscripción a modelos de pago, quizá no haya un beneficio especial aparte de la privacidad, pero eso por sí solo tampoco es despreciable.
    • Incluso los modelos pequeños manejan bastante bien tareas repetitivas como actualizar dependencias, resolver conflictos de merge, --help, Markdown y escribir README. Si fallan, basta con revertir con git restore o rechazar el PR y pasárselo de nuevo a un modelo mejor.
    • Qwen35ba3b puede hacer limpieza de datos a gran escala incluso en hardware relativamente común. Con dos GPU 3090 ya procesó alrededor de 100 mil millones de tokens.
  • Me pregunto qué tiene de mejor frente a LM Studio y si también ejecuta modelos MTP. Hasta donde sé, los modelos MTP están en formato GGUF.

  • Probé MLX con Rapid MLX, pero Qwen se cortaba constantemente y repetía lo mismo. Al pasarme a llama.cpp, la generación de tokens con MTP fue más rápida y el modelo también fue más estable.
    Me da curiosidad qué resultados han obtenido otros al comparar MLX y llama.cpp.

    • En un M1 Max casi no vi beneficios con MLX. Es posible que la ventaja sea mayor en M3 o superior gracias a los cambios en Apple Neural Engine.
      En los modelos que probé, a veces el rendimiento de GGUF en llama.cpp era mejor. El MTP de Gemma 4 no aportó mucho valor, pero en Qwen 3.6 MoE sí hubo una diferencia medible, y en hardware más reciente podría ser más significativa.
    • Probé MLX dos veces en momentos distintos, y en ambas ocasiones mostró un rendimiento bastante inferior al de llama.cpp.
  • Me pregunto cuál sería una especificación intermedia razonable de Mac para este uso. Estoy entre una M5 Pro de 64 GB y una M5 Air barata más pagar tokens en la nube.
    En lugar de gastar 2,000–3,000 dólares más para correr localmente modelos de menor rendimiento, se puede comprar una cantidad considerable de tokens en la nube.

    • Incluso en una M1 Max de 64 GB se pueden ejecutar bastantes de estos modelos.
  • Me pregunto por qué no ejecutar DeepSeek V4 sobre ds4. Creo que los resultados serían bastante buenos.

    • Nativ no parece admitir streaming desde SSD como DwarfStar.