Rodando LLMs Localmente com MLX
Jul 3, 2026 - ⧖ 2.0 minAlso available in: , English
Após a WWDC 2026, fiquei curioso para tentar rodar o modelo localmente no meu MacBook e tive uma surpresa agradável, pois funciona bem.
Isso não é sobre performance ou melhores resultados, é sobre auto-hospedagem e usar meu hardware para rodar meus próprios modelos.
Às vezes eu gostaria de rodar modelos para pequenas tarefas de desenvolvimento e processamento de texto na minha máquina, não com os melhores resultados ou para me substituir. Escrevo meu código no meu computador pessoal, mas gostaria de um ajudante inteligente para tarefas simples. Depois de assistir à palestra, comecei a configuração e foi muito simples. Selecionei o modelo mlx-community/Qwen3.5-9B-MLX-4bit para rodar no meu MacBook.

Na imagem, podemos ver dois pontos importantes: você precisa de memória na máquina porque LLMs consomem muita memória. O outro ponto importante é a configuração das ferramentas. Usei o OpenCode no terminal para rodar as tarefas principais, assim como na palestra. A configuração foi mais complicada porque não é fácil de encontrar se você não estiver familiarizado com a ferramenta.
Para rodar o modelo é simples, uma linha e sobe um servidor de API local:
mlx_lm.server --model mlx-community/Qwen3.5-9B-MLX-4bit
No Xcode a configuração é mais simples, com a URL simples (http://localhost:8080) e tudo será configurado muito rápido.

E depois é fácil selecionar modelos locais para usar no Apple Intelligence dentro do Xcode.

Conclusão
Até este momento minha experiência está muito feliz com a estratégia de modelos locais e meu próximo passo é cancelar a assinatura do CoPilot, vou migrar para a API do OpenCode como backup e para usar em alguns casos onde preciso rodar novos modelos remotamente.
Outro ponto é que talvez um hardware melhor melhore minha experiência, um M5 Pro tem alguns recursos novos e melhora os modelos locais.