Meta lança Muse Glimmer, IA open source de 30B que roda em GPU consumer
O Meta Superintelligence Labs anunciou nesta segunda-feira (10) o Muse Glimmer, novo modelo de linguagem de 30 bilhões de parâmetros (30B) com pesos abertos sob licença Apache 2.0. O destaque da proposta é o foco em fluxos de agentes locais “always-on”: segundo a Meta, o modelo é pequeno o suficiente para rodar em uma única GPU consumer e foi treinado para concluir tarefas agênticas de ponta a ponta, com raciocínio em múltiplas etapas.
Os pesos já estão disponíveis para download no Hugging Face, e o lançamento chegou com suporte de dia zero ao ecossistema de IA local: o Ollama 0.32.7 foi atualizado no mesmo dia para suportar o modelo, que também funciona no LM Studio, no llama.cpp, no Unsloth e na biblioteca Transformers.
Arquitetura: 30B com visão de imagens e vídeos
O Muse Glimmer é um modelo denso (não-MoE) que combina um decodificador de texto de 28B de parâmetros com um codificador de visão de 2B no estilo ViT, baseado na arquitetura Perception Encoder da Meta. Na prática, isso o torna multimodal: além de texto, ele aceita imagens e vídeos como entrada e é capaz de executar “multimodal tool calling” — chamar ferramentas externas com base no que enxerga em uma imagem.
De acordo com a documentação técnica publicada no Hugging Face, o modelo foi destilado a partir do Muse Spark, um dos modelos maiores da Meta, e otimizado para implantações locais. Um módulo opcional de decodificação especulativa (drafter DFlash) promete acelerar a geração, especialmente em conteúdo estruturado, como código.
A Meta também enfatiza que o Glimmer foi ajustado para uso de ferramentas, tarefas longas e recuperação de falhas — recursos essenciais para agentes de codificação e assistentes autônomos que ficam horas executando fluxos na máquina do usuário.
Desempenho à frente de rivais abertos da mesma classe
No BionicBench v0.1, avaliação de fluxos agênticos reais divulgada pelo LM Studio — que inclui 18 tarefas como programar, seguir instruções de repositórios, editar documentos Word, PowerPoint e Excel, interpretar capturas de tela e gerar PDFs —, o Muse Glimmer concluiu 83,3% das tarefas, à frente de concorrentes diretos como Gemma 4 31B (77,7%) e Qwen 3.6 27B (77,7%).
A Meta também reporta desempenho competitivo em avaliações de codificação (como SWE-Bench) e segurança, posicionando o modelo para usos como LLM-as-a-judge — quando um modelo é usado para avaliar as saídas de outros modelos.
Uma única GPU consumer basta
A promessa de rodar fora do data center é o coração do lançamento. Em precisão BF16, o modelo exige cerca de 80 GB de VRAM (classe H100). Porém, com as quantizações calibradas (GGUF) distribuídas pela Meta — e as versões otimizadas pelo Unsloth —, o consumo cai a ponto de caber em placas consumer e em Macs com memória unificada, além de plataformas como AMD Ryzen AI Max e Radeon.
O mesmo código roda em GPUs NVIDIA (CUDA), AMD (ROCm) e Intel (XPU), ampliando o leque de hardware compatível.
Como baixar e rodar o Muse Glimmer
O modelo está no Hugging Face, inclusive em formato GGUF. Quem usa Ollama basta atualizar para a versão 0.32.7+ e baixar o modelo; no llama.cpp, um único comando sobe um servidor local com interface web; no LM Studio, ele aparece direto no catálogo; e o Unsloth atende quem deseja fazer fine-tuning em casa.
Rodar localmente tem dois apelos práticos: privacidade (os dados não saem da máquina) e custo zero por token, além de viabilizar agentes 24/7.
A disputa da IA aberta esquenta
Com a licença Apache 2.0, uma das mais permissivas do mercado, a Meta reforça sua estratégia de competir no terreno de pesos abertos contra famílias como Gemma (Google) e Qwen (Alibaba). “Estamos animados em liberar os pesos abertos do Muse Glimmer hoje, um modelo denso de 30B que pode rodar localmente”, celebrou Alexandr Wang, do Meta Superintelligence Labs, ao anunciar o lançamento.
Para quem desenvolve agentes locais, ferramentas de codificação ou avaliação automatizada, o Muse Glimmer chega como uma das opções abertas mais interessantes de 2026 — e como sinal de que a fronteira da IA “no seu hardware” avança rápido.
Ficha técnica
- Parâmetros: 30B densos (28B texto + 2B visão)
- Multimodal: texto, imagens e vídeos (entrada)
- Licença: Apache 2.0
- Origem: destilado do Muse Spark (Meta Superintelligence Labs)
- Onde baixar: Hugging Face
- Suporte: Ollama 0.32.7+, LM Studio, llama.cpp, Unsloth, Transformers
- Hardware: GPUs NVIDIA, AMD e Intel; Macs e PCs com GPU consumer

Carlos Araújo
Especialista em tecnologia e fundador da SuaInternet.COM. Com sólida experiência em desenvolvimento de software e inteligência artificial, dedica-se a criar soluções de alta performance e sites otimizados que conectam marcas a resultados. Entusiasta de sistemas Linux e automação, partilha aqui análises técnicas e tendências do ecossistema digital.