A Meta anunciou o lançamento do Muse Glimmer, um modelo de inteligência artificial multimodal de 30 bilhões de parâmetros, disponível em código aberto no Hugging Face Hub. O sistema processa texto, imagem e vídeo, executa chamadas de ferramentas e pode atuar como assistente pessoal em execução local.

Arquitetura

O modelo combina um encoder de visão de 2 bilhões de parâmetros com um decoder de texto de 28 bilhões. A atenção híbrida alterna entre janelas deslizantes e atenção global, e cabeças de atenção compartilhadas reduzem o consumo de memória. Um mecanismo opcional de decodificação especulativa, o DFlash, acelera a geração de respostas, sobretudo em tarefas estruturadas como programação.

Desempenho

Em benchmarks, o Muse Glimmer superou concorrentes em várias tarefas agênticas e de raciocínio. No MCP Atlas, marcou 75,5 pontos, contra 54,2 do Gemma4 e 62,5 do Qwen3.6. No AIME 2026, alcançou 94,7, à frente de ambos. No SWE-Bench Verified, obteve 76,0, atrás do Qwen3.6 (77,2), mas acima do Gemma4 (66,6).

Disponibilidade

A Meta garantiu suporte de primeiro dia em transformers, llama.cpp, vLLM e Inference Endpoints. O modelo pode ser executado em GPUs NVIDIA, AMD ou Intel, via llama.cpp local ou em endpoints gerenciados com API compatível com OpenAI. A empresa também disponibilizou exemplos de fine-tuning com TRL.

O lançamento reforça a tendência de modelos abertos para uso local, com capacidade de se autoquantizar, se implantar em infraestrutura remota e otimizar o próprio motor de inferência para hardware específico.

Continue no Radar