O Beam, da Reflection, tem 501 bilhões de parâmetros e pesos abertos. Com pesos abertos, a operação é sua
A Reflection anunciou o Beam, modelo mixture-of-experts de 501 bilhões de parâmetros para código e agentes, sob Apache 2.0. Os pesos saem ainda este mês, depois do red teaming final.
Ouça este artigo · 5 min
Narração completa do artigo, gerada por IA.

Em 5 de outubro, a Reflection apresentou o Beam, seu primeiro modelo de pesos abertos, feito para código, raciocínio e trabalho agêntico. Se as promessas se confirmarem, as empresas ganham mais um modelo capaz que pode rodar na própria infraestrutura. Antes de alguém baixar o modelo, vale entender o que os pesos abertos de fato transferem: não só controle, mas as tarefas de operação que a API escondia.
O que a Reflection anunciou, e o que ainda não entregou
- Arquitetura. Um modelo mixture-of-experts esparso com 501 bilhões de parâmetros no total e 23 bilhões ativos por token. Contexto de 256 mil tokens no aprendizado por reforço, estendido a 1 milhão no midtraining.
- Treinamento. Pré-treino com 23,8 trilhões de tokens em 6.144 GPUs NVIDIA GB300 em menos de quatro semanas; aprendizado por reforço com mais de 100 milhões de rollouts em cerca de 10.500 GPUs GB300 ao longo de quatro semanas.
- Licença. Apache 2.0, permissiva, que admite uso comercial.
- Status. O Beam está em fase final de red teaming e avaliações. A Reflection diz que vai publicar os pesos, o relatório técnico, o model card e os artefatos para desenvolvedores ainda este mês. Hoje existe uma lista de espera para acesso antecipado na plataforma da empresa.
- Benchmarks. A Reflection informa resultados como 77,2% no SWE Bench Pro v2-Hard e 90,5% no GPQA Diamond. São números da própria empresa até aparecerem avaliações independentes.
O status honesto hoje é um anúncio com licença e data, não um modelo para download. Isso é útil: dá ao time de plataforma algumas semanas para se preparar.
O que passa para você quando você roda os pesos
- Capacidade e disponibilidade
- Correções e atualizações
- Testes de segurança para o seu uso
- Avaliação nas suas tarefas
- Fronteira e retenção dos dados
- Custo por resposta aceita
Sua de qualquer jeito
Capacidade é a primeira surpresa. “23 bilhões ativos” descreve o cálculo por token, não a memória. Os 501 bilhões de parâmetros precisam estar carregados para servir o modelo: cerca de 500 GB de pesos com 8 bits por parâmetro, cerca de 1 TB com 16 bits, antes da memória para contextos longos. Isso é, no mínimo, um servidor com várias GPUs, e produção com redundância exige mais de um. No Brasil, onde GPU de última geração é cara, cotada em dólar e com prazo de entrega longo, essa conta decide o projeto antes da qualidade do modelo. Dimensione pelo total de parâmetros, não pelos ativos.
Atualizar vira release seu. Com API, o provedor publica correções e versões no ritmo dele. Com pesos, nada muda até você mudar, o que é bom para estabilidade e ruim se um problema de segurança aparecer depois. Alguém precisa acompanhar novas versões, rodar de novo as avaliações e fazer o rollout, como em qualquer troca de modelo.
O teste de segurança é em parte seu. A Reflection está terminando o red teaming antes do lançamento. Ela não consegue testar as ferramentas, os dados e as permissões do seu agente. Um agente de código que executa comandos precisa de testes adversariais seus, no seu ambiente.
A fronteira dos dados é o ganho. Prompts, código e respostas não saem da sua infraestrutura. Para quem hoje manda dados pessoais a uma API no exterior, isso tira do caminho a transferência internacional de dados regulada pela LGPD e pela ANPD, e simplifica a conversa com o DPO. Para bancos e para quem protege código proprietário, pode justificar o esforço. É a mesma lógica de custódia que discutimos nos agentes de código auto-hospedados.
Onde o Beam pode caber
Nem toda tarefa precisa de um generalista de fronteira, e nem todo modelo precisa ser o maior. No nosso framework de portfólio de modelos, um modelo de pesos abertos como o Beam seria candidato aos papéis em que custódia ou custo em volume pesam mais do que ter a melhor resposta possível: assistência de código em repositórios sensíveis, ou etapas de agentes que rodam milhares de vezes por dia. Só o seu conjunto de avaliação decide se ele merece o papel.
O que fazer agora
- Monte um conjunto de avaliação com tarefas reais de código e de agentes antes de os pesos chegarem.
- Dimensione a capacidade pelo total de parâmetros, com redundância e memória para contexto longo.
- Leia o model card e o relatório técnico quando saírem, antes de qualquer piloto.
- Confira os pesos baixados contra os checksums do publicador e guarde-os como artefato controlado.
- Planeje o seu red teaming para as ferramentas e permissões que os agentes terão.
- Compare custo por resposta aceita, em reais, com a API que você usa hoje, e não custo por token.
Para fechar
O Beam pode somar uma opção forte e com licença permissiva aos portfólios de modelos, mas os pesos ainda não saíram e os benchmarks são da própria Reflection. Use as semanas até o lançamento para decidir se você quer as tarefas que vêm junto com rodar um modelo, porque com pesos abertos elas são suas.