← Todos os insights

Análise de tendênciaRecorte: Brasil5 min de leitura

Build vs. buy agora vale também para a busca. O que o Compass Cloud e o Embed 5, da Cohere, mudam

A Cohere está transformando a sua camada de busca em serviço gerenciado, com API, MCP e permissões na consulta, e lançou novos embeddings. Como decidir o que construir e o que comprar.

Ouça este artigo · 6 min

Narração completa do artigo, gerada por IA.

Dois grandes dutos lado a lado ao longo de uma vala de cascalho, em duotone La Madre, ao lado das palavras Busca como serviço
Foto: Jay Mantri (StockSnap, CC0)

Pergunte a um time de IA enterprise onde vai o tempo dele, e a busca costuma aparecer no topo da lista. Conectar SharePoint e Google Drive, interpretar PDFs escaneados e apresentações, escolher um modelo de embeddings, manter um índice vetorial, somar busca por palavra-chave e um reranker e, o mais difícil, garantir que ninguém recupere um documento que não tem permissão para abrir.

Dois anúncios da Cohere no fim de setembro mostram essa camada virando um produto que dá para comprar como serviço. Isso não torna a decisão fácil, mas muda as opções.

O que a Cohere anunciou

O Compass Cloud, anunciado em 25 de setembro, é uma versão gerenciada da plataforma de busca da Cohere, em beta privado com um número limitado de empresas parceiras. Segundo a Cohere, ele cobre o pipeline inteiro:

  • conecta fontes como SharePoint, OneDrive e Google Drive;
  • interpreta documentos, inclusive conteúdo multimodal;
  • gera embeddings densos e esparsos e os indexa separados dos arquivos de origem;
  • recupera com busca híbrida (semântica, esparsa e por palavra-chave) e depois reordena os resultados;
  • governa com controle de acesso multi-tenant e permissões por documento aplicadas no momento da busca.

O acesso é feito de três formas: uma API para aplicações próprias de busca e RAG, um servidor MCP dedicado e com versões independentes para agentes, e um SDK em Python. O anúncio não informa em quais regiões o serviço roda.

O Embed 5, anunciado em 30 de setembro, é uma nova família de modelos de embeddings em duas versões, Pro e Fast, em disponibilidade geral na API da Cohere, no Microsoft Foundry e no Amazon SageMaker. A Cohere informa contexto de 128 mil tokens, mais de 100 idiomas, entrada de texto e imagem, vetores de 2.048 até 256 dimensões e formatos comprimidos. Os preços publicados são de US$ 0,12 por milhão de tokens de texto no Pro e US$ 0,08 no Fast. Os resultados de benchmark divulgados são da própria Cohere.

O que um serviço de busca gerenciado assume, e o que não assumeGERENCIADO NO COMPASS CLOUD, SEGUNDO A COHERE (BETA PRIVADO)CONTINUA SEU01Conectar asfontes02Interpretardocumentos03Gerarembeddingse indexar04Buscahíbrida ereordenação05Aplicarpermissõespordocumento06Definirrelevânciae avaliarJá pode ser comprado como serviçoNão dá para terceirizar
  1. Conectar as fontes
  2. Interpretar documentos
  3. Gerar embeddings e indexar
  4. Busca híbrida e reordenação
  5. Aplicar permissões por documento
  6. Definir relevância e avaliar
  • Gerenciado no Compass Cloud, segundo a Cohere (beta privado): Conectar as fontes · Interpretar documentos · Gerar embeddings e indexar · Busca híbrida e reordenação · Aplicar permissões por documento
  • Continua seu: Definir relevância e avaliar

Já pode ser comprado como serviçoNão dá para terceirizar

A infraestrutura virou produto. A definição de uma boa resposta para o seu negócio, não.

Como pensar em construir ou comprar

Permissões decidem a conta. A maioria dos projetos internos de busca subestima a aplicação de permissões. Espelhar os controles de acesso do SharePoint ou do Drive em um índice vetorial, mantê-los sincronizados e aplicá-los na hora da consulta é difícil de acertar. Um serviço que faz isso como parte da busca elimina um risco grande. E também exige verificação: teste com usuários que devem e que não devem ver documentos específicos antes do go-live.

Embeddings criam um lock-in silencioso. Trocar de modelo de embeddings significa gerar de novo os vetores e reindexar todos os documentos. Em um serviço gerenciado, isso é trabalho do fornecedor, no calendário do fornecedor. No seu próprio stack, você controla o momento e paga o custo. Nos dois casos, trate a troca de modelo como migração, e não como ajuste de configuração.

Dimensões são alavanca de custo. Vetores menores e formatos comprimidos reduzem armazenamento e custo de busca, em geral com alguma perda de qualidade. Teste o trade-off nos seus documentos em vez de supor que a maior opção é necessária.

O MCP muda quem consome a busca. Uma camada de busca exposta via MCP foi feita para ser chamada por agentes, não só por uma interface de chat. Isso a transforma em infraestrutura compartilhada, com dono, níveis de serviço e política de acesso próprios.

A avaliação continua com você. Nenhum serviço gerenciado sabe o que é um resultado relevante para o seu time de sinistros ou para o jurídico. A disciplina que descrevemos no nosso artigo sobre como medir a busca vale para qualquer coisa que você compre.

O que isso significa no Brasil

Dois pontos pedem atenção especial por aqui.

Português precisa de teste próprio. O anúncio do Embed 5 cita mais de 100 idiomas, mas, nos destaques de desempenho por idioma, o português não aparece. Isso não quer dizer que o modelo vá mal em português; quer dizer que você precisa medir, com os seus documentos, o seu vocabulário e as suas siglas.

Índice também é dado. Embeddings gerados a partir de documentos com dados pessoais devem ser tratados com o mesmo cuidado dos próprios documentos. Como o Compass Cloud não informa regiões, pergunte onde ficam o índice e os vetores antes de conectar fontes com dados de clientes. Se ficarem fora do Brasil, a LGPD trata isso como transferência internacional de dados. Para o Embed 5, rodar o modelo pelo Foundry ou pelo SageMaker na sua própria conta de nuvem pode ajudar a manter o processamento perto dos dados; confira a disponibilidade na região que você usa.

O que fazer agora

  1. Liste as suas fontes e os modelos de permissão de cada uma antes de falar com fornecedores.
  2. Monte uma bateria de testes de permissão: usuários reais, documentos reais, resultados esperados de acesso e bloqueio.
  3. Compare embeddings no seu próprio acervo em português, incluindo documentos escaneados e tabelas, se houver.
  4. Pergunte sobre reindexação: quem dispara, quanto tempo leva e quanto custa quando o modelo muda.
  5. Trate beta como beta. O Compass Cloud está em beta privado; planeje os prazos de produção de acordo.

Em resumo

A busca está se modularizando como o resto do stack de IA: interpretação, embeddings, indexação e busca com permissões podem ser comprados como um serviço só, ou montados com peças. A resposta certa depende menos da qualidade do modelo e mais das suas fontes, dos seus modelos de permissão e da disposição do time para operar infraestrutura. Em qualquer caso, a definição de um bom resultado continua sendo sua. O nosso guia do stack de 2026 coloca essa camada em contexto.

Tem um caso de uso de IA parado entre o protótipo e a produção?

Conte o que você quer colocar no ar. Respondemos com próximos passos honestos.

Converse sobre um caso de uso