← Todos os insights

Análise de casoRecorte: Brasil3 min de leitura

Antes de a IA escrever o relatório mensal, a Microsoft criou um agente para corrigir os dados do projeto

O time de TI da Microsoft combina relatórios com IA no Azure DevOps com um agente de higiene de dados que aponta lacunas no planejamento. O segundo explica por que o primeiro funciona.

Ouça este artigo · 5 min

Narração completa do artigo, gerada por IA.

Close-up de uma vassoura de palha, em duotone La Madre, ao lado das palavras Primeiro, os dados
Foto: rawpixel (CC0)

O relatório de liderança de julho chegou no fim de agosto. Esse era o ritmo antigo do time de Infrastructure Engineering Services da Microsoft, parte da organização de TI da empresa: semanas de trabalho manual para transformar um mês de cenários de engenharia em algo que executivos pudessem ler. Agora, diz o principal PM manager Martin O’Flaherty, “Agora conseguimos enviar esse relatório no primeiro dia de agosto.”

O case study, publicado em 8 de outubro pelo Microsoft Digital, é fácil de ler como uma história sobre IA escrevendo relatórios. A história mais útil está na segunda capacidade que o time construiu, e em por que a primeira não funcionou sem ela.

A primeira tentativa era imprecisa

A capacidade de relatórios revisa todos os cenários concluídos no mês anterior no Azure DevOps, agrupa-os sob prioridades estratégicas e os resume em relatórios de liderança e visualizações de investimento e resultados de engenharia.

A saída inicial, diz a Microsoft, às vezes era imprecisa ou incompleta. O time corrigiu três coisas: a lógica de relatórios, os dados de planejamento por trás dela e como o sistema pondera a evidência documentada de entrega. O resumo de O’Flaherty é a frase com que todo projeto de relatórios deveria começar: “No fim do dia, a IA só pode ser tão precisa quanto os dados que tem diante de si.”

O segundo agente corrige a fonte

Então o time construiu um agente de higiene de dados. Ele verifica continuamente os cenários no escopo contra um conjunto de regras definido, identifica lacunas e avisa os responsáveis com orientação específica sobre como preenchê-las no Azure DevOps.

Três escolhas de design fazem isso funcionar.

O agente pergunta; as pessoas corrigem. O agente de higiene não escreve os dados de planejamento sozinho. Ele diz ao dono o que está faltando, e o dono corrige o registro no sistema de registro (system of record). A fonte da verdade continua pertencendo às pessoas responsáveis por ela, e um palpite errado do agente não pode virar fato silenciosamente.

Completude é um conjunto de regras, não um julgamento. “No escopo” e “completo” são definidos de antemão. Isso é um data contract, verificado continuamente, e é determinístico onde pode ser.

Evidência de entrega tem peso. Mudar como o sistema pondera a evidência documentada é o mesmo movimento que vimos na Chatham Financial, que redesenhou a validação de operações em torno da evidência em vez de em torno de onde um agente poderia se encaixar. Um relatório construído sobre evidência registrada pode ser checado; um construído sobre progresso inferido, não.

As duas capacidades formam um loop. Dados melhores melhoram os relatórios; o esforço de relatórios mantém a pressão sobre os dados.

Onde ter cuidado

Todos os números são anedóticos. Os números da Microsoft são estimativas individuais do time: um relatório no primeiro dia em vez de semanas depois, relatórios de parceiros que “podiam levar horas por dia” agora gerados em uma programação, protótipos em menos de uma hora em vez de um ou dois dias. Não há baselines, tamanhos de amostra ou taxas de precisão. Os modelos e a plataforma de agentes por trás das duas capacidades não são nomeados; as ferramentas mencionadas incluem Azure DevOps, GitHub Copilot, servidores MCP e Copilot Studio.

Menos revisão precisa de um substituto. O’Flaherty diz que os relatórios agora “não exigem mais tanta revisão humana”, e que o mais recente quase não recebeu feedback. Silêncio não é precisão. Quando a revisão humana encolhe, outra coisa tem que detectar o desvio: amostragem periódica contra os registros brutos, ou uma checagem de que os totais do relatório batem com o sistema. A pergunta que levantamos no estudo da IBM sobre supervisão humana se aplica: a revisão só é controle se alguém ainda for capaz e estiver disposto a contestar a saída.

Isso se transfere onde existe um sistema de registro. O padrão depende de dados de planejamento que vivem em um único sistema estruturado, com campos que podem ser checados por regra. Times cujo status vive em slides e threads de chat precisariam corrigir isso primeiro, e isso é um projeto por si só.

O agente de relatórios é o resultado visível. O agente de higiene é o mais transferível: ele torna todo uso posterior dos mesmos dados melhor, qualquer que seja a ferramenta ou o modelo que os leia depois.

Tem um caso de uso de IA parado entre o protótipo e a produção?

Conte o que você quer colocar no ar. Respondemos com próximos passos honestos.

Converse sobre um caso de uso