IA na saúde começa com mensagens clínicas consultáveis. Funke da Databricks faz parsing de HL7v2 sem FHIR
Funke, um acelerador do Databricks Industry Solutions, transforma mensagens HL7v2 brutas em tabelas Spark no Unity Catalog. Encurta o caminho para dados clínicos governados. Não é um interface engine.
Ouça este artigo · 5 min
Narração completa do artigo, gerada por IA.

A maioria dos sistemas hospitalares ainda conversa entre si em HL7 versão 2: mensagens compactas, delimitadas por pipe, que anunciam uma admissão, uma transferência, um resultado de laboratório, uma alta. No fio, o formato é confiável. Em uma plataforma de analytics, é miserável: segmentos aninhados, campos repetidos e variações locais que resistem a tabelas comuns. Muitos projetos de IA na saúde param aí, muito antes de qualquer modelo entrar em cena.
A resposta da Databricks, publicada em 8 de outubro, é o Funke, que ela chama de “um acelerador de código aberto que transforma mensagens HL7v2 brutas em dados consultáveis e nativos do Spark”. Escrito em Python e PySpark, ele sucede o Smolder, uma biblioteca Scala que a Databricks lançou em 2021.
O que ele faz
O Funke faz o parsing de mensagens HL7v2 diretamente para tipos nativos do Spark, sem conversão para FHIR no meio. A Databricks diz que o parsing é “projetado para ser sem perdas” e mantém “a hierarquia completa de segmento, campo, componente e subcomponente da mensagem original”. Ele é construído em torno do Unity Catalog, do Declarative Automation Bundles e do Spark Declarative Pipelines: implantado como um bundle, ingerindo por meio de um pipeline declarativo com o Auto Loader, e colocando mensagens brutas em uma tabela bronze e mensagens parseadas em uma silver.
A demonstração usa um gerador sintético de eventos de admissão, transferência e alta, com mensagens de teste do projeto HL7 v2-to-FHIR, e as transforma em métricas operacionais. A Databricks afirma que o Funke “suporta todos os tipos e versões de mensagens HL7”.
Por que pular o FHIR é um trade-off, não um atalho
O FHIR é o padrão moderno de interoperabilidade, e muitos pipelines convertem HL7v2 para ele antes da análise. Essa conversão é um mapeamento, e mapeamentos perdem ou reinterpretam detalhes. Fazer o parsing do original sem perdas mantém tudo o que o sistema emissor disse, e permite que os times decidam depois o que mapear.
O custo é que a semântica permanece não mapeada. Uma mensagem parseada é uma estrutura fiel, não um significado clínico: qual código local significa o quê, como a variação de um hospital difere da de outro, qual campo carrega o médico assistente. A Databricks é explícita que o Funke “não é um interface engine” e não substitui a expertise clínica e de HL7 necessária para interpretar mensagens; mapear segmentos e campos para conceitos de negócio fica com o usuário. O FHIR ainda importa onde os dados precisam ser trocados com outras organizações.
Um parsing sem perdas oferece uma coisa fácil de ignorar: ele pode ser verificado. Reconciliar tabelas parseadas com mensagens brutas, mensagem por mensagem, é um teste determinístico que uma conversão com perdas não consegue passar. Em dados regulados, esse tipo de prova de fora do modelo vale mais do que qualquer afirmação sobre o parser.
O que ele deixa para você
Informações de saúde protegidas. A tabela bronze contém mensagens brutas, que carregam nomes, identificadores e diagnósticos. O post não aborda como protegê-las. Permissões do Unity Catalog, máscaras de coluna, regras de retenção e auditoria nessas tabelas são design do time, e, sob a LGPD, dados de saúde são dados pessoais sensíveis (art. 5º, II), e o princípio da necessidade (art. 6º, III) significa que a maioria dos consumidores nunca deve tocar a camada bronze.
A licença. A Databricks chama o Funke de open source, mas o repositório usa a licença DB, que diz: “You may not use the Licensed Materials except in connection with your use of the Databricks Services.” Isso é bom para clientes Databricks. Não é o mesmo que uma licença permissiva, e times que esperam rodar o parser em outro lugar devem pedir para o jurídico ler primeiro.
Suporte. O Funke é um acelerador do Databricks Industry Solutions. O post não diz que ele tem suporte de produto, então planeje assumi-lo como código que você adotou.
A ordem importa
O valor da IA em operações hospitalares, como prever demanda por leitos, sinalizar altas atrasadas ou responder à pergunta de um coordenador de cuidado em linguagem simples, fica em cima de fluxos de eventos limpos. Eventos de admissão, transferência e alta se tornam censo e tempo de permanência por meio de lógica determinística primeiro. Os modelos vêm depois, e são tão bons quanto os eventos que leem, a mesma dependência que descrevemos em o caminho do dado por trás dos agentes.
O Funke não faz IA na saúde. Ele remove uma das razões mais comuns pelas quais ela nunca começa: mensagens clínicas que ninguém consegue consultar.