RASCUNHO — versão de trabalho. Gerado automaticamente a partir dos artefatos de resultado; números não transcritos à mão. Referências preliminares, a conferir antes de submeter. Não submetido, não revisado por pares.

O número mais alto raramente é o mais confiável: uma bateria de testes de falsificação para alegações de aprendizado de máquina em saúde

Estudo transversal pré-registrado em três modalidades

Leandro Souza Anselmo — Medicina, Pedro Juan Caballero, Paraguai

Resumo

Contexto. Alegações de desempenho em aprendizado de máquina aplicado à saúde são publicadas majoritariamente com métricas de discriminação obtidas na mesma fonte de dados em que o modelo foi treinado. Vazamento entre partições, aprendizado de atalho e extrapolação para fora do domínio de aplicabilidade são reconhecidos como ameaças, mas raramente são testados de forma explícita — e quase nunca se publica o teste que teria derrubado o próprio resultado.

Objetivo. Avaliar se uma bateria mínima e portátil de testes de falsificação, aplicável em CPU e sem retreinar modelos, distingue resultados confiáveis de resultados aparentemente fortes em três modalidades distintas.

Métodos. Estudo transversal com pré-registro escrito antes da execução, abrangendo três projetos independentes: predição de atividade antibacteriana contra Staphylococcus aureus (46001 moléculas), classificação de tuberculose e pneumonia em radiografia de tórax (800 e 5856 imagens) e predição de sepse em terapia intensiva (40.336 pacientes, 1.552.210 horas). A bateria compreende: validação externa por fonte nos dois sentidos; oclusão anatômica; verificação de composição da lista de candidatos com teto de similaridade; PR-AUC interpretada contra a prevalência; e comparação pareada entre alternativas com intervalo de confiança por reamostragem da unidade de observação.

Resultados. Em cada um dos três projetos, o maior número de desempenho e o resultado mais confiável não coincidiram. A classificação de pneumonia atingiu ROC-AUC 0,9946 ± 0,0023 e manteve 0,8305 com o campo pulmonar ocluído, indicando atalho. A triagem molecular produziu 17 candidatos aprovados nos três critérios pré-declarados, dos quais 11 de 17 pertencem a classes antibióticas conhecidas, com Tanimoto mediano de 0,832 ao conjunto de treino. A predição de sepse atingiu ROC-AUC 0,8450 com PR-AUC 0,1137 sobre prevalência horária de 1,80%, e não emitiu alerta algum para 691 de 2932 pacientes sépticos. A classificação de tuberculose funcionou como controle positivo: ROC-AUC intra-fonte 0,9078 ± 0,0356, queda para 0,6566 sob oclusão e média de 0,8145 em validação externa.

Conclusão. A bateria identificou como frágeis dois resultados que pareceriam publicáveis pelas métricas convencionais e preservou um terceiro. O custo computacional é desprezível frente ao do treinamento. Propomos que testes de falsificação, com relato obrigatório dos que falham, integrem o requisito mínimo de alegações de desempenho em saúde.

Palavras-chave: aprendizado de máquina; reprodutibilidade; validação externa; aprendizado de atalho; domínio de aplicabilidade; pré-registro.

1. Introdução

A literatura de aprendizado de máquina em saúde cresce mais rápido do que a capacidade de replicá-la. Revisões sistemáticas têm apontado que a maioria dos modelos publicados relata apenas métricas de discriminação obtidas por validação cruzada na mesma fonte de dados usada no treinamento, sem avaliação em fonte independente e sem exame das razões pelas quais o modelo acerta.

Três ameaças são especialmente frequentes. O vazamento ocorre quando informação do conjunto de teste influencia o treinamento — por partição que separa imagens em vez de pacientes, por análogos quase idênticos distribuídos entre as partições, ou por decisões de pré-processamento tomadas sobre o conjunto completo. O aprendizado de atalho ocorre quando o modelo encontra um sinal correlacionado ao desfecho porém irrelevante para ele, como marcações de equipamento ou características de aquisição. A extrapolação para fora do domínio de aplicabilidade ocorre quando a predição é emitida para observações dissimilares de tudo que o modelo viu.

Essas ameaças são bem descritas; o que falta é prática de rotina para testá-las. Duas lacunas nos parecem centrais. A primeira é a ausência de testes de derrubada — procedimentos desenhados para invalidar a própria alegação, cujo resultado é publicado independentemente de confirmar ou refutar. A segunda é a ausência de controle positivo: quando uma bateria de verificação reprova todos os casos examinados, não é possível distinguir entre um campo frágil e uma bateria excessivamente severa.

Este trabalho aplica uma bateria mínima a três projetos conduzidos em paralelo, em modalidades distintas — moléculas, imagem e série temporal clínica —, com pré-registro escrito antes da execução. A tese que emerge é única e verificável: em todos os três, o maior número de desempenho e o resultado mais confiável não coincidiram. A contribuição pretendida não é o catálogo de erros, e sim a bateria como instrumento reutilizável.

2. Métodos

2.1 Pré-registro e registro de desvios

As frentes de análise dos três projetos foram declaradas por escrito antes da execução, incluindo as métricas, as regras de partição e a regra de parada. O documento de pré-registro foi mantido sob controle de versão e as alterações posteriores foram acrescentadas como emendas datadas, preservando o texto original.

O relato de desvios é parte do resultado. Registramos seis itens pré-declarados que não foram executados (com a justificativa de cada um, predominantemente limite de disco ou de credenciamento de acesso), três itens executados de forma diferente da declarada, e cinco falhas de código que exigiram correção e reexecução. As três categorias são mantidas separadas de propósito: uma análise que não rodou por limite físico, uma que rodou de forma diferente e uma que quebrou e foi corrigida têm implicações distintas para a leitura dos resultados.

Três dos testes aqui descritos foram acrescentados após a observação dos primeiros resultados, mediante autorização registrada, e estão marcados como pós-hoc com data no pré-registro. Optamos por declará-lo no corpo do artigo, e não em nota de rodapé: em um trabalho cuja tese é a transparência metodológica, a procedência dos testes é material empírico. Os três só podiam reduzir a confiança nos resultados já obtidos, nunca aumentá-la.

2.2 P1 — atividade antibacteriana (moléculas)

Conjunto derivado do ChEMBL, restrito a medidas de concentração inibitória mínima (MIC) contra S. aureus. O rótulo binário foi definido como ativo para MIC <= 4 ug/mL e inativo para MIC >= 16 ug/mL, exigindo no mínimo 2 medidas independentes por molécula e descartando a faixa intermediária. A escolha não é arbitrária: MIC é medida em diluições sucessivas por fator dois, e o valor 8 µg/mL é modal na distribuição, de modo que um corte posicionado exatamente nele classificaria como ativa uma grande massa de moléculas limítrofes. O conjunto final reúne 46001 moléculas.

Dez frentes de análise foram pré-declaradas, variando dado, representação e enquadramento do problema, e todas foram avaliadas com a mesma partição: cinco dobras agrupadas por arcabouço de Murcko. A partição aleatória foi calculada apenas como medida do vazamento — a diferença entre as duas — e nunca reportada como resultado.

2.3 P2 — tuberculose e pneumonia (imagem)

Radiografias de tórax de três fontes públicas: dois conjuntos de tuberculose (Montgomery e Shenzhen, 800 imagens somadas) e um conjunto de pneumonia pediátrica (5856 imagens). Partição por paciente em todos os casos. O ponto de partida principal foram pesos pré-treinados em radiografia de tórax; um segundo ponto de partida, pré-treinado em ImageNet, foi declarado antes da execução como comparação.

2.4 P3 — sepse em terapia intensiva (série temporal)

Desafio público de sepse com 40.336 pacientes e 1.552.210 horas de internação, 127 variáveis derivadas. A predição é estritamente causal: cada linha horária utiliza apenas informação disponível até aquela hora, verificado empiricamente pela recomputação da linha após remoção de todo o futuro. Comparamos um modelo de gradient boosting com uma rede recorrente.

Desvio declarado: o pré-registro previa partição temporal, impossível neste conjunto por ausência de data de calendário. Em substituição, adotou-se causalidade estrita dentro da internação, partição por paciente e validação externa entre hospitais.

2.5 A bateria de testes de falsificação

Cinco procedimentos, todos executáveis em CPU e sem retreinar modelos, exceto onde indicado:

3. Resultados

3.1 P1 — positivo pela régua, redescoberta pelo conteúdo

As dez frentes produziram desempenho semelhante entre si (Tabela 1). O melhor resultado foi obtido por Fingerprints alternativos (ROC-AUC 0,8965); o baseline de similaridade de Tanimoto, que não envolve modelo algum, atingiu 0,8296 — diferença de 0,067. Representações aprendidas ficaram abaixo dos descritores convencionais: embeddings de transformador atingiram 0,8520 e a rede sobre grafo molecular 0,8762.

Tabela 1. Desempenho das dez frentes pré-declaradas do P1. Partição por arcabouço de Murcko, cinco dobras, em todas.

#FrenteROC-AUC ± dpPR-AUC ± dp
1ChEMBL com rótulos limpos0,8948 ± 0,00670,8985 ± 0,0089
2CO-ADD (produtos naturais)0,8840 ± 0,02960,2432 ± 0,0531
3ChEMBL ampliado (outras unidades, MRSA)0,8891 ± 0,00770,8967 ± 0,0035
4Transfer learning antibacteriano0,8832 ± 0,01050,8887 ± 0,0106
5D-MPNN (chemprop)0,8762 ± 0,00990,8767 ± 0,0145
6Fingerprints alternativos0,8965 ± 0,00550,9003 ± 0,0083
7Embeddings ChemBERTa0,8520 ± 0,01140,8623 ± 0,0146
8Regressão de pMIC0,87300,8785
9Similaridade de Tanimoto (baseline)0,8296 ± 0,00870,8044 ± 0,0155
10Triagem restrita ao domínio (COCONUT)——
Figura 1. Comparação das dez frentes do P1. O baseline sem modelo (frente 9) situa-se a 0,067 do melhor resultado.
Figura 1. Comparação das dez frentes do P1. O baseline sem modelo (frente 9) situa-se a 0,067 do melhor resultado.

A triagem de biblioteca de produtos naturais aplicou o filtro final pré-declarado, composto por três critérios simultâneos. O funil reduziu a biblioteca a 57 candidatos após escore e domínio; a aplicação do terceiro critério — arcabouço inédito em relação ao treino — reduziu a 17.

Pela regra declarada antes da execução, a existência de candidatos aprovados caracteriza resultado positivo. O exame da composição da lista, contudo, mostra outra coisa: 11 dos 17 candidatos pertencem a classes antibióticas conhecidas (macrolídeos, tiopeptídeos e aminoglicosídeo), a massa molecular varia de 479,5 a 1648,9 Da e o Tanimoto ao conjunto de treino tem mediana 0,832, chegando a 0,975 (Tabela 2).

Tabela 2. Composição da lista de candidatos aprovados nos três critérios.

ProbabilidadeTanimoto ao treinoMassa (Da)Classe reconhecida
0,97540,747522,6tiazol (tiopeptideo)
0,96130,857835,0-
0,95060,76479,5tiazol (tiopeptideo)
0,94730,975580,8aminoglicosideo
0,93090,9011599,9macrolideo (lactona 12+);tiazol (tiopeptideo)
0,92770,9051368,6macrolideo (lactona 12+);tiazol (tiopeptideo)
0,92630,878922,1macrolideo (lactona 12+)
0,92320,697914,0-
0,92240,839564,4-
0,91780,832816,0macrolideo (lactona 12+)
0,91780,832816,0macrolideo (lactona 12+)
0,91540,784830,0macrolideo (lactona 12+)
0,90620,783886,0-
0,90610,9091648,9macrolideo (lactona 12+);tiazol (tiopeptideo)
0,90480,761842,0macrolideo (lactona 12+)
0,90360,697980,6-
0,90170,863562,8-

A causa é identificável e corrigível: o critério de domínio de aplicabilidade possuía piso de similaridade, para excluir extrapolação, mas o teto estava posicionado em Tanimoto igual a 1,0 — isto é, apenas moléculas idênticas eram excluídas. Análogos próximos passam. Adicionalmente, o arcabouço de Murcko é descritor grosseiro para macrociclos: alteração pequena no anel gera arcabouço formalmente inédito com a molécula praticamente inalterada. O resultado é reportado com as duas leituras porque ambas são verdadeiras.

3.2 P2 — um atalho detectado e um controle positivo preservado

A classificação de pneumonia atingiu ROC-AUC 0,9946 ± 0,0023 sobre 5856 imagens. Sob oclusão do campo pulmonar central, preservando apenas a moldura da imagem, o desempenho manteve-se em 0,8305. A informação que sustenta o resultado não está, em proporção relevante, no pulmão.

A classificação de tuberculose comportou-se de modo oposto: ROC-AUC 0,9078 ± 0,0356 intra-fonte, caindo para 0,6566 sob a mesma oclusão. Sensibilidade e especificidade no ponto de Youden foram 0,799 e 0,889.

Figura 2. Teste de oclusão. A barra inferior de cada tarefa mostra o desempenho com o campo pulmonar suprimido. A pneumo
Figura 2. Teste de oclusão. A barra inferior de cada tarefa mostra o desempenho com o campo pulmonar suprimido. A pneumonia preserva 0,8305; a tuberculose cai para 0,6566.

A validação externa da tuberculose revelou queda assimétrica (Tabela 3): treinar na fonte maior e testar na menor custa substancialmente menos do que o percurso inverso. A média dos dois sentidos é 0,8145, com queda média de -0,0934 em relação à avaliação intra-fonte. Reportar um único sentido produziria conclusões opostas conforme a escolha.

Tabela 3. Validação externa cruzada da tuberculose, nos dois sentidos.

Condiçãon (teste)ROC-AUCPR-AUCQueda
Intra-fonte (5 dobras por paciente)8000,9078 ± 0,03560,9124 ± 0,0347—
Treina montgomery → testa shenzhen6620,76810,7543-0,1397
Treina shenzhen → testa montgomery1380,86080,8265-0,0470
Média dos dois sentidos—0,8145—-0,0934
Figura 3. Queda de desempenho por mudança de fonte, tuberculose.
Figura 3. Queda de desempenho por mudança de fonte, tuberculose.

Duas verificações adicionais qualificam esse resultado. A primeira é desfavorável: um classificador que utiliza exclusivamente estatísticas brutas de imagem — brilho e dimensões — distingue as fontes com ROC-AUC 1,000 e prevê o próprio rótulo de tuberculose com 0,7599. Existe, portanto, sinal de aquisição disponível. A segunda é favorável e responde à primeira: o desempenho calculado dentro de cada fonte separadamente, sobre as predições fora da dobra, permanece elevado. Como a fonte é constante dentro de cada subconjunto, esses valores não podem ser atribuídos a sinal de aquisição.

Tabela 4. Desempenho intra-fonte, calculado separadamente por conjunto.

FontenTaxa baseROC-AUC
montgomery1380,4200,9304
shenzhen6620,5080,9005
Figura 4. Matriz de confusão da tuberculose no ponto de Youden (sensibilidade 0,799, especificidade 0,889).
Figura 4. Matriz de confusão da tuberculose no ponto de Youden (sensibilidade 0,799, especificidade 0,889).

A comparação entre os dois pontos de partida inverte-se conforme a pergunta (Tabela 5). Na avaliação intra-fonte, a comparação pareada indica vantagem dos pesos de ImageNet, com intervalo de confiança que não contém zero. Na validação externa, a média favorece os pesos pré-treinados em radiografia. Não há resposta única para “qual pré-treino é melhor”: há duas respostas, para duas perguntas diferentes.

Tabela 5. Pontos de partida comparados, por tipo de avaliação.

AvaliaçãoPesos de raio-XPesos ImageNetQuem vence
Intra-fonte (5 dobras)0,9078 ± 0,03560,9296 ± 0,0241ImageNet
Externa: treina montgomery → testa shenzhen0,76810,8057ImageNet
Externa: treina shenzhen → testa montgomery0,86080,7798raio-X
Externa (média)0,81450,7928raio-X
Figura 5. Diferença pareada entre pontos de partida, com intervalo de confiança por reamostragem de pacientes. Válida pa
Figura 5. Diferença pareada entre pontos de partida, com intervalo de confiança por reamostragem de pacientes. Válida para a avaliação intra-fonte.
Figura 6. Intervalos de confiança por reamostragem de pacientes (2000 reamostragens).
Figura 6. Intervalos de confiança por reamostragem de pacientes (2000 reamostragens).

3.3 P3 — discriminação aparente e utilidade limitada

O modelo de gradient boosting atingiu ROC-AUC 0,8450 com PR-AUC 0,1137 (Tabela 6). A prevalência horária do desfecho é 1,80%, de modo que um classificador aleatório teria PR-AUC igual a essa proporção: o modelo situa-se aproximadamente 6,3 vezes acima do acaso — resultado real, porém muito distante do que a ROC-AUC sugere isoladamente. A rede recorrente, executada em unidade de processamento gráfico, ficou abaixo do baseline em ambas as métricas.

Tabela 6. Desempenho na predição de sepse.

ModeloROC-AUCPR-AUCECE
gradient boosting (CPU)0,84500,11370,0032
LSTM temporal (GPU)0,77410,08290,1920

Na validação externa entre hospitais, o desempenho caiu para 0,7456 (hospital A → hospital B) e 0,7693 (hospital B → hospital A). A antecedência mediana do alerta foi de 38 horas; esse valor, entretanto, descreve apenas os pacientes alertados. Para 691 dos 2932 pacientes que desenvolveram sepse (23,6%), o modelo não emitiu alerta algum no limiar operacional adotado. Antecedência calculada sobre o subconjunto alertado é métrica incompleta quando reportada sem a cobertura.

Figura 7. Curvas ROC e de precisão-sensibilidade para a predição de sepse. A distância entre as duas ilustra o efeito da
Figura 7. Curvas ROC e de precisão-sensibilidade para a predição de sepse. A distância entre as duas ilustra o efeito da prevalência baixa.

3.4 Síntese

A Tabela 7 reúne, para cada projeto, o maior número obtido, o teste que o confrontou e o que restou depois dele.

Tabela 7. Síntese: o maior número, o teste de derrubada e o resultado.

ProjetoMaior númeroTeste de derrubadaDepois do testeVeredito
P1 — moléculas17 candidatos nos 3 critériosComposição da lista curta (classe química e similaridade ao treino)11 de 17 são classes antibióticas conhecidas; Tanimoto mediano 0,832Redescoberta, não descoberta
P2 — pneumoniaROC-AUC 0,9946 ± 0,0023Oclusão do campo pulmonarROC-AUC 0,8305 apenas com a molduraAtalho: número invalidado
P2 — tuberculoseROC-AUC 0,9078 ± 0,0356Oclusão + validação externa nos dois sentidos + IC por pacienteCai para 0,6566 sob oclusão; externa média 0,8145CONTROLE POSITIVO: sobrevive
P3 — sepseROC-AUC 0,8450PR-AUC contra a prevalência + externa entre hospitais + cobertura do alertaPR-AUC 0,1137 (acaso 0,018); 691 de 2932 sem alertaModesto; o temporal perdeu do baseline

Em nenhum dos três projetos o maior número foi o resultado mais confiável. A tuberculose, que apresenta número intermediário, é o único caso que atravessa todos os testes aplicados — e é por isso que funciona como controle positivo da bateria.

4. Discussão

Por que o número engana. Métricas de discriminação medem separabilidade no conjunto avaliado, não a validade do mecanismo que a produz. Quando existe variável correlacionada ao desfecho e mais fácil de aprender que o fenômeno — características de aquisição, prevalência distinta entre fontes, proximidade química ao conjunto de treino —, o modelo a utiliza. A métrica registra o sucesso; não registra a razão.

Validação externa de um só sentido também é selecionável. O achado de assimetria tem consequência prática direta: ao dispor de duas fontes, há duas validações externas possíveis, e a diferença entre elas foi, neste trabalho, da ordem de três vezes. Reportar apenas a mais favorável é uma forma de seleção que passa despercebida porque a validação externa já é vista como prática conservadora. Recomendamos reportar ambos os sentidos sempre que houver duas ou mais fontes.

Conclusões dependem da pergunta. A inversão observada entre pontos de partida ilustra que “melhor” não é propriedade do modelo, e sim da combinação entre modelo e regime de avaliação. Um trabalho que reportasse apenas a avaliação intra-fonte concluiria o oposto de um que reportasse apenas a externa, ambos corretos no que mediram.

A bateria é barata e portátil. Nenhum dos cinco procedimentos exigiu retreinamento; a oclusão reutiliza pesos já ajustados, os intervalos de confiança e a comparação pareada operam sobre predições já registradas, e a verificação de composição da lista é consulta a descritores. O custo é desprezível diante do treinamento que os precedeu. A condição prática é arquivar as predições brutas — identificador da unidade de observação, rótulo, probabilidade e fonte —, pois de métricas agregadas não se reconstrói incerteza.

O controle positivo é parte da contribuição. Uma bateria que reprovasse os três casos seria indistinguível de uma bateria mal calibrada. O caso da tuberculose demonstra que os procedimentos preservam resultado sustentado por sinal legítimo, e é o que autoriza interpretar as reprovações como informativas.

5. Limitações

6. Conclusão

Em três projetos independentes, de modalidades distintas, o maior número de desempenho e o resultado mais confiável não coincidiram. Uma bateria mínima de cinco testes de falsificação, executável em CPU e sem retreinamento, identificou um atalho que invalidava a alegação mais forte do conjunto, caracterizou como redescoberta uma lista de candidatos formalmente aprovada, dimensionou a utilidade real de um preditor clínico aparentemente competente e preservou um resultado legítimo.

Propomos que alegações de desempenho em aprendizado de máquina aplicado à saúde passem a incluir, como requisito mínimo: validação externa reportada em todos os sentidos disponíveis; ao menos um teste de ablação ou oclusão dirigido ao mecanismo; métricas sensíveis à prevalência quando o desfecho for raro; intervalos de confiança por reamostragem da unidade de observação; e publicação dos testes que falharam, com o mesmo destaque dos que confirmaram.

Referências

Lista preliminar — conferir antes de submeter. As referências abaixo indicam a literatura pertinente aos conceitos empregados e precisam ser verificadas quanto a autoria, ano, veículo e paginação, além de ajustadas ao formato exigido pelo periódico escolhido.
  1. Literatura sobre aprendizado de atalho em redes neurais profundas e suas manifestações em imagem médica.
  2. Estudos sobre identificação da instituição de origem a partir de radiografias e suas implicações para generalização.
  3. Revisões sobre vazamento de dados e reprodutibilidade em aprendizado de máquina aplicado à saúde.
  4. Trabalhos sobre domínio de aplicabilidade em modelagem quantitativa estrutura-atividade.
  5. Diretrizes de relato para modelos de predição clínica (TRIPOD e extensões para inteligência artificial).
  6. Metodologia de intervalos de confiança por reamostragem para métricas de discriminação com observações agrupadas.
  7. Discussão sobre PR-AUC e sua interpretação sob prevalência baixa.
  8. Descrições dos conjuntos públicos utilizados nas três modalidades.
Documento de trabalho gerado a partir de RELATORIO_FINAL.md e dos JSON de resultado em storage/dados/portfolio/. Figuras: 7, todas reaproveitadas de /portfolio/figuras/. Nenhum número foi digitado manualmente.