Skip to content

Article image
Tratamento de dados desequilibrados em pesquisa biomédica

May 16, 2026 · Updated: May 25, 2026

Visão geral

Dados desequilibrados ocorrem quando o número de amostras em uma classe excede em muito as outras, um desafio generalizado na pesquisa biomédica. A prevalência da doença é normalmente baixa, pelo que os conjuntos de dados contêm muito mais controlos saudáveis do que casos; as reações adversas a medicamentos são raras; e os elementos genômicos funcionais são esparsos em todo o genoma. Classificadores padrão treinados em dados desequilibrados tendem a favorecer a classe majoritária, alcançando alta precisão simplesmente prevendo o rótulo mais comum, ignorando completamente a classe minoritária. Técnicas especializadas são necessárias para produzir modelos que detectem eventos raros, mas importantes.

Métodos

As abordagens em nível de dados modificam a distribuição do conjunto de treinamento. Subamostragem aleatória remove amostras da classe majoritária, mas corre o risco de descartar informações úteis. Técnica de sobreamostragem minoritária sintética (SMOTE) gera amostras minoritárias sintéticas interpolando entre instâncias minoritárias existentes. As abordagens em nível de algoritmo ajustam o processo de aprendizagem: a ponderação de classe atribui penalidades mais altas a erros de classificação minoritários na função de perda, e o aprendizado sensível ao custo incorpora diretamente os custos de classificação incorreta. Métodos de conjunto como florestas aleatórias balanceadas e EasyEnsemble combinam subamostragem com ensacamento. Movimento de limite altera o limite de decisão pós-treinamento para favorecer o recall da minoria. A avaliação deve basear-se em curvas de recuperação de precisão ou em exatidão equilibrada, em vez de exatidão geral, o que é enganoso em caso de desequilíbrio.

Protocolo Prático

Um fluxo de trabalho prático para lidar com dados biomédicos desequilibrados começa com a avaliação da distribuição de classes. Num conjunto de dados típico de doenças raras, os casos podem constituir apenas 5–10% das amostras, criando um desequilíbrio grave de 90:10 ou 95:5. O pesquisador primeiro estabelece uma linha de base treinando um classificador de regressão logística simples nos dados brutos e avaliando com precisão equilibrada e curvas de recuperação de precisão, em vez da precisão geral, que pareceria alta mesmo se todos os casos fossem perdidos. Para remediação em nível de dados, o SMOTE é aplicado apenas ao conjunto de treinamento: para cada amostra minoritária, seus k vizinhos mais próximos (padrão k = 5) são identificados e amostras sintéticas são geradas interpolando entre a amostra e vizinhos selecionados aleatoriamente ao longo de vetores de espaço de características. O conjunto de treinamento agora balanceado é usado para treinar um classificador florestal aleatório com 500 árvores. Para soluções algorítmicas, a ponderação de classe atribui pesos inversamente proporcionais às frequências de classe – um peso de 10 para a classe minoritária se esta representar 10% dos dados. A movimentação de limites é aplicada verificando os limites de decisão de 0,1 a 0,9 no conjunto de validação para maximizar a pontuação F1. Num exemplo do mundo real, estas técnicas foram aplicadas para prever reações adversas a medicamentos a partir de dados de farmacovigilância, onde os eventos adversos ocorreram em apenas 2% dos casos. O SMOTE combinado com a ponderação de classe aumentou o recall para a classe minoritária de 12% para 78%, mantendo a precisão de 85%, permitindo a detecção eficaz de sinais para eventos raros de segurança de medicamentos. Outra aplicação é a detecção de genes de resistência a antibióticos em dados metagenômicos, onde os determinantes de resistência são raros em comparação com o conteúdo total do gene, mas clinicamente cruciais para serem identificados.

Aplicativos

Métodos de dados desequilibrados são indispensáveis para detectar subtipos raros de câncer em estudos de bioquímica do câncer, identificar marcadores diferencialmente expressos a partir de dados de microarranjos de DNA e expressão gênica, descobrir genes de resistência em genética bacteriana e prever patogenicidade de variantes raras em microbiologia clínica. Estas técnicas garantem que os modelos de aprendizagem automática permanecem sensíveis à classe minoritária, permitindo a descoberta de sinais biológicos verdadeiramente raros.