В мире медицинских технологий исследование, проведенное учеными из Германии и Дании, выявило, что модели машинного обучения, основанные на Международной классификации болезней 10-го пересмотра (ICD-10), демонстрируют значительно более низкую чувствительность и специфичность при применении к немецкой популяции по сравнению с внешними валидационными группами из США и Великобритании. Это открытие подчеркивает важность улучшения семантической гармонизации рутинных данных и интеграции специфических для редких заболеваний онтологий, таких как Human Phenotype Ontology и ORPHAcodes.
Исследователи проанализировали данные пациентов с амилоидной кардиомиопатией (ATTR-CM) из Центра амилоидоза Charité в Берлине за период с 2002 по 2023 год. Они также изучили данные пациентов с аортальным стенозом и сердечной недостаточностью, которые проходили скрининг на наличие ATTR-CM. Для этого они сопоставили диагностические данные из немецкой системы кодирования (ICD-10-GM) с клинической модификацией, используемой в США (ICD-10-CM).
Используя алгоритм случайного леса, ранее валидированный на нескольких внешних группах пациентов из США и Великобритании, исследователи смогли выявить случаи ATTR-CM среди пациентов с сердечной недостаточностью и аортальным стенозом. Однако им не удалось различить пациентов с наследственной формой ATTR-CM и диким типом. Чувствительность и специфичность алгоритма оказались значительно ниже, чем в валидационных группах из США и Великобритании.
Кроме того, исследователи отметили, что эффективность модели сильно зависела от детализации кодирования и доступности характеристик, что также способствовало снижению ее предсказательной силы. Они пришли к выводу, что, несмотря на умеренную переносимость модели в условиях обогащения, зависимость от географически специфических систем ICD-10 ограничивает ее более широкое применение из-за несоответствий в кодировании и потери информации.
Таким образом, для улучшения диагностики редких заболеваний, таких как ATTR-CM, необходимо работать над интеграцией более универсальных систем кодирования и повышением качества данных.