Искусственный интеллект МГУ повысил точность выявления туберкулёза по рентгеновским снимкам
Учёные Московского государственного университета разработали способ подготовки данных, который помогает нейросетям точнее распознавать признаки туберкулёза на рентгеновских изображениях грудной клетки. Новый подход основан на алгоритме Fast and Adaptive Bidimensional Empirical Mode Decomposition, или FABEMD. Его применение позволяет формировать дополнительные варианты снимков для обучения моделей без потери важных диагностических признаков.
Исследование выполнили представители научно-образовательной школы "Мозг, когнитивные системы, искусственный интеллект". В работе участвовали студентка Ю. Д. Сенотова, кандидат физико-математических наук Я. А. Пчелинцев и профессор кафедры математической физики факультета вычислительной математики и кибернетики МГУ Андрей Крылов.
Почему для диагностики нужны большие наборы снимков
Туберкулёз по-прежнему относится к наиболее опасным инфекционным заболеваниям. Ежегодно болезнь становится причиной смерти более миллиона человек. Одним из ключевых условий успешного лечения остаётся своевременное обнаружение инфекции, однако на практике ранняя диагностика может быть затруднена.
Особенно остро проблема проявляется в регионах, где недостаточно врачей-рентгенологов и современного диагностического оборудования. В таких условиях алгоритмы машинного обучения способны выполнять роль дополнительного инструмента: анализировать снимок, выделять подозрительные области и обращать внимание специалиста на возможные признаки заболевания.
При этом качество работы искусственного интеллекта напрямую зависит от обучающей выборки. Если в ней мало изображений или они получены на оборудовании одного типа, модель может хуже работать со снимками из другой клиники. На результат также влияют разрешение, контрастность, положение пациента и технические особенности рентгеновского аппарата.
Как работает метод FABEMD
Исследователи предложили использовать FABEMD для увеличения объёма исходных данных. В машинном обучении этот процесс называют аугментацией. Он заключается в создании новых вариантов уже имеющихся изображений, которые сохраняют ключевые особенности оригинала, но отличаются структурой и визуальными характеристиками.
В случае с рентгеновскими снимками алгоритм адаптивно разделяет изображение на различные компоненты и удаляет либо изменяет фоновые структуры. Благодаря этому формируются дополнительные изображения, похожие на реальные медицинские данные, но не являющиеся простыми копиями исходных файлов.
Такой подход помогает нейросети увидеть больше возможных вариантов проявления болезни. Модель меньше привязывается к случайным особенностям конкретного набора снимков и лучше концентрируется на признаках, действительно связанных с туберкулёзом.
Результаты испытаний
Работу алгоритма проверили на нескольких открытых международных наборах данных, среди которых Montgomery, Shenzhen, TBX11K и Sakha-TB. Эти коллекции включают тысячи рентгеновских изображений, собранных в разных условиях.
Эксперименты показали, что добавление синтетических снимков, созданных с помощью FABEMD, повышает точность классификации. Наиболее заметный эффект наблюдался при работе с наборами, где исходных данных было относительно мало или изображения существенно различались по качеству.
По словам Андрея Крылова, метод улучшает не только итоговые показатели распознавания, но и устойчивость моделей к изменениям входных данных. Это особенно важно для медицинских систем, поскольку снимки из разных учреждений могут заметно отличаться друг от друга даже при обследовании одного и того же заболевания.
ИИ не заменяет врача
Разработанный алгоритм не предназначен для самостоятельной постановки диагноза. Его задача - повысить эффективность анализа снимков и предоставить врачу дополнительную информацию. Окончательное решение должно приниматься специалистом с учётом жалоб пациента, результатов лабораторных исследований, анамнеза и других методов обследования.
Автоматизированная система может помочь сократить время первичного анализа и снизить вероятность пропуска подозрительных изменений. Кроме того, такие технологии потенциально полезны при массовых профилактических обследованиях, когда специалистам приходится обрабатывать большое количество изображений за ограниченный период.
Однако перед внедрением в клиническую практику модель необходимо дополнительно проверять на данных из конкретных медицинских учреждений. Важно убедиться, что она одинаково корректно работает с различными аппаратами, форматами изображений и группами пациентов.
Возможные ограничения технологии
Несмотря на многообещающие результаты, синтетическое увеличение данных не решает все проблемы обучения нейросетей. Если исходная выборка содержит ошибки, перекосы или недостаточно разнообразных случаев, их можно частично перенести и в искусственно созданные изображения.
Отдельное внимание требуется уделять редким формам заболевания. Модель, обученная преимущественно на типичных случаях, может хуже распознавать нестандартные проявления туберкулёза или отличать их от других заболеваний лёгких.
Кроме того, точность алгоритма не должна оцениваться только по одному показателю. Для медицинской диагностики важны чувствительность, специфичность, количество ложноположительных и ложноотрицательных результатов. Ошибка каждого типа может иметь разные последствия для пациента и работы медицинской системы.
Где ещё может применяться разработка
Авторы считают, что метод FABEMD способен использоваться не только при анализе рентгеновских снимков для выявления туберкулёза. Подобная технология может оказаться востребованной в задачах, где медицинских изображений недостаточно, а требования к точности особенно высоки.
Потенциальные направления включают обнаружение других заболеваний органов дыхания, анализ снимков в онкологии, обработку офтальмологических изображений и выявление патологий на компьютерных томограммах. В каждом случае алгоритм потребуется адаптировать с учётом особенностей конкретного типа данных.
Перспективным направлением также является создание комбинированных систем, которые анализируют не только изображение, но и дополнительные сведения о пациенте. Объединение рентгенологических данных с возрастом, симптомами, результатами анализов и историей болезни может повысить информативность автоматизированного заключения.
Значение исследования
Работа специалистов МГУ показывает, что развитие медицинского искусственного интеллекта зависит не только от выбора архитектуры нейросети. Не менее важную роль играет грамотная подготовка данных. Если обучающая выборка небольшая, её качество и разнообразие можно повысить с помощью специализированных методов обработки изображений.
В перспективе такие решения могут поддержать врачей в регионах с ограниченными ресурсами, ускорить первичный скрининг и сделать диагностику более стабильной при использовании оборудования разных типов. При этом внедрение технологии должно проходить постепенно - с обязательной клинической проверкой, контролем качества и сохранением ведущей роли медицинского специалиста.
