Сивец О. Д. - все статьи автора в журнале

    Цифровое здравоохранение
  • 2026 № 10 От BERTScore к БГМ-судье: эволюция методов автоматической оценки качества медицинских систем на основе генеративных моделей.

    Актуальность. Быстрое внедрение больших генеративных моделей (БГМ) в медицинскую практику требует надёжных инструментов оценки качества их работы. Классические метрики семантического сходства, изначально разработанные для задач машинного перевода, применяются, в том числе, для оценки работы БГМ. Помимо этого, в настоящее время все более актуальными становятся подходы с использованием БГМ в качестве судьи для решения аналогичных задач. Тем не менее, применимость автоматизированных метрик оценки семантического сходства и оценок при помощи БГМ-судей для определения фактологической точности ответов моделей на вопросы медицинской тематики остаётся недостаточно изученной.
    Цель: провести сравнительный анализ классической семантической метрики BERTScore и современного подхода на основе БГМ-судьи (фреймворк DeepEval) для автоматической оценки качества ответов медицинской RAG-системы по-средством изучения корреляции автоматических метрик с эталонной экспертной оценкой.
    Материалы и методы. Тестирование проводилось на наборе данных НД‑77, включающем в себя 77 пар вопросов по 7 тематикам, актуальным для врача-рентгенолога, и эталонных ответов экспертов. Для автоматической оценки использовались F1-мера метрики BERTScore и метрика фреймворка DeepEval – фактологическая точность (Answer Correctness).
    Для формирования эталонных значений фактологической точности была проведена экспертная оценка ответов модели по 5-балльной шкале Ликерта. В качестве БГМ-судьи выступала модель Mistral-Small3.2:24b. Для расчета корреляции между показателями использовался коэффициент корреляции Спирмена.
    Результаты. Всего при тестировании RAG-системы был получен 61 ответ из 77 (79,2%). Шестнадцать вопросов (20,8%) были оставлены без ответа вследствие отсутствия источников в базе знаний. По результатам проведенного тестирования не было зафиксировано ни одного случая галлюцинирования модели. На НД‑77 фактологическая точность составила 0,699 (95% ДИ: 0,648–0,748), F1-мера BERTScore – 0,477 (95% ДИ: 0,460–0,495). Корреляция с экспертной оценкой была выше у показателя фактологической точности (ρ = 0,711) по сравнению с F1-мерой BERTScore (ρ = 0,267).
    Выводы. Подход к оценке качества работы генеративных моделей при помощи БГМ-судьи существенно превосходит классические семантические метрики по информативности при использовании для медицинских задач, однако применение БГМ-судьи в качестве полноценной альтернативы экспертной оценки требует дальнейшего изучения.

    Авторы: Ерижоков Р. А., Сахарова П. А., Варюхина М. Д., Гордеев А. Е., Емгожева А. Х., Сивец О. Д., Кирсанов В. В., Омелянская О. В., Васильев Ю. А., Владзимирский А. В.

    Темы: bertscore1 deepeval1 rag-система1 автоматическая оценка качества1 бгм-судья1 большие генеративные модели1 рентгенология3

    Подробнее >