Статьи с темой: «bertscore»
-
2026 № 10 От BERTScore к БГМ-судье: эволюция методов автоматической оценки качества медицинских систем на основе генеративных моделей.
Актуальность. Быстрое внедрение больших генеративных моделей (БГМ) в медицинскую практику требует надёжных инструментов оценки качества их работы. Классические метрики семантического сходства, изначально разработанные для задач машинного перевода, применяются, в том числе, для оценки работы БГМ. Помимо этого, в настоящее время все более актуальными становятся подходы с использованием БГМ в качестве судьи для решения аналогичных задач. Тем не менее, применимость автоматизированных метрик оценки семантического сходства и оценок при помощи БГМ-судей для определения фактологической точности ответов моделей на вопросы медицинской тематики остаётся недостаточно изученной.
Цель: провести сравнительный анализ классической семантической метрики BERTScore и современного подхода на основе БГМ-судьи (фреймворк DeepEval) для автоматической оценки качества ответов медицинской RAG-системы по-средством изучения корреляции автоматических метрик с эталонной экспертной оценкой.
Материалы и методы. Тестирование проводилось на наборе данных НД‑77, включающем в себя 77 пар вопросов по 7 тематикам, актуальным для врача-рентгенолога, и эталонных ответов экспертов. Для автоматической оценки использовались F1-мера метрики BERTScore и метрика фреймворка DeepEval – фактологическая точность (Answer Correctness).
Для формирования эталонных значений фактологической точности была проведена экспертная оценка ответов модели по 5-балльной шкале Ликерта. В качестве БГМ-судьи выступала модель Mistral-Small3.2:24b. Для расчета корреляции между показателями использовался коэффициент корреляции Спирмена.
Результаты. Всего при тестировании RAG-системы был получен 61 ответ из 77 (79,2%). Шестнадцать вопросов (20,8%) были оставлены без ответа вследствие отсутствия источников в базе знаний. По результатам проведенного тестирования не было зафиксировано ни одного случая галлюцинирования модели. На НД‑77 фактологическая точность составила 0,699 (95% ДИ: 0,648–0,748), F1-мера BERTScore – 0,477 (95% ДИ: 0,460–0,495). Корреляция с экспертной оценкой была выше у показателя фактологической точности (ρ = 0,711) по сравнению с F1-мерой BERTScore (ρ = 0,267).
Выводы. Подход к оценке качества работы генеративных моделей при помощи БГМ-судьи существенно превосходит классические семантические метрики по информативности при использовании для медицинских задач, однако применение БГМ-судьи в качестве полноценной альтернативы экспертной оценки требует дальнейшего изучения.