1---2name: model-evaluation3description: Применяйте при оценке или сравнении ML, LLM, RAG, систем ранжирования и прогнозирования; задавайте сопоставимые условия, знаменатели, срезы, неопределённость, проверку автоматического оценивания и основания для приёмки.4---56# Оценка моделей78## Условия сравнения910- Определите нужный пользователю результат, порог принятия решения, единицу оценки, учитываемую совокупность, источник целевых или эталонных значений, стоимость значимых ошибок и текущий базовый вариант.11- Изучите версии данных и систем, происхождение разбиений и имеющиеся результаты. Держите финальную отложенную выборку отдельно от примеров для настройки промптов, модели, метрики и автоматического оценщика.1213## Ключевые решения14151. Оценивайте базовый вариант и кандидата на одних примерах и версиях эталона. Для сравнения моделей фиксируйте значимые промпты, поиск, инструменты, декодирование, бюджеты рассуждения и токенов, повторы и тайм-ауты; если они различаются, описывайте сравнение систем и компромиссы по стоимости.162. Отделяйте корректность метрики от качества модели. Проверяйте знаменатели, отказы отвечать, отсутствующие результаты, качество целевых значений и правила взвешивания для задачи; сбои не должны незаметно исключаться из оцениваемой совокупности.173. Вместе с общими результатами показывайте важные срезы и попарные выигрыши, проигрыши и равные результаты. Указывайте количества и подходящую оценку неопределённости; прежде чем утверждать улучшение, учитывайте повторяющиеся или зависимые примеры и стохастические запуски.184. Проверяйте автоматических оценщиков по явным критериям и примерам, проверенным человеком, включая неоднозначные и провокационные случаи. Где это возможно, скрывайте идентичность кандидата и исследуйте расхождения; согласие оценщиков само по себе не является эталонной истиной.1920## Результат и проверка2122- Подготовьте запрошенные результаты или план оценки с наборами данных, конфигурациями, метриками, сравнением с базовым вариантом, примерами ошибок, критериями приёмки и ограничениями.23- Если задержка и стоимость влияют на решение, измеряйте их при указанных нагрузке, состоянии кеша, повторах и сбоях; отличайте оценки от наблюдений.24- Для RAG отдельно показывайте качество поиска и ответа. Используйте templates/eval-report.md, если шаблон доступен; не требуйте отдельного файла для небольшой проверки.2526## Ограничения2728- Не настраивайте по финальной тестовой выборке, не полагайтесь только на общие метрики и не заявляйте о превосходстве по несопоставимым наборам данных.29- Запрос на оценку сам по себе не разрешает менять глобальные настройки моделей или продвигать кандидата.