Почему ИИ-модели провалили тест DROP: расследование ошибок в оценке

Почему ИИ-модели провалили тест DROP: расследование ошибок в оценке

В конце 2023 года модели набрали меньше 10 баллов из 100 в бенчмарке DROP. Разбираем, как ошибки нормализации чисел и стоп-токена исказили результаты и почему проблема была в оценке, а не в ИИ.

Аномалия в результатах DROP: что произошло?

В конце 2023 года команда Hugging Face зафиксировала странную картину в бенчмарке DROP. Большинство языковых моделей набрали менее 10 баллов из 100 возможных. Для теста, который проверяет базовые навыки извлечения информации из текста и выполнения логических операций, это выглядело как системный сбой.

DROP расшифровывается как Discrete Reasoning Over Paragraphs. Он предлагает модели прочитать фрагмент текста и ответить на вопросы, требующие сложения, вычитания, сравнения чисел или поиска конкретных фактов. Модели, которые до этого успешно справлялись с похожими задачами, вдруг оказались почти беспомощными.

Такое падение результатов вызвало подозрения. Когда все модели одновременно показывают аномально низкие баллы, проблема чаще всего кроется не в самих алгоритмах, а в способе проверки ответов. Команда Hugging Face начала расследование.

Расследование Hugging Face: поиск причин

Разработчики проверили пайплайн оценки DROP шаг за шагом. Они сравнили, как система обрабатывает ответы моделей и сопоставляет их с эталонными значениями. Обнаружились две технические ошибки, которые искажали результаты.

Ошибка нормализации чисел: ответы с новой строкой не сопоставлялись

Первая проблема касалась нормализации чисел. Когда модель выдавала ответ с символом новой строки в конце, система не считала его правильным. Например, модель возвращала «42 », а эталонный ответ был «42». Для человека разница незаметна, но для программы это два разных значения.

Нормализация должна была убирать лишние символы перед сравнением. Из-за ошибки в этом процессе ответы с переносами строк не проходили проверку. Модель давала верный результат, но система помечала его как ошибочный. Это приводило к ложным отрицательным результатам и резкому снижению итоговых баллов.

Неправильный стоп-токен: точка вместо перевода строки

Вторая ошибка оказалась связана со стоп-токеном. Стоп-токен - это символ, при котором модель прекращает генерацию текста. В настройках DROP использовалась точка, а не перевод строки.

Из-за этого модели обрезали ответы с плавающей запятой. Если правильный ответ был «3.14», модель останавливалась на точке и выдавала только «3». В других случаях модель, наоборот, продолжала генерировать лишний текст после точки, что тоже мешало корректному сравнению.

Обе ошибки действовали в связке. Они не показывали реальный уровень моделей, а лишь фиксировали сбои в обработке ответов. Проблема была в методологии оценки, а не в способностях языковых моделей.

Последствия: заниженные результаты и удаление DROP с лидерборда

Баги в оценке привели к тому, что модели получали несправедливо низкие баллы. Результаты ниже 10 баллов из 100 не отражали реальную производительность. Публикация таких метрик могла ввести в заблуждение разработчиков и пользователей, которые выбирают модели для своих задач.

Команда Hugging Face приняла решение временно удалить DROP с лидерборда. Это было сделано до переработки способа оценки. Цель - избежать распространения некорректных данных и сохранить доверие сообщества к бенчмаркам.

Ситуация напоминает случай с немецкой открытой моделью Soofi S, когда в обучающие данные случайно попали вопросы из тестового набора. Тогда открытость команды помогла быстро найти проблему и пересчитать результаты. Здесь логика та же: честное признание ошибки ценнее, чем сохранение видимости стабильности.

Уроки для оценки ИИ-моделей: как избежать подобных ошибок

Инцидент с DROP показал, что даже небольшие технические детали могут кардинально исказить результаты. Нормализация чисел и выбор стоп-токена - это не второстепенные настройки, а критически важные элементы пайплайна оценки.

Проверка нормализации и обработки ответов

Перед запуском бенчмарка нужно убедиться, что система корректно обрабатывает пробелы, переносы строк и другие невидимые символы. Полезно использовать регулярные выражения для очистки ответов перед сравнением. Например, удалять все символы перевода строки и лишние пробелы в начале и конце строки.

Тестирование на эталонных примерах помогает выявить такие ошибки до публикации результатов. Если модель отвечает «42 », а система не засчитывает ответ, это повод проверить нормализацию.

Выбор стоп-токена и его влияние на генерацию

Стоп-токен нужно выбирать так, чтобы он не встречался в ожидаемых ответах. Если ответы могут содержать десятичные дроби, точка - плохой вариант. Лучше использовать специальный символ конца последовательности, который не появляется в тексте ответа.

Для задач с числовыми ответами стоит дополнительно проверять, не обрезает ли модель дробную часть. Если эталонный ответ «3.14», а модель выдала «3», проблема может быть в стоп-токене, а не в способности модели считать.

Эти рекомендации актуальны для всех, кто работает с бенчмарками. Ошибки в оценке могут привести к неверным выводам о качестве моделей и, как следствие, к плохим решениям при выборе инструментов для бизнеса.

Доверие к бенчмаркам: почему прозрачность важна

Инцидент с DROP показывает, что даже авторитетные бенчмарки могут содержать ошибки. Это не повод отказываться от оценки моделей, но причина внимательнее относиться к методологии.

Открытость Hugging Face в этой ситуации - хороший пример для сообщества. Команда не скрыла проблему, а публично признала её и убрала бенчмарк на доработку. Такое поведение укрепляет доверие к платформе и к бенчмаркам в целом.

Прозрачность важна и для бизнеса. Когда компании выбирают ИИ-модели для реальных задач, им нужны достоверные метрики. Ошибочные результаты могут привести к выбору неподходящего инструмента и финансовым потерям. Поэтому лидерборды, ориентированные на практические сценарии, набирают популярность. Они проверяют модели на задачах, приближенных к реальным условиям, а не только на академических тестах.

Проблема доверия к бенчмаркам касается и других аспектов оценки. Например, галлюцинации ИИ - ещё одна область, где корректность измерений напрямую влияет на бизнес-решения. Если метрики искажены, компании не могут адекватно сравнивать модели и оценивать риски.

Заключение: модели не виноваты, но уроки извлечены

Аномалия в DROP была вызвана двумя техническими ошибками: неправильной нормализацией чисел и неудачным выбором стоп-токена. Это привело к заниженным результатам и временному удалению бенчмарка с лидерборда.

Главный вывод из этой истории: качество оценки не менее важно, чем качество самих моделей. Тщательная проверка пайплайнов, внимание к деталям обработки ответов и открытость при обнаружении ошибок помогают сохранять доверие к бенчмаркам.

После переработки способа оценки DROP сможет снова стать надёжным инструментом для проверки навыков извлечения информации и логических операций. А сообщество получило ещё одно напоминание: за каждым результатом стоит методология, которую нужно проверять так же внимательно, как и сами модели.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции