Почему ИИ не умеет видеть: новый бенчмарк PerceptionBench
Moonshot AI представила бенчмарк PerceptionBench, который проверяет визуальное восприятие ИИ отдельно от логики. Ни одна модель не набрала 60%. Узнайте, почему ИИ ошибается в простых визуальных задачах.
Moonshot AI, создатели ассистента Kimi, представили бенчмарк PerceptionBench. Он проверяет, насколько хорошо мультимодальные ИИ-модели действительно «видят» изображения. Результаты оказались слабыми: ни одна из ведущих моделей, включая GPT-5.6 Sol, Claude Fable 5 и Gemini 3.1 Pro, не набрала и 60% точности в базовых визуальных задачах. Ключевой вывод авторов: многие ошибки, которые раньше приписывали плохому логическому мышлению, возникают уже на этапе считывания информации с картинки.
Это меняет представление о том, где именно ломаются современные нейросети. Если модель неверно распознала объект, никакая логика не исправит ошибку. PerceptionBench впервые изолирует визуальное восприятие от рассуждений и показывает: проблема глубже, чем казалось.
Что такое PerceptionBench и почему это важно
PerceptionBench создан командой Moonshot AI. Это тест, который оценивает именно визуальное восприятие мультимодальных моделей, отделяя его от логического мышления. Раньше ошибки ИИ часто списывали на слабую логику. Новый бенчмарк демонстрирует, что сбой происходит раньше, на этапе «считывания» изображения.
Простая аналогия: человек сначала видит объект, а потом думает о нем. Если на сетчатке или в зрительной коре искажение, мозг получит неверные данные. Так и у ИИ: если модель неправильно определила, что на фото стул, все последующие рассуждения строятся на ложной посылке.
PerceptionBench проверяет базовые визуальные задачи: распознавание объектов, сцен, действий. Это фундамент, без которого сложные мультимодальные сценарии невозможны.
Зачем отделять восприятие от мышления
Мультимодальные модели, работающие с текстом и изображениями, обычно оцениваются по конечному ответу. Если ответ неверный, непонятно, где именно произошел сбой: модель не увидела деталь или не смогла рассуждать. PerceptionBench изолирует визуальный компонент.
Пример: модель просят описать сцену на кухне. Она отвечает, что на столе стоит чайник. На самом деле чайника нет. Это ошибка восприятия, а не логики. Модель «увидела» несуществующий объект. Если бы чайник был, но модель не смогла бы сделать вывод, что его нужно вскипятить, это была бы ошибка мышления. Бенчмарк разделяет эти два типа сбоев.
Такой подход помогает разработчикам понять, куда направить усилия: улучшать архитектуру визуального кодировщика или тренировать рассуждения.
Результаты: ни одна модель не набрала и 60%
В тестировании участвовали GPT-5.6 Sol, Claude Fable 5 и Gemini 3.1 Pro. Ни одна модель не достигла 60% точности в базовых визуальных задачах. Это низкий показатель для систем, которые позиционируются как универсальные помощники.
Общие результаты у моделей схожи. Но при детальном разборе выяснилось, что по отдельным навыкам они сильно различаются. Это указывает на отсутствие универсального лидера: каждая модель сильна в чем-то одном и слаба в другом.
Сравнение моделей по навыкам
Почти все модели стабильно проваливают тест на галлюцинации, то есть выдумывание несуществующих объектов. На других задачах результаты расходятся. Одна модель лучше распознает сцены, другая точнее определяет действия. Но ни одна не показывает стабильно высокий результат по всем категориям.
Это значит, что выбор модели для практической задачи должен зависеть от конкретного типа визуального анализа. Универсального решения пока нет.
Главная проблема: галлюцинации в визуальном восприятии
Галлюцинации в контексте изображений - это когда модель «видит» то, чего нет. На фото комнаты она может добавить несуществующий стул или окно. Это общая проблема для всех протестированных моделей. И она возникает на этапе восприятия, а не логики.
Авторы PerceptionBench подчеркивают: раньше такие ошибки приписывали слабому мышлению. Новые данные показывают, что корень проблемы в визуальном кодировщике. Модель буквально получает искаженную картинку.
Почему галлюцинации опасны на практике
Если ИИ используется для анализа медицинских снимков, документов или фотографий, ошибки восприятия приводят к неверным решениям. В медицине модель может «увидеть» опухоль, которой нет, или пропустить реальную. В автономном вождении неверное распознавание знака или пешехода создает прямую угрозу.
В модерации контента галлюцинации означают ложные срабатывания или пропуск нарушений. Пока таким системам нельзя полностью доверять в задачах, где цена ошибки высока. Подробнее о том, как измеряют галлюцинации и почему это важно для бизнеса, читайте в разборе The Hallucinations Leaderboard.
Что это значит для будущего ИИ
Текущие мультимодальные модели далеки от человеческого уровня зрения. Выявление слабых мест - первый шаг к улучшению. Возможно, потребуются новые архитектуры или методы обучения, ориентированные на точное восприятие, а не только на генерацию правдоподобных ответов.
PerceptionBench заполняет пробел в оценке визуального восприятия. Раньше бенчмарки для мультимодальных моделей фокусировались на конечном результате, смешивая восприятие и логику. Теперь у исследователей есть инструмент для точечной диагностики.
Роль бенчмарков в прогрессе ИИ
Бенчмарки задают стандарты и направления для разработчиков. Когда тест выявляет системную слабость, компании направляют ресурсы на ее устранение. Это видно на примере языковых моделей: появление сложных тестов на рассуждение подтолкнуло развитие логических способностей. Один из таких прорывов разбираем в статье о рекорде Claude Opus 5 на ARC-AGI-3.
PerceptionBench может сыграть аналогичную роль для визуального восприятия. Если модели начнут соревноваться в точности «зрения», это ускорит прогресс во всей области мультимодального ИИ.
Кто создал PerceptionBench: Moonshot AI и Kimi
Moonshot AI - компания, известная ассистентом Kimi. Она активно работает над мультимодальными моделями и заинтересована в объективной оценке их возможностей. Создание бенчмарка - это вклад в общую инфраструктуру тестирования ИИ, а не только внутренний инструмент.
Для пользователей Kimi результаты PerceptionBench важны как сигнал: даже продвинутые ассистенты могут ошибаться в визуальных задачах. Это стоит учитывать при использовании ИИ для анализа изображений.
Выводы: что нужно знать обычному пользователю
ИИ пока плохо «видит». Ошибки восприятия распространены, особенно галлюцинации. Ни одна ведущая модель не набрала 60% точности в базовых визуальных задачах по тесту PerceptionBench. Общие результаты у моделей схожи, но по отдельным навыкам разброс большой.
Практическая рекомендация: с осторожностью используйте ИИ для задач, требующих точного визуального анализа. Проверяйте результаты, особенно если речь идет о медицине, документах или безопасности. Если модель описывает изображение, сверяйте описание с оригиналом.
Результаты PerceptionBench соотносятся с другими свежими тестами. Исследователи из Беркли показали, что на сложных профессиональных задачах лучшие модели решают лишь 24% заданий. Подробности в статье о масштабном тестировании GPT, Gemini и Fable. Слабые места ИИ - это не разовая новость, а системная картина текущего уровня технологий.
Есть вопрос или заметили неточность? Напишите нам, мы открыты к диалогу.