Почему AI-модели становятся уже: бывший сотрудник OpenAI объясняет проблему нехватки данных и запускает стартап

Почему AI-модели становятся уже: бывший сотрудник OpenAI объясняет проблему нехватки данных и запускает стартап

Бывший исследователь OpenAI Эндрю Хо объясняет, почему масштабирование не ведёт к универсальному ИИ. Модели становятся уже из-за нехватки данных. Узнайте о стартапе для биоинформатики и прогнозах на $100 млрд инвестиций.

Бывший исследователь OpenAI Эндрю Хо покинул компанию через восемь месяцев работы. Причина - убеждённость, что большие языковые модели не станут универсальным интеллектом за счёт простого масштабирования. Вместо этого они становятся «уже» - более специализированными. Хорошо решают задачи по программированию и математике, но стагнируют или даже регрессируют в качестве языка и простой логике. Решение, по мнению Хо, потребует более 100 миллиардов долларов инвестиций в целенаправленный сбор данных.

Этот взгляд разделяет исследователь из Кембриджа Адам Хант. Он указывает на скрытую ловушку в обучении моделей: улучшение одних навыков происходит за счёт ухудшения других. Истинная универсальность всё ещё недостижима. AI-индустрия входит в новую фазу, где побеждает не размер модели, а качество и специфичность данных для её обучения.

Масштабирование не работает: почему большие модели не становятся умнее во всём

Эндрю Хо пришёл в OpenAI с ожиданием, что рост вычислительных мощностей и объёмов данных приведёт к появлению универсального интеллекта. Практика показала обратное. Модели становятся экспертами в узких областях, а не универсалами. Термин «уже» описывает именно этот процесс - не деградацию, а целенаправленную специализацию. Модель, которая великолепно пишет код, может допускать грубые ошибки в логических рассуждениях, не связанных с программированием.

Адам Хант из Кембриджа называет это компромиссом обучения. Нейросеть оптимизируется под определённый тип задач, и эта оптимизация неизбежно снижает её способности в других. Нельзя просто добавить больше данных и получить одинаковый рост по всем направлениям. Мозг модели перераспределяет ресурсы, улучшая сильные стороны и ослабляя остальные.

От универсальности к специализации: что увидел экс-сотрудник OpenAI

Хо зафиксировал конкретные паттерны. В задачах на генерацию кода и решение математических проблем современные модели показывают устойчивый рост. Одновременно с этим падает качество связного языка, способность к простым логическим выводам и фактическая точность в общих темах. Модель может написать сложный алгоритм на Python, но ошибиться в пересказе содержания короткого текста.

Это противоречит ранним ожиданиям от AGI - универсального искусственного интеллекта, одинаково сильного во всех сферах. Вместо одного всемогущего AI появляется семейство узких экспертных моделей. Для бизнеса это означает смену стратегии: вместо поиска «волшебной кнопки» придётся учиться выбирать правильный инструмент под конкретную задачу. Два параметра API - сохранение цепочки рассуждений и режим уплотнения - позволили GPT-5.6 втрое улучшить результат на бенчмарке ARC-AGI-3, но это не сделало модель универсальной. Улучшение было точечным, подтверждая тезис Хо.

Голод данных: почему $100 млрд - это цена за следующий прорыв

Корень проблемы - не в вычислительных мощностях. Железо становится быстрее и дешевле. Новое исследование OpenAI показало, что ИИ расширяет круг задач сотрудников, но сами модели упираются в потолок данных. Публичные тексты из интернета заканчиваются. Синтетические данные, сгенерированные другими моделями, имеют ограничения по качеству и разнообразию. Они не могут заменить реальную экспертную информацию.

Прогноз Хо жёсткий: AI-лабораториям придётся потратить более 100 миллиардов долларов на целенаправленный сбор данных. Это не расходы на серверы и видеокарты. Это инвестиции в создание новых, узкоспециализированных наборов информации, которых сейчас не существует. Без этого шага модели продолжат «ужаться» в специализации, а прогресс в ключевых областях замедлится. Проблему не исправить одним лишь увеличением вычислительных мощностей - нужно идти в поля, лаборатории, на производства и собирать данные там.

Стартап для биоинформатики: как узкие данные решают узкие задачи

Эндрю Хо запускает стартап, который займётся созданием узкоспециализированных наборов данных для биоинформатики и лабораторных исследований. Это прямой ответ на обнаруженную проблему. Даже передовые модели вроде GPT-5.6 Sol показывают успех лишь в 30% случаев в этих областях. Для науки и медицины такой показатель - катастрофа.

Биоинформатика требует работы с геномными последовательностями, белковыми структурами, данными клинических испытаний. Эти данные не лежат в открытом доступе в том виде, который пригоден для обучения AI. Они разрознены, хранятся в специализированных форматах и требуют экспертной разметки. Стартап Хо планирует создавать именно такие наборы - чистые, размеченные специалистами, готовые для обучения моделей.

Почему 30% успеха - это провал для науки

В биоинформатике ошибка стоит дорого. Неправильно предсказанная структура белка может отправить исследовательскую группу по ложному пути на месяцы. Некорректный анализ генетических данных способен привести к неверному диагнозу. 30% успеха GPT-5.6 Sol означает, что в 7 случаях из 10 модель ошибается. Для сравнения: в задачах генерации кода аналогичные модели уже превышают 80% точности.

Специализированные наборы данных могут поднять точность до приемлемого уровня - 90% и выше. Google выделила $40 млн на программу Genesis Mission, где AlphaFold 3 и AlphaEvolve помогают учёным удвоить темпы открытий. Но даже такие инвестиции решают лишь часть проблемы. Стартап Хо нацелен на создание инфраструктуры данных, которая позволит обучать модели под конкретные научные задачи, а не адаптировать универсальные системы.

Будущее без универсального ИИ: что это значит для бизнеса и технологий

Мнения Хо и Ханта сходятся в главном: истинная универсальность пока недостижима. Вместо одного всемогущего AI появится множество узких экспертных моделей. Каждая будет сильна в своей области и бесполезна в других. Для технологического бизнеса это меняет правила игры.

Компаниям придётся пересмотреть подход к внедрению AI. Нельзя просто подключить одну модель и ожидать, что она решит все задачи - от обработки документов до анализа финансовых рисков. Потребуется комбинация специализированных инструментов. Сэм Альтман встречается с властями США, пока соцсети взрываются слухами о GPT-6 и AGI, но реальность такова: даже следующее поколение моделей не станет универсальным. Специализация - это надолго.

Как выбрать AI-инструмент, когда модели становятся уже

В новой парадигме работают три правила выбора. Первое: оценивайте модель по конкретным бенчмаркам в своей отрасли, а не по общим рейтингам. Модель-лидер в генерации текста может быть аутсайдером в анализе медицинских изображений. Второе: обращайте внимание на происхождение данных для обучения. Модель, обученная на обезличенных клинических данных, будет точнее в медицинских задачах, чем система, видевшая весь интернет. Третье: не ждите универсального решения. Соберите стек из специализированных моделей под каждый тип задач в вашем бизнесе.

Стартап Хо - ранний сигнал этого тренда. Инвестиции потекут не в создание «ещё одной большой модели», а в инфраструктуру специализированных данных. Monday.com сократила 20% персонала ради AI-платформы, и это часть того же процесса: компании перестраиваются под новую реальность, где AI - это набор точных инструментов, а не один универсальный молоток.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции