NVIDIA Nemotron 3 Diarization: открытая модель, которая определяет, кто и когда говорил

NVIDIA Nemotron 3 Diarization: открытая модель, которая определяет, кто и когда говорил

NVIDIA выпустила Nemotron 3 Diarization: открытую модель примерно на 100 млн параметров, которая размечает записи по голосам и работает с прямым эфиром. Разбираем простыми словами, что такое диаризация, где она пригодится и какие у модели ограничения.

NVIDIA выпустила Nemotron 3 Diarization: открытую модель, которая определяет, кто и когда говорил в аудиозаписи. Размер модели небольшой, около 100 млн параметров, поэтому её можно запустить на обычном компьютере или сервере. Она работает с готовыми файлами и с прямым эфиром, различает до восьми собеседников и сохраняет метки говорящих, даже когда участники перебивают друг друга.

Веса опубликованы на Hugging Face под лицензией OpenMDW 1.1: модель разрешено использовать в коммерческих и некоммерческих проектах. Для рынка это заметный шаг, потому что диаризация перестаёт быть функцией дорогих облачных сервисов, куда запись разговора приходится отправлять целиком.

Текста модель не даёт. Она расставляет анонимные метки speaker_0, speaker_1 и так далее, а расшифровка появляется только после того, как рядом заработает система распознавания речи.

Что такое диаризация и почему это важно

Диаризация - это разметка записи по голосам. Система слушает разговор и отмечает, какой отрезок времени принадлежит какому участнику. Результат похож на хронологическую ленту голосов: время, номер говорящего, паузы и наложения реплик.

Термин звучит технически, а задача бытовая. Стенограмма совещания на пять человек без такой разметки превращается в сплошной текст, где непонятно, кто что предложил и кто с кем спорил. Читать её неудобно, искать решение в ней почти бессмысленно.

Чем диаризация отличается от распознавания речи

Распознавание речи, или ASR (automatic speech recognition), переводит звук в текст. Оно отвечает на вопрос «что сказали». Диаризация отвечает на другой вопрос: «кто говорил в этот момент».

Разница видна на коротком примере. ASR выдаст две фразы подряд: «Привет, как дела?» и «Нормально, а у тебя?». Диаризация добавит к ним авторство: первый отрезок 00:00-00:03 принадлежит speaker_0, второй 00:04-00:07 принадлежит speaker_1. Содержания реплик модель не знает, она работает с голосом и временем.

Задачи решают разными инструментами, поэтому на практике их соединяют. Открытые системы распознавания вроде Whisper от OpenAI обучены на 680 000 часах аудио и дают текст, а диаризация подписывает этот текст авторами реплик.

Зачем это нужно на практике

Сценариев несколько, и все они про экономию времени и точность:

  • совещания: протокол сразу показывает, кто предложил решение, а кто возразил;
  • звонки поддержки: видно, как чередуются реплики оператора и клиента и на каком шаге возникло недопонимание;
  • интервью: вопрос и ответ не сливаются в один абзац, готовить материал проще;
  • подкасты: реплики гостей размечены по номерам, монтаж идёт быстрее;
  • голосовые агенты: понимание, кто говорит в каждый момент, помогает диалогу не перебивать пользователя.

Размечать реплики вручную долго, а на записях с перебиваниями ошибки почти неизбежны. Голос меняется не только по тембру, но и по громкости, поэтому человеку приходится переслушивать спорные фрагменты по несколько раз.

Что именно представила NVIDIA: Nemotron 3 Diarization

Nemotron 3 Diarization содержит около 100 млн параметров. Компактность здесь ключевая: модель помещается на обычное оборудование и не требует отдельного кластера ускорителей.

Модель поддерживает до восьми собеседников и не теряется, когда несколько человек говорят одновременно. Она одинаково работает с готовыми записями и с прямым эфиром, сохраняя метки говорящих при паузах и перебиваниях.

Веса выложены на Hugging Face под лицензией OpenMDW 1.1, которая разрешает коммерческое и некоммерческое использование. Модель не расшифровывает содержание разговора и не определяет людей по имени или голосу: на выходе только анонимные метки speaker_0, speaker_1 и далее (описание релиза и технические детали).

Ключевые характеристики модели

  • около 100 млн параметров;
  • до 8 говорящих в одной записи;
  • на входе одноканальное аудио с частотой 16 кГц;
  • на выходе таблица вероятностей размером [T, 8]: восемь колонок по числу говорящих, строки по умолчанию описывают отрезки по 10 мс;
  • потоковый режим с рекомендуемым буфером от 320 мс;
  • кеш ранее услышанных голосов, который не даёт меткам перескочить на другого участника после паузы;
  • лицензия OpenMDW 1.1 с правом коммерческого использования.

Что значит «открытая модель» и почему это важно

Открытые веса дают возможность скачать модель, изучить её и запустить у себя, без оплаты внешнего API и без отправки аудио в чужое облако. Компания сама решает, где хранятся записи разговоров и у кого есть к ним доступ.

Лицензия OpenMDW 1.1 снимает типичное для открытых моделей ограничение: разрешено и коммерческое, и некоммерческое использование. Значит, модель можно встроить в готовый продукт для клиентов.

Как работает модель: просто о техническом

На вход модель получает одноканальное аудио с частотой 16 кГц, то есть обычную запись с одного микрофона. На выходе получается таблица вероятностей размером [T, 8]. Число T означает количество временных отрезков, восемь колонок соответствуют говорящим, а строки по умолчанию описывают шаги по 10 мс.

Что на выходе: метки speaker_0, speaker_1 и временная шкала

Из таблицы собирается понятная временная шкала. Пример вывода:

ГоворящийНачалоКонец
speaker_000:0000:07
speaker_100:0600:12
speaker_000:1300:18

Первые два отрезка пересекаются: с 00:06 по 00:07 собеседники говорили одновременно. Такие наложения модель показывает, а не склеивает в одну реплику.

Голоса нумеруются в порядке появления. Первый участник разговора становится speaker_0, следующий speaker_1. Имена в схеме не предусмотрены: модель не знает, кто скрывается за номером.

Потоковый режим и работа с прямым эфиром

Одна и та же модель обрабатывает готовые файлы и потоковое аудио. В потоковом режиме она получает запись небольшими фрагментами и держит кеш ранее услышанных голосов, чтобы не менять метки собеседников после пауз и перебиваний. Без кеша speaker_0 после молчания легко превратился бы в speaker_2, и вся стенограмма рассыпалась бы.

NVIDIA рекомендует буферы продолжительностью 30,4; 1,04; 0,64 или 0,32 секунды. Технически возможен буфер 80 мс, но минимальным рекомендуемым значением остаются 320 мс. Эти цифры описывают только объём аудио, который нужно накопить перед запуском модели: сетевая задержка, распознавание слов и остальная обработка в них не учтены. Для прямого эфира это значит, что итоговая пауза перед появлением метки окажется больше 320 мс.

Насколько хорошо она работает: цифры и рейтинги

В предварительном рейтинге VoiceArena Diarization-Bench модель заняла первое место среди 12 систем и 17 конфигураций. Тест включал 139 англоязычных разговоров общей продолжительностью около 22 часов.

Что такое DER и как его читать

DER (diarization error rate) - доля ошибок диаризации. Метрика складывается из пропущенной речи, ложных срабатываний и случаев, когда реплику приписали не тому участнику. Чем меньше значение, тем точнее система.

Nemotron 3 получила 14,72% DER против 19,3% у ближайшего конкурента. Разница составляет 4,58 процентных пункта, около 24% в относительном выражении. Для задач, где важен каждый диалог, такой отрыв заметен.

Сравнение с конкурентами и предыдущей моделью

Помимо рейтинговой таблицы, у NVIDIA есть собственные замеры: по данным компании, DER снизился в среднем на 41% относительно предыдущей потоковой модели. Это внутренние тесты разработчика, а не независимая проверка, поэтому цифру стоит воспринимать как заявление вендора.

Рейтинг VoiceArena Diarization-Bench назван предварительным, и NVIDIA отдельно предупреждает о результатах тестирования; полный текст этого предупреждения в доступном фрагменте источника не приводится. Итоговые цифры могут измениться, когда в бенчмарк добавят новые системы.

Что модель не умеет и как это исправить

Ограничения короткие, но принципиальные. Модель не расшифровывает речь, не определяет людей по имени или голосу, не различает эмоции и не оценивает разговор по смыслу. Она только расставляет анонимные метки на временной шкале.

Почему для стенограммы нужна ASR-модель

Диаризация даёт время и номера говорящих, текста в ней нет. Чтобы получить стенограмму, рядом запускают систему распознавания речи и сопоставляют отрезки двух систем по времени. Пример: распознавание нашло фразу «Давайте начнём» в интервале 00:02-00:04, диаризация отнесла этот же интервал к speaker_0. Значит, фразу произнёс speaker_0.

Готовых систем распознавания на рынке много. Google улучшил голосовой ввод в Gemini 3.5 Transcribe: по описанию компании, распознавание работает на 70% быстрее, поддерживает 85 языков и убирает слова-паразиты. Такие сервисы закрывают вторую половину задачи.

Как определить личность говорящего

За метками speaker_0 и speaker_1 стоят конкретные люди, но модель о них ничего не знает. Чтобы подставить имя, нужна отдельная система верификации говорящего: она сравнивает голос с заранее записанными образцами и находит совпадение.

Схема полезна там, где состав участников известен заранее, например на регулярных совещаниях команды. Она требует согласия участников и дополнительной настройки: записать образцы голосов, задать порог совпадения, решить, что делать с новыми людьми в звонке.

Полный путь от записи до текста с авторами выглядит так: аудио, затем диаризация на Nemotron 3, затем распознавание речи, затем объединение результатов по времени, затем стенограмма с указанием говорящих. Без ASR модель не даст ни строчки текста, без верификации ни одного имени.

Где это можно применить: практические сценарии

Диаризация полезна всюду, где в записи больше одного голоса и важно понимать, кому принадлежит реплика. Особенно там, где участники перебивают друг друга.

Локальный запуск и приватность

Модель на 100 млн параметров помещается на обычный компьютер или сервер, поэтому аудио не обязано покидать инфраструктуру компании. Для медицинских консультаций, юридических совещаний и внутренних обсуждений это снимает главный вопрос: кому уходят записи разговоров и как долго они там хранятся.

Компактность даёт и второй эффект: обработку можно вести без постоянных расходов на внешний сервис, а исходные файлы держать под своим контролем. Именно это преимущество открытой модели чаще всего оказывается решающим при выборе инструмента.

Примеры для бизнеса и повседневной работы

  • совещания: автоматический протокол сразу показывает авторов решений и возражений;
  • звонки поддержки: разметка диалогов оператора и клиента помогает найти шаг, на котором возникло недопонимание;
  • интервью: расшифровка с авторством реплик ускоряет подготовку материала;
  • подкасты: реплики гостей размечены по номерам, монтаж идёт быстрее;
  • голосовые агенты: понимание, кто говорит в каждый момент, помогает диалогу не перебивать пользователя. Разработки в этой области идут активно: Tencent Gander совмещает живой разговор с фоновыми задачами и перебивает пользователя в 8% случаев на тесте Full-Duplex-Bench v3.

Компактный размер позволяет запускать модель на обычном оборудовании, поэтому порог входа для небольшой команды или отдельного разработчика оказывается низким. Ручная разметка уходит из процесса, а стенограмма получается пригодной для поиска и анализа.

Что это значит для рынка и обычных пользователей

NVIDIA продолжает выпускать небольшие открытые модели, и диаризация перестаёт быть нишевой функцией крупных облачных платформ. Доступ к технологии получают малый бизнес и отдельные разработчики, у которых нет бюджета на инфраструктуру и договора с поставщиком.

Тренд на открытые и компактные модели

Открытые веса и понятная лицензия меняют способ выбирать инструмент. Результат в DER, ограничения по числу говорящих и условия использования можно проверить до внедрения, а не после подписки. Чем больше моделей с опубликованными метриками, тем проще сравнивать решения под конкретную задачу.

Компактность добавляет к этому независимость от внешних сервисов: обработка остаётся там, где лежат записи. Для отраслей с жёсткими требованиями к конфиденциальности это весомый аргумент.

Как это может изменить вашу работу

Автоматические протоколы совещаний станут точнее, расшифровка интервью ускорится, анализ звонков поддержки упростится. Быть техническим специалистом для этого не нужно: инструменты на базе таких моделей будут появляться в привычных сервисах записи и совместной работы.

Проверить технологию на своих данных можно уже сейчас. Возьмите одну запись совещания, прогоните её через диаризацию и распознавание речи и сравните метки говорящих с реальным ходом разговора: так вы увидите, где модель ошибается на ваших микрофонах и акцентах. Веса и карточку лицензии ищите на Hugging Face, а технические подробности с примерами и заявленными метриками в описании релиза.

Есть вопрос или заметили неточность? Напишите нам, мы разберём детали и обновим материал.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции