Nvidia випустила Nemotron 3 Diarization, модель на 100 млн параметрів, яка в реальному часі розрізняє до восьми спікерів і лежить у відкритому доступі.

Білдер отримує діаризацію як локальний компонент, а не як підписку. Аудіо залишається на власному сервері, затримка прогнозована, а білінг не стрибає разом із кількістю зустрічей. Це продовжує лінію Nvidia на дешевший інференс після здешевлення агентів для кодування. За даними The Decoder, ваги моделі доступні безкоштовно.

Що вміє модель на практиці?

Вона відповідає на одне питання: хто говорить у кожен момент розмови. Модель розрізняє до восьми спікерів і фіксує епізоди, коли двоє говорять одночасно. Працює як із записами, так і з живим аудіо.

Сам текст вона не розшифровує. У парі з системою розпізнавання на кшталт Parakeet вона віддає транскрипт із мітками спікерів. Мітки анонімні, на зразок «speaker_2», без імен і привʼязки до конкретної людини.

Для продукту це означає простіший пайплайн. Один невеликий модуль ставить мітки часу і спікерів, другий перетворює мову на текст. Аудіо не покидає контур компанії, що важливо для юристів, медицини і кол-центрів.

Наскільки вона точна і де ламається?

На бенчмарку Diarization-Bench від VoiceArena модель посідає перше місце з помилкою 14,72%. Найближчий конкурент показує 19,3%. Бенчмарк суворий: він зараховує одночасну мову і карає навіть за мікрозсуви на межах реплік.

Порівняно з попередником Streaming Sortformer помилка впала в середньому на 41% у восьми тестових сценаріях при буфері 1,04 секунди. Більше учасників, сильний фоновий шум і реверберація далі підвищують помилку. Для чистих дзвінків удвох це робочий рівень, для восьми людей у гулкій переговорній потрібна перевірка.

Що дає буфер від 0,32 до 30,4 секунди?

Буфер перемикається між чотирма рівнями, від 30,4 до 0,32 секунди. Довший контекст дає моделі більше опори, коротший ріже затримку, але зазвичай знижує точність.

Ймовірно, для живого асистента доведеться тримати буфер близько секунди, щоб баланс між затримкою і стабільністю міток влаштовував користувачів. Для офлайн-обробки записів логічно брати максимальний буфер і перераховувати складні місця окремо.

Що робити зараз

Перевірте модель на власних записах, а не на чистому демо.