Компания «Криптонит» разработала компактную нейросетевую модель для определения языка по короткому фрагменту речи (задача LID — Language Identification). Новая версия содержит 219 млн параметров против примерно 1 млрд у исходной, работает примерно в 10 раз быстрее, а точность распознавания снизилась менее чем на 1%. По данным компании, это позволит обрабатывать больший объём аудио на существующем оборудовании без пропорционального роста парка серверов.
Модель анализирует акустические и фонетические особенности речи, извлекая их напрямую из аудиосигнала. Система сначала отделяет речь от пауз и шума, затем LID‑модуль определяет язык и его вариант, оценивая уверенность в выборе. Результат идентификации выдаётся в виде стандартизированных языковых кодов (rus, eng и т. д.), что упрощает интеграцию в конвейеры обработки данных по распознаванию речи.
Кому подойдёт разработка
По словам Александра Самойлова, исследователя направления обработки аудиоданных компании «Криптонит», решение может использоваться у операторов связи, в технической поддержке и транснациональных компаниях, где аудиопотоки исчисляются миллионами записей.
Как обучали модель
В основе разработки лежит метод дистилляции знаний (knowledge distillation). Крупная обученная модель выступает «учителем» и передаёт компактной модели-«ученику» не только правильные ответы, но и распределение уверенности по всем вариантам. Обучение ученика опирается на комбинированную функцию потерь, которая учитывает и разницу с мягкими целями учителя, и стандартную кросс‑энтропию по жёстким меткам классов.
Специалисты лаборатории искусственного интеллекта «Криптонита» перебрали варианты архитектуры и объёма обучающих данных, проверили устойчивость модели к шумам и смене аудиокодеков, а также отдельно поработали над скоростью инференса. Основой для акустического анализа служит энкодер, который превращает звук в векторы фонетических и просодических признаков. Для окончательного решения система агрегирует оценки по коротким фреймам в 20–50 мс на интервале в 5–10 секунд.