Врио главы Минцифры Юрий Гамзатов рассказал об интеграции дагестанских языков в цифровые сервисы
Проект уже приносит первые практические результаты. Помимо перевода, специалисты создают мультимодальные корпуса, где каждое предложение сопровождается аудиозаписью. Это критически важно для синтеза речи — без таких данных «Алиса» не сможет корректно произносить гортанные звуки, характерные для кавказских языков. Студийная запись ведётся с участием филологов и дикторов, прошедших специальный отбор среди носителей из разных районов республики, что позволяет учитывать диалектные особенности.
Особое внимание уделяется сложностям морфологии. Например, в лезгинском до 40 падежных форм, а в аварском — сложная система классных показателей. Алгоритмы Яндекса адаптируют под эти особенности, используя параллельные корпуса как основу для обучения нейросетевых моделей. Параллельно идёт работа над нормализацией письменности: часть языков имеет вариативное написание, и единый стандарт для цифровой среды сейчас формируется совместно с учёными НИИ.
Волонтёрское сообщество через бот «Языки Дагестана» стало ключевым ресурсом. За несколько месяцев пользователи предоставили более 30 тысяч размеченных фраз, включая бытовую лексику и термины из области медицины и права. Эти данные проходят двухступенчатую проверку — автоматическую и ручную, с участием преподавателей национальных школ.
Следующий этап — интеграция в Госуслуги. Планируется, что интерфейс портала получит переключатель языков, а голосовой ввод в приложениях будет распознавать дагестанскую речь. Запуск первых версий ожидается к концу 2026 года, при этом приоритет отдаётся аварскому и лезгинскому как наиболее распространённым.