Сбер представил обновлённую нейросеть GigaChat Audio – большую языковую модель, которая способна обрабатывать аудиофайлы, и выложил её в открытый доступ. Модель научилась понимать интонацию говорящего и получила расширенные возможности по обработке звуковой информации.
GigaChat Audio умеет определять, с какой эмоцией говорит человек — радостью, раздражением, грустью и другими — по интонации, характеристикам голоса и нюансам произношения. Это позволяет создавать на основе модели сервисы, которые реагируют уместнее: например, голосовых ассистентов, которые мягче отвечают раздражённому пользователю или поддерживают настроение, если человек делится хорошей новостью.
Модель научилась обрабатывать записи длиной до двух часов и ориентироваться внутри них: можно спросить, в какой момент разговора обсуждали конкретный вопрос, попросить пересказать отдельный отрезок или получить саммари всей записи со ссылками на таймкоды. Нейросеть способна различать разных спикеров в записи. Эта возможность будет полезна для разбора совещаний и звонков, навигации по записям, протоколирования.
По результатам независимых тестов, новая модель GigaChat Audio способна понимать и отвечать на голосовые запросы на уровне лучших мировых аналогов. Это подтверждает тест Arena Hard Audio, где эксперты в «слепую» сравнивают ответы разных моделей на одни и те же голосовые вопросы. GigaChat Audio 32.4 набрала 75% побед — почти как у Gemini-3-Flash-preview (77,5%) и больше, чем у Gemini-2.5-Pro (62%). По замерам точности распознавания эмоций новой модели — модель Сбера достигает 80%. Это выше, чем у модели Qwen3-Omni-30B (70%) или Kimi-Audio (62%).
Доступность для разработчиков
Команда Сбера выложила в открытый доступ модель GigaChat Audio для свободного использования разработчиками. Нейросеть базово поддерживает русский и английский для распознавания и может быть обучена на другие языки, включая языки стран СНГ. Для этого достаточно собрать несколько десятков часов размеченных качественных аудиозаписей. На основе модели можно создавать сервисы транскрибации, тренажёры произношения, инструменты для оценки качества озвучки, голосовые переводчики с пониманием контекста и сервисы пересказа длинных записей.
Сбер также выложил в открытый доступ GigaAM Multilingual по лицензии MIT – расширенную версию семейства моделей автоматического распознавания речи GigaAM. Это первая российская открытая модель, работающая с несколькими языками, и лучшее из открытых решений по качеству распознавания русской, казахской, киргизской и узбекской речи. Модель также поддерживает английский язык. Энкодер предобучен на 2 млн часов речи на более чем 70 языках, поэтому модель можно быстро адаптировать к новым языкам. По замерам, даже компактная версия GigaAM Multilingual допускает меньше ошибок, чем более крупные Whisper large v3 и Omnilingual 1B: средняя доля ошибок 12,2% против 14,1% и 16,6% соответственно, а на языках СНГ разрыв кратный. Модель доступна в двух версиях — компактной и флагманской, обеспечивающей более высокое качество распознавания. GigaAM Multilingual подойдёт для кол-центров и голосовых ассистентов, расшифровки встреч, интервью и подкастов, голосового ввода в приложениях и автоматических субтитров — везде, где пользователи говорят на нескольких языках.
Подробный обзор от тест-менеджера er10.kz читайте по ссылке: GigaChat Audio и GigaAM Multilingual: открытые ИИ-модели для упрощения работы с аудио
Модели уже доступны на GitVerse и Hugging Face. Научные статьи о новых моделях приняты на одну из ведущих международных конференций по речевым технологиям Interspeech 2026.



