Искусственный интеллект колоссально упростил нашу жизнь за последние несколько лет, и каждый месяц выходят новые приложения, фичи и инструменты, которые все больше и больше оптимизируют повседневные процессы. И пусть многие боятся потерять рабочие места из-за этого, сейчас ИИ выступает скорее не как угроза, а как помощник и ассистент для реальных сотрудников. Так, er10.kz регулярно обозревает, какие ИИ-функции помогают работникам тратить меньше времени на операционные, повторяющиеся задачи, и больше — на креативные, интересные.
На сей раз на обзоре новинка от Сбербанка: в открытом доступе появились две ИИ-модели — GigaChat Audio и GigaAM Multilingual, делающие работу с аудио максимально простой и комфортной. Они были опубликованы на Hugging Face и GitHub под лицензией MIT, и редакция ER10 Media их протестировала. Рассказываем о том, как работают решения, и чем они будут интересны для аудитории из Центральной Азии.

GigaAM Multilingual
GigaAM Multilingual это открытая мультиязычная модель распознавания речи. Репозиторий развивается с апреля 2024 года, а версия Multilingual вышла в июне 2026. Она состоит из аудиоэнкодера и многоязычной модели автоматического распознавания речи ASR.
Примечание редакции: аудиоэнкодер — это часть модели, которая “слушает” аудиозапись и преобразует звук в набор признаков, с которыми дальше может работать модель.
Собственно, аудиоэнкодер предварительно обучили на 2 миллионах часов речи, более чем на 70 языках. При этом особый фокус был направлен на языки стран СНГ. Затем многоязычная ASR-модель обучилась на 50 тысячах часов аудиозаписей по разным темам. Так родилась GigaAM Multilingual, которая сейчас поддерживает русский, казахский, английский, кыргызский и узбекский языки.
Тест-менеджер ER10 Media Даяна Надырова сравнила GigaAM Multilingual с топовой моделью распознавания аудио Whisper large v3.
— Что особенно удобно — модель не нужно устанавливать на компьютер. Разработчики подготовили готовый файл для Google Colab. Поэтому я открываю его в браузере, запускаю ячейки по порядку и тестирую распознавание речи там. Записываю голосовое на казахском, и потом прогоняю через GigaAM Multilingual и Whisper large v3, топовую модель распознавания, которой пользуется полмира, — объяснила Даяна Надырова. — На казахском Whisper показал заметно худший результат. А проверив оба решения через открытый тест Common Voice, я получила следующие результаты: Whisper выдал 57.8% ошибок, а GigaAM всего 13.8%. На практике GigaAM показывал некоторые неточности. Например, иногда было немного трудно понять суть текста из-за отсутствия точных знаков препинания.

При запуске GigaAM через Colab Даяна столкнулась с ошибкой Tensor on device cpu is not on the expected device meta! Оказалось, что проблема возникла из-за нажатия кнопки “Выполнить все”. Потому что ноутбук не рассчитан на сквозной прогон: это каталог примеров из двух независимых разделов, каждый со своим набором зависимостей. GigaAM from GitHub ставит библиотеку из репозитория, а GigaAM from Hugging Face — собственные версии: torch 2.8, torchaudio 2.8, transformers 4.57, numpy 2.x.
А после установки необходимых компонентов также нужно перезапустить сессию Colab — иначе модель может не загрузиться. Поэтому достаточно выбрать нужный раздел, выполнить ячейки по порядку и после установки перезапустить сессию.
GigaAM Multilingual доступна в двух версиях:
- компактной на 240 млн параметров, которая рассчитана на работу на стандартных процессорах,
- и более мощной флагманской, которая приоритезирует качество распознавания.

GigaChat Audio
Модель обладает 10 миллиардами параметров, причем на каждом токене активны 1,8 миллиарда. А для разработчиков имеется и облегченная версия: GigaChat3.1-Audio-10B.
— Именно благодаря этому модель быстрая, несмотря на свой внушительный вес, — заметила Даяна. — В отличие от GigaAM, она не просто расшифровывает речь, но еще и слышит и понимает ее содержание. Например, можно скормить GigaChat Audio часовой подкаст и спросить: "в какой момент говорили про такую-то тему?". А модель подскажет точный таймкод.
Тест-менеджер er10.kz загрузила в GigaChat Audio запись своего подкаста и задала вопрос о его содержании. Модель тут же выдала ответ с точным таймкодом. А последующая проверка подтвердила его правильность.
На какие особенности GigaChat Audio стоит обратить внимание?


- Распознавание эмоций: по внутренним тестам GigaChat Audio показывает точность 80%;
- Возможность работать с длинными аудиозаписями: можно обработать запись продолжительностью до трех часов. А размер контекста составляет до двух часов;
- Поиск нужного таймкода: как мы говорили ранее, можно задать вопрос по содержанию записи и найти нужный фрагмент по таймкоду;
- Пересказ: можно попросить модель пересказать какую-нибудь часть аудио;
- Различать спикеров: доступна функция распознавания разных спикеров аудиозаписи;
- Память: модель поддерживает долгосрочную память, благодаря чему можно сохранить факты из текущих аудиозаписей для будущих сессий.
— При этом GigaChat Audio существенно требовательнее к ресурсам, чем компактные модели распознавания речи, — заключила Даяна. — Для ее запуска в описанном сценарии требуется видеокарта с 24 ГБ памяти или облачная GPU.

Почему это вообще имеет значение
GigaChat Audio и GigaAM Multilingual интересны и полезны совершенно разным специалистам:
- AI-разработчикам и ML-инженерам, исследователям в области Speech AI, техническим лидерам и архитекторам AI-решений, R&D-командам, open source сообществу.
- Компаниям, которые внедряют голосовые интерфейсы, ассистентов и аналитику звонков, в первую очередь тем, кому нужен локальный запуск без передачи данных наружу.
- Отдельно разработчикам и продуктовым командам в Казахстане, Кыргызстане и Узбекистане: для этих языков открытого распознавания такого качества раньше не существовало.
— Это открытые веса, а не API, то есть скачал один раз, и модель работает у тебя всегда, — объяснила Даяна. — Лицензия MIT, к тому же их можно использовать в коммерческих проектах. И для разработчиков из Казахстана, Кыргызстана, Узбекистана это отличная модель, которая по-настоящему хорошо понимает тюркские языки.




