Сбер выкатил в open source целую линейку речевых моделей 😘
В открытом доступе появились GigaChat Audio, GigaAM Multilingual и датасет TimeGround-1M. Модели уже лежат в открытом доступе, код можно посмотреть на GitHub, а сами решения скачать с Hugging Face и запускать у себя.
Начнем с GigaChat Audio. Модель умеет понимать аудио как полноценный контекст. Например, можно загрузить двухчасовую запись встречи и вместо долгого прослушивания получить выжимку, найти конкретный момент разговора или спросить, где именно обсуждали нужную тему. Модель привязывает события ко времени и показывает таймкоды, то есть работает скорее как поиск внутри разговора, а не как обычная расшифровка. 🤗 ai-sage/GigaAM-Multilingual 👩💻 salute-developers/GigaAM
GigaAM Multilingual. Решает другую проблему: языки, которые часто остаются за пределами больших ИИ-систем. Она поддерживает русский, английский, казахский, киргизский и узбекский, а при необходимости её можно адаптировать под новые языки или конкретные сферы. Например, разработчики показывали дообучение под грузинский и башкирский язык с небольшим количеством данных. 🤗 ai-sage/GigaChat3.1-Audio-10B-A1.8B
Отдельно интересно, что Сбер открыл не только сами модели, но и данные для обучения. TimeGround-1M позволяет разработчикам создавать собственные решения, а не просто пользоваться готовым инструментом.