More posts — page 3

52 posts total
М
Милорд
@milord_q
60.9K

Сбер выкатил в open source целую линейку речевых моделей 😘

В открытом доступе появились GigaChat Audio, GigaAM Multilingual и датасет TimeGround-1M. Модели уже лежат в открытом доступе, код можно посмотреть на GitHub, а сами решения скачать с Hugging Face и запускать у себя.

Начнем с GigaChat Audio. Модель умеет понимать аудио как полноценный контекст. Например, можно загрузить двухчасовую запись встречи и вместо долгого прослушивания получить выжимку, найти конкретный момент разговора или спросить, где именно обсуждали нужную тему. Модель привязывает события ко времени и показывает таймкоды, то есть работает скорее как поиск внутри разговора, а не как обычная расшифровка. 🤗 ai-sage/GigaAM-Multilingual 👩‍💻 salute-developers/GigaAM

GigaAM Multilingual. Решает другую проблему: языки, которые часто остаются за пределами больших ИИ-систем. Она поддерживает русский, английский, казахский, киргизский и узбекский, а при необходимости её можно адаптировать под новые языки или конкретные сферы. Например, разработчики показывали дообучение под грузинский и башкирский язык с небольшим количеством данных. 🤗 ai-sage/GigaChat3.1-Audio-10B-A1.8B

Отдельно интересно, что Сбер открыл не только сами модели, но и данные для обучения. TimeGround-1M позволяет разработчикам создавать собственные решения, а не просто пользоваться готовым инструментом.

C
Crypto | Azam
@crypto_azam
4K

💳 Неименная карта Visa Gold банка Кыргызстана

Карта открывается со счётом в USD и подходит для оплаты зарубежных сервисов, покупок и поездок.

⏳ Срок оформления: до 2 рабочих дней + доставка 📅 Срок действия: 3 года 💵 Годовое обслуживание: 50 USD (списывается со счета при первом пополнении)

🌍 Возможности карты: • онлайн-покупки по всему миру • оплата в зарубежных магазинах и сервисах • снятие наличных в банкоматах • подключение мобильного банка к российской SIM-карте • поддержка Google Pay • комиссия за снятие наличных — 1%

📊 Суточные лимиты: • снятие наличных — до 2 800 USD • интернет-покупки — до 1 200 USD • офлайн-оплата — до 3 200 USD

💵 Способы пополнения: • с привязанной российской карты «Мир» в приложении банка • через Сбербанк по номеру карты • рублёвым переводом по реквизитам счёта из российских банков, не находящихся под санкциями

📄 Для оформления потребуются: • цветной скан основного разворота загранпаспорта в формате PDF • номер российского телефона • электронная почта • семейное положение • ИНН

В
Волчонок Флейзин
@flazin7
20.7K

⚡️БРЕЛОКИ ФЛЕЙЗИНА ТОЖЕ В ПРОДАЖЕ⚡️ Теперь Флейзина можно брать с собой куда угодно, повесить на ключи, рюкзак или пенал! 😍 ‼️ Заказать брелок можно уже сейчас на сайте‼️ ⭐️ https://flazinjell.ru/product/brelok-flazin ⭐️

📦 Доставка доступна в: 🇷🇺 Россию • 🇧🇾 Беларусь • 🇰🇿 Казахстан • 🇺🇿 Узбекистан • 🇦🇲 Армению • 🇰🇬 Кыргызстан

В
Волчонок Флейзин
@flazin7
17.7K

🔥НАКОНЕЦ-ТО! МЕРЧ ФЛЕЙЗИНА УЖЕ В ПРОДАЖЕ! 🔥 Мы долго готовились и теперь наш мерч доступен к заказу! 🤪 ‼️Заказать мерч можно уже сейчас на сайте: flazinjell.ru ‼️

Встречайте два принта🥺 «РЕТРОГЕЙМЕР🎮» и «СКЕЙТБОРДИСТ🛹»

📦 Доставка доступна в: 🇷🇺 Россию • 🇧🇾 Беларусь • 🇰🇿 Казахстан • 🇺🇿 Узбекистан • 🇦🇲 Армению • 🇰🇬 Кыргызстан

Э
эйай ньюз
@ai_newz
34.8K

Сбер выкатил в опенсорс GigaAM Multilingual и GigaChat Audio

Статьи по архитектуре моделей уже приняли на Interspeech 2026. В релизах исправили две проблемы открытых Speech AI систем — слабую поддержку языков СНГ и деградацию качества на длинных аудио.

GigaAM Multilingual — мультиязычный стек для распознавания русского, казахского, киргизского, узбекского и английского. Тут две части: аудио-энкодер и CTC ASR. Энкодер обучали на 2 млн часов речи на 70+ языках, и он быстро адаптируется к новым доменам. На башкирском и грузинском его дообучили с одного датасета Common Voice до ошибки WER ~4% (у Whisper Encoder при тех же вводных — 11%+). А модель распознавания CTC ASR в версии на 240M параметров обходит Whisper Large v3 и Omnilingual 1B, хотя весит кратно меньше.

GigaChat Audio — это audio-native LLM на базе GigaAM Multilingual и GigaChat3.1-10B-A1.8B. Модель тянет до 2 часов контекста и умеет в temporal grounding — локализацию событий во времени с таймстемпами и суммаризацией интервалов. На длинных записях от 20 до 60 минут точность локализации IoU составляет 48.3, в то время как у Voxtral, Phi-4 и Qwen3-Omni результат близок к нулю. Вдобавок опубликовали датасет TimeGround-1M для обучения LLM привязке событий ко времени, а на RuBQ-Audio модель выбивает 60.0 (против 43.7 у Qwen3-Omni).

Полноразмерную GigaChat-Max-Audio уже добавили в ИИ-помощник ГигаЧат giga.chat, а распознавание голосовых сообщений работает в @smartspeech_sber_bot. Веса открытых моделей, датасет и статьи на arXiv уже в сети.

GigaAM Multilingual GigaChat Audio

@ai_newz