5 Aug 2026, 11:26 UTC634 views31 reactionsread 6 August 2026 Interaction Models: A Scalable Approach to Human-AI Collaboration
Каскад из VAD, ASR, LLM и TTS всё ещё остаётся одним из самых понятных способов собрать голосового агента. Компоненты можно независимо улучшать и менять распознавание, языковую модель, поиск, инструменты, и, конечно же, синтез. Но за модульность приходится платить — задержки компонентов складываются, а взаимодействие обычно остаётся пошаговым: сначала…
🔥16❤8👌4👍2🤩1
29 Jul 2026, 09:16 UTC≈1,230 views32 reactionsread 6 August 2026 Photo
Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling Up Real-world Acoustic Simulation
Разбираем статью со скромным названием Mega-ASR. Основной вклад работы — улучшение распознавания сложных аудио. Также авторы собрали и выложили свой датасет — VOICES-IN-THE-WILD-2M.
В реальных условиях, где есть разные шумы, ASR работает хуже. Так происходит, потому что шумов нет в данных. Кто-то пробует добавлять в дан…
❤11👍9🔥7🤓4🆒1
23 Jul 2026, 08:58 UTC609 views23 reactionsread 6 August 2026 A review on subjective and objective evaluation of synthetic speech
Сегодня разбираем обзор 2024 года, авторы которого попытались охватить 40 с лишним лет эволюции оценки синтеза речи — с 80-х и до наших дней. При этом статья не такая уж большая: 27 страниц, 7 из которых — ссылки на множество упомянутых работ.
Первая часть, пожалуй, самая увлекательная — историческая справка о том, как оценивали синтез речи с самог…
❤10🎅4👍4🤩2❤🔥1💯1🔥1
17 Jul 2026, 11:15 UTC732 views26 reactionsread 6 August 2026 Photo
Работы о голосовых технологиях на ICML 2026 [2/2]
Продолжаем подборку работ от Максима Борисова. В первой части — общие впечатления о конференции и несколько интересных статей.
CoCoEmo: Composable and Controllable Emotional TTS via Activation Steering
Эмоция в речи часто состоит из нескольких, порой противоречивых оттенков, которые могут не совпадать с текстом, но TTS обычно навязывают одну эмоцию на всё высказыва…
🔥11👍8❤7
17 Jul 2026, 09:51 UTC600 views22 reactionsread 6 August 2026 Photo
Работы о голосовых технологиях на ICML 2026 [1/2]
С 6 по 11 июля в Сеуле проходила International Conference on Machine Learning, на которой побывал наш коллега Максим Борисов. Он поделился впечатлениями и подборкой работ на тему Speech.
По спичу представленность была довольно ограниченной — большинство релевантных работ можно было найти на постерах, а не в основных треках и oral-докладах. Зато именно постерные сесс…
👍10🔥6❤5❤🔥1
10 Jul 2026, 15:12 UTC709 views20 reactionsread 6 August 2026 Photo
Voxtral Realtime
Разбираем статью о модели Voxtral Realtime, в которой предложили ещё один способ, как стримить speech-to-text.
Авторы утверждают, что у них получилось сделать модель, в которой можно контролировать латенси и которая при задержке в полсекунды имеет паритет по качеству с Whisper. Если увеличить задержку до секунды, то модель начинает превосходить Whisper, ещё больше — например, 2,5 секунды, — качеств…
❤8👌5👍5💯2
2 Jul 2026, 07:48 UTC≈3,020 views22 reactionsread 6 August 2026 Photo
UALM: Unified Audio Language Model for Understanding, Generation and Reasoning
В более ранних статьях аудиопонимание и генерация традиционно шли параллельно и не пересекались. Но, если задуматься, человек, решая задачу в области аудио, одновременно мыслит словами и воспринимает звук, постоянно переключая в голове эти модальности — например, так происходит, когда композитор пишет музыку.
Объединить аудиопонимание, г…
❤8🔥7👍4💯2🕊1
30 Jun 2026, 07:45 UTC766 views37 reactionsread 6 August 2026 Photo
Ускорили перевод видео в Яндекс Браузере — задистиллировали диффузионный декодер TTS
Сегодня делимся свежей хабростатьёй о том, как ускорили синтез речи при переводе видео в Яндекс Браузере.
С чего стартовали
Внутри TTS — каскад из трёх частей:
🔴языковая модель предсказывает аудиотокены по тексту;
🔴диффузионный декодер восстанавливает мел-спектрограмму из латентов;
🔴вокодер превращает её в звуковую волну.
После т…
❤20🔥11👍6
23 Jun 2026, 08:53 UTC988 views36 reactionsread 6 August 2026 Photo
Chunk-wise Attention Transducers for Fast and Accurate Streaming Speech-to-Text
В NVIDIA есть несколько сотрудников, которые стабильно пишут интересные статьи об ASR в целом и RNN-T в частности. Примеры таких работ — FastConformer, TDT, WIND. Сегодня расскажем о CHAT, суть которого также в улучшении RNN-T. Но сначала вспомним, что это такое.
Recurrent Neural Network Transducer — архитектура для распознавания и пере…
👍16❤11🔥7👏1🥰1
18 Jun 2026, 09:02 UTC≈1,470 views39 reactionsread 6 August 2026 Photo
Как устроена голосовая активация в Яндекс Дропс
Недавно Яндекс запустил свои первые ИИ-наушники — Яндекс Дропс. В числе прочего они умеют распознавать обращение «Алиса», а отвечает за эту способность компонент, который мы внутри называем «споттером» (чуть подробнее писали о споттерах тут). И если с голосовой активацией в колонках всё плюс-минус понятно, то перенести её в наушники — это челлендж.
О том, что было сло…
🔥16❤11👍11👏1
11 Jun 2026, 09:33 UTC≈3,040 views25 reactionsread 6 August 2026 Photo
Reward-Driven Interaction: Enhancing Proactive Dialogue Agents through User Satisfaction Prediction
Разбираем статью об улучшении диалоговых агентов с помощью «проактивности». Речь о способности системы в нужный момент задать уточняющий вопрос, если она понимает, что пользователь, скорее всего, останется недоволен ответом.
Применяют обычный для голосового ассистента каскадный пайплайн: отдельный ASR, переформулиров…
❤10👍8🔥7
3 Jun 2026, 09:15 UTC≈1,120 views31 reactionsread 6 August 2026 Photo
Три работы о том, как сделать речь полноценной модальностью для LLM
В сегодняшней подборке — три любопытные идеи: от генерации голосового ответа с ризонингом без лишней задержки до более компактных речевых представлений и подготовки аудиоданных для мультимодального претрейна.
STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
Статья Microsoft о том, как добавить ризонинг в …
❤13🔥11👍7
Showing the 12 most recent of 13 posts we hold for @speechinfo. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.