22 Jul 2026, 09:21 UTC81 views6 reactionsread 9 August 2026 Forwarded from @saturov_stroit_komanduPhoto
⚡️ 10 августа проводим в Москве первый Voice AI Dev Meetup.
Мы в Bitmanager.ai строим платформу для голосовых AI-агентов, поэтому много запариваемся над UX речевых интерфейсов. Тема бездонная, много сложной теории, которая конвертируется в практику через тернистый путь проб и ошибок. Об этом и поговорим.
Программу собирали с любовью. Выступают наши voice-инженеры, специалисты из VK и MWS, ресерчеры из lab260. Особе…
❤4🔥2
4 Jun 2026, 13:46 UTC249 views17 reactionsread 9 August 2026 Photo
🚀Наша работа на CVPR воркшопе (FGVC)
ℹ️В работе мы исследуем мультимодальную идентификацию животных по изображениям и текстовым описаниям.
➡️CVPR — одна из главных мировых площадок по компьютерному зрению и искусственному интеллекту, поэтому для нас это сильный международный результат.
🔗Ссылка на работу
🔥11⚡3👏3
30 May 2026, 18:53 UTC262 views11 reactions1 Starread 9 August 2026 Video
Давайте разберёмся: можно ли сломать alignment?
➡️Обычно безопасность больших языковых моделей выглядит для пользователя очень просто: задаёшь рискованный вопрос, модель оценивает контекст и останавливает ответ.
Но в open-weight моделях всё становится интереснее.
ℹ️Исследования показывают, что у ряда чат-моделей защитное поведение можно связать с внутренним направлением отказа, или refusal direction. Если говорить…
🔥8👍3
23 May 2026, 14:35 UTC221 views17 reactionsread 9 August 2026 Forwarded from @korallll_aiPhoto
Работа по биометрии домашних животных на воркшопе CVPR
Раньше мы уже занимались человеческой биометрией: речевой и лицевой. В этой работе решили посмотреть на биометрию с другой стороны: не людей, а домашних животных.
Мы исследовали совместно с AvitoTech AI Lab задачу pet identification - поиск одного и того же питомца по разным данным. Важная особенность работы в том, что подход мультимодальный: мы используем не т…
👍7⚡6🔥4
16 May 2026, 10:05 UTC574 views13 reactionsread 9 August 2026 Photo
Temporal Audio Narratives: Event Reasoning through Large Language Models — вышла наша работа про то, как научить модель понимать аудиосцену через цепочку событий.
Идея простая: сначала находим, какие звуки произошли и когда, а потом компактная LLM собирает из этого понятное описание происходящего.
После адаптации наш пайплайн обходит более крупные foundation-модели и при этом лучше подходит для embedded-сценариев, …
❤8🔥4👍1
12 Mar 2026, 17:05 UTC426 views14 reactionsread 9 August 2026 Photo
Не только камеры: как звук помогает понимать городскую среду
Сегодня на открытом семинаре «Проблемы внедрения прикладного искусственного интеллекта», который прошёл в МТУСИ, я рассказывал о задаче анализа городской акустической среды и о том, почему для интеллектуальных систем мониторинга городской среды одного только видео уже недостаточно.
Если камера в первую очередь показывает, что находится в кадре, то аудио д…
🔥8❤3🤝3
7 Mar 2026, 14:22 UTC571 views8 reactions10 Starsread 9 August 2026 Photo
Языковая проблема антиспуфинга
В задачах speech anti-spoofing модели обычно обучают на нескольких крупных языках, а затем применяют и к другим. На практике это работает не всегда хорошо: одна и та же модель может показывать отличные результаты на одном языке и сильно проседать на другом, даже если синтетическая речь создана тем же самым TTS-синтезатором. Это показывает, что устойчивость антиспуфинг-моделей к языково…
👍5❤2🔥1
20 Feb 2026, 19:02 UTC380 views12 reactionsread 9 August 2026 Spectra-0 — наша новая модель для детекции речевых дипфейков.
Решает задачу speech anti-spoofing: по аудио определяет, реальная ли это речь или синтез/подмена.
Архитектурно это SSL-энкодер Wav2Vec2 + MLP-проекция + классификатор ECAPA-TDNN.
Результаты (EER):
In-the-Wild — 1.026
ASVspoof19 LA — 0.181
ASVspoof21 LA — 6.475
🤗 Hugging Face
🔥4❤3⚡2👏2💯1
29 Jan 2026, 16:32 UTC385 views4 reactionsread 9 August 2026 Forwarded from @korallll_aiPhoto
Balalaika: второе дыхание для RU speech-данных
Релизим сразу 3 датасета, профильтрованных и размеченных Balalaika.
Что получилось по объёму после фильтрации:
- Biggest RU Books: было ~1000 часов → осталось 528 часов.
- Golos: было ~1300 часов → осталось 49 часов.
- DeepSpeech: было ~6000 часов → осталось 278 часов.
Если сложить с ранее выложенным датасетом с аудио, суммарно сейчас опубликовано 1286 часов высококаче…
👍2💯1🔥1
23 Jan 2026, 14:53 UTC339 views12 reactionsread 9 August 2026 Photo
Давненько ничего не постил и тут сразу с интересной новостью. У нас вышла статья по интерпретируемости AASIST3, которую мы с коллегами представили пару лет назад на ASVspoof5.
Вот ссылка на саму статью MDPI Mathematics
А подробнее про детали читайте у Кирилла
P.S. По ASV модели есть очень большие проблемы и в течение этого года мы планируем все их осветить и предложить решения.
Make SOTA great again 😁
🔥5🤝4❤🔥3
28 Nov 2025, 17:31 UTC500 views9 reactionsread 9 August 2026 На днях с коллегами обсуждали ML-фреймворки и их использование в РФ . Итогом получилась показательная картина, где инфраструктурные ограничения сильно сместили баланс в пользу инструментов, которые дают минимум рисков и быстрый цикл итераций.
PyTorch стал базовым стандартом. Благодаря подходу заложенному в PyTorch, прототипы поднимаются быстро, а эксперименты масштабируются без ощущения, что вокруг нужно строить …
🔥6❤3
25 Nov 2025, 10:58 UTC511 views18 reactions1 Starread 9 August 2026 Photo
На этих выходных с коллегами были в командировке в Шанхае:
представили результаты наших исследований в области ИИ на 2025 International Cooperation Forum for Universities of Applied Sciences, проходившем в SDJU.
С коллегами из разных университетов со всего мира обсудили практики внедрения прикладных ИИ-решений, обменялись опытом и договорились о дальнейшем совместном R&D.
В Шанхае отлично выстроенная инфраструктура,…
🔥18
Showing the 12 most recent of 15 posts we hold for @polestvr_me. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.