19 May 2026, 14:23 UTC≈1,060 views12 reactionsread 6 August 2026 Forwarded from @vf_scienceFile
👀 Audio Generation 2024-2026
Недавно собрался силами провести семинар в МИСиС от AIKC. Рассказал как сейчас делают генерацию музыки и речи. От подготовки данных из большых сырых корпусов, до применения RL. Поделился своими инсайдами и направлениями ресерча. Презу приложил к посту. Запись выложат на Stepic. Тут поделюсь сухой выжимкой без моих размышлений и комментариев)
Структура семинара поделилась на общие патте…
🔥12
31 Dec 2025, 19:35 UTC≈1,720 views53 reactionsread 6 August 2026 Небольшой офтоп про канал и прошедший год.
В этом году я перестал активно вести канал, и связано это во многом с тем, что рассказывать мне стало вам особо нечего.
Звучит это конечно противоречиво, так как контента, статей, релизов и разных инфоповодов за этот год стало только больше, чем было. За 2025тый год, мне кажется, у многих сформировалось понимание об AI, что нужно, а что нет, использование AI стало принимат…
👍42⚡4🙏4🫡2👎1
26 Aug 2025, 14:23 UTC≈1,940 views17 reactionsread 6 August 2026 Forwarded from @den4ikresearchVideo
Наш русскоязычный датасет для TTS опубликован!
Сегодня выкладываем открытые корпуса на 4000+ часов речи, а еще синтезатор речи ESpeech-TTS-1
Наш датасет содержит больше 4000 часов русской речи. Статистика по корпусам:
Многоголосые:
ESpeech-podcasts - 3200 часов
ESpeech-webinars - 850 часов
Одноголосые:
ESpeech-igm - 220 часов
ESpeech-buldjat - 54 часа
ESpeech-upvote - 296 часов
ESpeech-tuchniyzhab - 306 часов
Да…
🔥16👍1
6 Jun 2025, 17:51 UTC≈2,430 views11 reactionsread 6 August 2026 Forwarded from @mltochka
Многие компании сёрвят LLM
Кто-то использует готовые инструменты, которые предоставляют OpenAI-compatible эндпоинты: например, DeepSeek, развёрнутый через vllm serve. Кому-то не хватает OpenAI-compatible протокола. А кому-то хочется и того, и другого — например, нам в Точке.
С одной стороны, мы хотим уметь ходить в LLM-провайдеры, которые поддерживают общепринятый формат. А с другой стороны у нас есть внутренняя LL…
🔥10👍1
30 May 2025, 18:59 UTC≈1,650 viewsread 6 August 2026 Forwarded from @AIexTimePhoto
Photo, posted without a caption
30 May 2025, 18:59 UTC≈2,320 views13 reactionsread 6 August 2026 Forwarded from @AIexTime
Объемный и очень интересный тех репорт про модель под названием Skywork Open Reasoner 1. Может показаться, что это очередной RL тюн на математические задачи, который обгоняет модели по типу R1-distil, но на самом деле это первый (по крайней мере я не встречал раньше подобных работ) ablation на огромное число факторов, влияющих на процесс обучения с GRPO-like методами. Фильтрация данных, on/off policy trade off, темпе…
👍11👎1🔥1
19 May 2025, 11:22 UTC≈1,010 views4 reactionsread 6 August 2026 Forwarded from @ai_arseny_ivanovFile
⬆️ Провел небольшую лекцию о мультимодальных языковых моделях
С ребятами в AI Knowledge Club сейчас проводим курс, где я выступил с лекцией о развитии мультимодальных моделей, задачах и бенчмарках. Попробую рассказать и вам =)
❓ Когда мы подаем в языковую модель большие объёмы текста, она не просто запоминает слова, но и учится извлекать из них смысл, комбинировать разрозненные фрагменты и решать разнообразные NLP-…
👍4
19 May 2025, 11:22 UTC≈1,370 views4 reactionsread 6 August 2026 Forwarded from @ai_arseny_ivanov
2) Perceiver IO (Google DeepMind, 2021) - у персивера есть проблема, хоть он и скейлится на разные входы, его выходы являются простыми — годится для классификации по заданному числу классов, но не подходит для генерации сложных выходов произвольного размера. Основное улучшение сделано в процедуре декодирования, через специально задизайненные query к латентным переменным можно получить выходы нужной структуры (заданно…
🔥4
19 May 2025, 11:22 UTC≈1,930 views16 reactionsread 6 August 2026 Forwarded from @ai_arseny_ivanov
По большей части работы, что я описал, являются фундаментальными и что-то вроде базовыми. Для большего понимания я рекомендую почитать недавно вышедшую статью на HuggingFace блоге о последних трендах в VLM: про reasoning в VLM, MoE-декодеры для VLM, исследование Vision Language Action моделей для робототехники, мультимодал раги, video-understending в VLM.
🐧 В целом я хотел кратко описать то, что я рассказал на высту…
👍16
3 May 2025, 06:10 UTC≈1,590 views21 reactionsread 6 August 2026 Photo
Бывает делаешь датасет без статьи и блога, никому о нем не рассказываешь, выкладываешь тихонечко в опенсорс - а потом тебя неожиданно цитируют китайцы в работе про ризонинг через почти полтора года.
В недавней работе (24тое апреля) "DeepDistill: Enhancing LLM Reasoning Capabilities via Large-Scale Difficulty-Graded Data Training" от команды a-m-team, где авторы решили отобрать самые лучшие данные для трейна ризонинг…
🔥19👍2
2 May 2025, 05:34 UTC≈1,710 views12 reactions51 Starsread 6 August 2026 Хороший обзор от Романа Куцева про основные виды агентов для прода и как их работу можно более менее адекватно оценивать (спойлер: используя набирающий популярность фреймворк deepeval)
https://habr.com/ru/articles/904880/
🔥12
8 Apr 2025, 04:29 UTC≈1,720 views18 reactionsread 6 August 2026 Forwarded from @quant_prune_distillFile
Презентация с моей сегодняшней лекции про методы сжатия БЯМ на курсе Школы Анализа Данных Яндекса "Эффективные Модели".
В ней даю краткий обзор по существующим подходам, актуальным работам в области и некоторые общие рекомендации.
🔥18
Showing the 12 most recent of 16 posts we hold for @nlpwanderer. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.