27 Dec 2025, 11:48 UTC≈1,030 views15 reactionsread 8 August 2026 Photo
Почитала тех репорт 🔗Fun-Audio-Chat — LALM (Large Audio Language Model) от Tongyi Team (Alibaba). Интересно, что теперь большинство конкурентов в сравнительных таблицах это другие китайские модели (Kimi-Audio, GLM4-Voice, …), опенсорс-гонка сместилась, такое время. По бенчмаркам уже становится сложно делать однозначные выводы, результаты смешанные в зависимости от задачи
Тем не менее в статье нашла пару интересных …
❤9👍3✍2🍾1
25 Dec 2025, 13:22 UTC724 views22 reactionsread 8 August 2026 Forwarded from @max_dot_sh
Год подходит к концу, поэтому самое время подводить итоги.
В этом посте разбираю одну из центральных тем блога в этом году: собеседования на ML/Research роли.
⚫️В первой половине года я много собеседовал и понял, что хочется делиться тем, что может помочь соискателям. Так появились эти тексты. Они разные по формату и теме, все субъективные и основаны на личном опыте. А теплые сообщения в личку о пользе текстов толь…
❤11🔥5👍4🍾1🤯1
22 Dec 2025, 14:33 UTC922 views28 reactionsread 8 August 2026 ✨ Meta выпустила 🔗SAM Audio, модель для open-domain audio separation. В отличие от классических сепараторов с фиксированными стемами (vocals/drums/bass/other), здесь можно изолировать произвольный звук
🎧 Архитектура
В основе flow matching модель на базе Diffusion Transformer (DiT). На вход подаем замиксованное аудио и промпты для изоляции. Промпты могут быть трёх типов:
1️⃣ Текстовый: описание звука текстом («dog …
❤13👍8🔥7
16 Dec 2025, 16:07 UTC950 views53 reactionsread 8 August 2026 Давно не было разборов. А все потому, что последние ~1,5 месяца я много собеседовалась.
🐹 В сумме прошла 28 интервью, включая HR-скрининги, технические этапы, два онсайта, один из которых — с исследовательской задачей и презентацией результатов в конце дня. Что из этого вышло и вышло ли расскажу позже, а пока впечатления именно о процессе поиска и подачи. Было стрессово, трудно, местами изнурительно 🌸
Искала ваканс…
❤28🔥11👏6🍾4👍2💔1🥱1
7 Nov 2025, 09:44 UTC≈1,180 views21 reactionsread 8 August 2026 Генерация речи с LLM задача нетривиальная, мы тренируем модель воспроизводить наиболее вероятную последовательность аудио / речевых токенов; но это усреднение часто ведет к плоским ненатуральным интонациям, эмоциям и паузам, множеству артефактов. 💃 И здесь RL как раз неплохо вписывается, дает возможность вознаграждать разборчивость, и не поощрять непонятную речь
Если вам интересно попробовать RL post-training для TT…
🔥9❤7👍4🍾1
3 Nov 2025, 08:49 UTC≈1,130 views14 reactionsread 8 August 2026 Photo
В далеком 2020 году вывели степенные законы масштабирования для pre-training. Теперь команда Meta (и партнеры из академии) попытались сделать то же самое для RL
🔗«The Art of Scaling RL Compute for LLMs» показывает, что это предсказуемая сигмоида и предлагает ScaleRL рецепт стабильного RL проверенный на 100k GPU‑часов
😑 Почему не power law, а sigmoid?
В отличие от pre-training, где cross-entropy loss следует степен…
❤7👍5🔥2
29 Oct 2025, 12:07 UTC942 views23 reactionsread 8 August 2026 Хороший пост от разработчика PyTorch с обзором внутреннего устройства фреймворка
пост 2019 года, так что некоторые детали уже эволюционировали (слияние Variable/Tensor уже случилось, например), но ментальные модели про тензоры, страйды, автоград и путь вызова — это всё ещё актуально, мне понравилось
🔗 https://blog.ezyang.com/2019/05/pytorch-internals/
❤10🔥7👍6
27 Oct 2025, 08:14 UTC982 views15 reactionsread 8 August 2026 Photo
🐹 ARC-Encoder от Kyutai: plug-and-play компрессия для LLM
На прошлой неделе вышла крутая статья от Kyutai Labs (да, я им симпатизирую): 🔗ARC-Encoder learning compressed text representations for large language models
Почему-то осталась относительно незамеченной, хотя на мой взгляд работа хорошо сделана и достойна deep-dive чтения. Как уже видно из названия, эта статья даже не про TTS & STT, здесь авторы придумали ун…
❤10👍4🔥1
21 Oct 2025, 11:13 UTC≈4,320 views17 reactionsread 8 August 2026 Интерактивный tutorial по аудио кодекам от Kyutai labs 😎
https://kyutai.org/next/codec-explainer
🔥10❤4👍3
21 Oct 2025, 08:01 UTC≈1,110 views18 reactionsread 8 August 2026 Photo
Microsoft предлагает использовать speech-LLM для оценки качества синтетической речи. Идея практичная, стандартные протоколы типа MOS и A/B тестов трудозатратны, а на выходе получаем оценку без качественных инсайтов, что именно пошло не так
🔗SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
🐯 SQ-LLM
Авторы собрали датасет SpeechEval: 32к аудио (реальных и синтетики, включая коммерческ…
❤7👍6✍3🔥2
15 Oct 2025, 11:04 UTC836 views11 reactionsread 8 August 2026 Летом вышла HRM, модель на 27М с «биологически вдохновленной иерархией» и 32% на ARC-AGI. У нас тут был обзор на deep-dive от ARC-AGI, где показали, что эта самая иерархия не так и нужна
В комьюнити HRM уже успели покрутить, и вышел еще разбор, из которого про модель я узнала больше, чем из оригинальной работы. А следом Tiny Recursion Model, в которой отбросили всю сложность HRM
🔗HIERARCHICAL REASONING MODELS: PERS…
👍6❤3🔥2
14 Oct 2025, 07:31 UTC684 views16 reactionsread 8 August 2026 🐈Learning is not supposed to be fun
Карпатый зарелизил новый репозиторий для обучения LLM’ок с нуля — 🔗nanochat
It weighs ~8,000 lines of imo quite clean code to:
- Train the tokenizer using a new Rust implementation
- Pretrain a Transformer LLM on FineWeb, evaluate CORE score across a number of metrics
- Midtrain on user-assistant conversations from SmolTalk, multiple choice questions, tool use.
- SFT, evaluat…
✍8❤4🔥4
Showing the 12 most recent of 13 posts we hold for @applied_scientist_blog. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.