4 Aug 2026, 13:44 UTC≈298 views5 reactionsread 6 August 2026 Photo
Наука или инженерия
Мысли после ICML'26 [2/2]
В первой части обсуждали критерии научности и 10% работ, которые им соответствуют. Теперь про остальные 90%. Чему они соответствуют?
Roberto Pieraccini называет такие работы translational имея ввиду “перевод” общих методов в плоскость прикладных задач. По смыслу это ближе всего к тому что ML сообществе называют RnD:
• Составление бенчмарков
• Добавление к общему методу …
Signed Sergey Kastryulin
3 Aug 2026, 11:49 UTC≈313 views22 reactionsread 6 August 2026 Photo
Наука или инженерия
Мысли после ICML'26 [1/2]
Не важно ходишь ли по постерам в Сеуле или пытаешься читать по заверениям дедов фид arxiv cs.ai 👴: твой контекст не бесконечен и не очевидно на что его тратить.
Есть такой Roberto Pieraccini, я бы его описал как Шмитхубера здорового человека: много чего сделал и понял, но не пытается причислить себе все ключевые находки в ML. У него есть блог The voice in the machine, в…
Signed Sergey Kastryulin
14 Jul 2026, 10:27 UTC≈529 views15 reactionsread 6 August 2026 Forwarded from @MLunderhoodPhoto
Рассказываем о новой unified-модели в Alice AI
С недавних пор в Алисе AI и Шедевруме появилась обновлённая модель — Alice AI ART 2.0. Пользователи уже сейчас могут протестировать два базовых сценария её работы: Text-to-Image и Image-to-Image.
Для Яндекса этот релиз — первый шаг к тому, чтобы получить unified-модель с едиными метриками и стеком, которая одинаково хорошо умеет и в T2I, и в I2I. Команда генеративных м…
Signed Sergey Kastryulin
7 Jul 2026, 14:39 UTC≈727 views25 reactionsread 6 August 2026 Photo
ICML’26
Зачем ездить на конференции?
Конечно, чтобы презентовать свои статьи и читать чужие. Чтобы спорить у постеров, слушать доклады, искать неожиданные идеи и пытаться понять, куда сейчас движется область
Но не только
Ещё — чтобы увидеться с командой не через календарь и созвоны. Поговорить с исследователями и инженерами за пределами своего ежедневного круга. Потолкаться на экспо и в секции постеров про RL, сл…
Signed Sergey Kastryulin
3 Jul 2026, 12:38 UTC≈796 views1 reactionsread 6 August 2026 Photo
Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла унификация?
В прошлом посте закончили на том, что агент-оркестратор с двумя специализированными моделями решает те же задачи, что и BAGEL-стайл унификация. За те же 14 месяцев это направление тоже не стояло на месте. Разберём, где мультимодальность нужна по существу задачи, где агенты её вытягивают.
Где мультимодальность реально …
Signed Sergey Kastryulin
2 Jul 2026, 13:07 UTC≈543 views8 reactionsread 6 August 2026 Photo
Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия?
В мае 2025 BAGEL и близкие по времени работы продавали унифицированные модели с одним набором весов на понимание и генерацию картинок. Мотивационный тезис — модальности взаимно усиливают друг друга. Экспериментальных подтверждений тогда было немного, но авторы смотрели в светлое будущее. Прошло 14 месяцев. Посмотрим, что реально измерили за это…
Signed Sergey Kastryulin
29 Jun 2026, 09:32 UTC≈528 views4 reactionsread 6 August 2026 Photo
Тексты для T2I, второй акт: переписывание промтов, агенты и Context Gap
[кода нет, новый бенч]
Ранее в Тексты для T2I претрена разбирали две работы про тренировочные кепшены — Structured Captions и Design Choices for Synthetic Captions. Если коротко, обе пришли к выводу, что для T2I-претрена выгодно использовать структурированные кепшены: длинные , с заданным порядком пунктов и единым форматом. Чем плотнее и регуляр…
Signed Sergey Kastryulin
29 Jun 2026, 09:32 UTC≈521 views1 reactionsread 6 August 2026 Результаты
На IA-Bench Qwen-Image-Agent даёт IA-score 45.4.
Для контекста:
• Nano Banana Pro — 42.6
• GPT-Image-1.5 — 35.7
• Чистый Qwen-Image-2.0 без агента — 17.4
То есть агентский обвес поверх собственной модели даёт ~+28 пунктов и выводит её выше топовых закрытых рендереров на этом бенче.
На WISE-Verified, более старом бенче на world knowledge ситуация аналогичная.
В работе аблейтят влияние поиска (IA-scor…
Signed Sergey Kastryulin
18 Jun 2026, 09:19 UTC≈633 views4 reactionsread 6 August 2026 Qwen-Image-2.0 Technical Report
Вышел-таки, красивое. Модельку так и не выложили, не красивое.
Понравилось, что число авторов не исчисляется сотнями. Не понравилось, что страниц всего 30 и то половина картинки. Оч не подробно для команды Qwen.
Signed Sergey Kastryulin
17 Jun 2026, 10:34 UTC≈683 views9 reactionsread 6 August 2026 Photo
UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer
[ссылка на код, а кода нет ☔️]
Очередная unified MM-модель от Nanjing + ByteDance Seed с декаплингом диффузионного декодера от LLM-бэкбона в духе DDT/RAE/PixNerd. Авторы атакуют две знакомые проблемы UMM: конфликт understanding и generation лоссов и фрагментированное виз пространство.
Архитектура
Noisy ViT → LLM-бэкбон (Q…
Signed Sergey Kastryulin
9 Jun 2026, 10:40 UTC≈677 views7 reactionsread 6 August 2026 Photo
SpecEdit: Training-Free Acceleration for Diffusion based Image Editing via Semantic Locking
[код пока нет, обещают]
Работа про ускорение диффузионного редактирования изображений без дообучения. Не новая модель, а надстройка над уже существующими редакторами вроде Qwen-Image-Edit и FLUX.1-Kontext.
Проблема
При редактировании не все области картинки одинакого важны. Не важные регионы можно сначала редактированть в н…
Signed Sergey Kastryulin
3 Jun 2026, 07:44 UTC≈644 views5 reactionsread 6 August 2026 Photo
За последнюю неделю вышли две довольно любопытные работы по мультимодальной генерации. Первая рассматривает UMM в контексте нынче модных pixel-space картиночных диффузионок. Вторая — тех репорт про то как запихнуть аж 7 разных модальностей в одну модель.
Representation Forcing for Bottleneck-Free Unified Multimodal Models
Новелти работы в том что делают мультимодалку с генерацией картинок без использования VAE.
Дл…
Signed Sergey Kastryulin
Showing the 12 most recent of 13 posts we hold for @c_research. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.