4 Aug 2026, 09:01 UTC≈12,300 views73 reactionsread 7 August 2026 Photo
Курс по Visual GenAI от Yandex Research и ШАД
Авторы CV Time не только пишут обзоры статей о компьютерном зрении, но и создают обучающие курсы.
Сегодня делимся курсом ШАДа «Генеративные модели в компьютерном зрении», который ведёт Дмитрий Баранчук, руководитель группы GenAI в Yandex Research, вместе с праймовой командой исследователей в этой области.
Будет полезно тем, у кого есть базовые знания по генеративкам и …
❤40❤🔥15👍8🔥7🤝2🙏1
30 Jul 2026, 08:33 UTC≈1,780 views29 reactionsread 7 August 2026 Photo
Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation
Сегодня разбираем статью о Qwen-Image-Agent — не столько техническую, сколько идеологическую. Авторы предлагают добавить перед генеративной моделью агентский пайплайн, который собирает недостающий контекст.
Главной проблемой называют Context Gap — разрыв между тем, что пользователь написал, и тем, что модели нужно для качественной генерации. …
❤14🔥8👌4✍2🤝1
21 Jul 2026, 10:40 UTC≈1,880 views22 reactionsread 7 August 2026 Photo
High-Fidelity Two-Step Image Generation via Teacher-Aligned End-to-End Distillation
Сегодня разбираем статью о Z-Image Turbo++. Основная идея — повторное применение DMD к уже задистилелной модели. Так авторы дистиллируют 8-шаговый Z-Image Turbo в 2-шаговый генератор. Достигается это с помощью трёх приёмов:
1) Distribution-aligned adversarial training. В качестве «настоящих» семплов для дискриминатора GAN используют…
❤8👍7💯5🔥1🤝1
14 Jul 2026, 10:23 UTC≈1,620 views32 reactionsread 7 August 2026 Photo
Что нового в архитектуре Alice AI ART 2.0
В Алисе AI и Шедевруме теперь работает Alice AI ART 2.0 — это большой шаг к созданию unified-модели, которая одинаково хорошо умеет генерировать и редактировать картинки. Команда генеративных моделей в компьютерном зрении рассказала на Хабре об экспериментах на пути к решению — удачных и не очень. В этом разборе сосредоточимся на архитектурной части.
Несколько вводных
В му…
🔥15👍8❤6😐2🤝1
9 Jul 2026, 07:58 UTC≈1,700 views24 reactionsread 7 August 2026 Photo
Три идеи для обучения text-to-image с ICML 2026
В Сеуле идёт ICML 2026, а мы продолжаем делиться работами на тему компьютерного зрения. Кстати, доля работ из области computer vision в этом году — почти 8%. Вторая по популярности тематика после LLM.
Ambient Dataloops: Generative Models for Dataset Refinement
Авторы рассматривают специфическую для text-to-image-моделей проблему, когда данных для конкретного домена н…
❤8👍8🔥7🥰1
7 Jul 2026, 14:32 UTC≈1,230 views23 reactionsread 7 August 2026 Photo
Concept Removal for Frontier Image Generative Models
Есть такая задача — разучивать модель генерировать нежелательные концепты: объекты и отношения между ними, стили и прочее. Нужно это для white-box-сетапов — случаев, когда модель необходимо дать пользователю не через API, а как набор весов.
Авторы статьи предлагают использовать transcoder-блок, который конвертирует латент нежелательного концепта в null и дальше п…
❤9❤🔥7👍6🔥1
3 Jul 2026, 10:03 UTC≈1,490 views26 reactionsread 7 August 2026 Photo
GLM-Image: Auto-regressive for Dense-knowledge and High-fidelity Image Generation
Продолжаем разбирать интересные авторегрессионные модели text-to-image. Недавно рассказывали о BitDance, а сегодня на очереди GLM-Image. В блогпосте технических деталей почти нет, зато есть код в Diffusers, так что архитектуру можно восстановить довольно подробно.
Идея в следующем. Большая LLM каузально генерирует последовательность с…
🔥14❤5👍5🥰2
24 Jun 2026, 08:10 UTC≈2,170 views31 reactionsread 7 August 2026 Photo
DeepEyesV2: Toward Agentic Multimodal Model
В последний год в статьях всё чаще затрагивают идею агентного зрения, где VLM используют в решении задач не только язык, но и создают новые изображения с помощью внешних инструментов.
Сегодня разбираем DeepEyesV2 — открытый бейзлайн мультимодального агентного ризонера. Авторы собирают его на основе опенсорсных данных в стадиях ColdStart и RL, и показывают рост по многим б…
❤12👍8🔥6❤🔥2🤔2🤩1
17 Jun 2026, 09:55 UTC≈1,880 views57 reactionsread 7 August 2026 Несколько идей о perception и reasoning в VLM
Глобально качество любой мультимодальной модели строится на трёх вещах: knowledge — визуальных и текстовых знаниях, заложенных в модель; perception — умении хорошо понимать изображение; и reasoning — её способности учитывать эти два пункта и делать по ним выводы. Сегодня делимся подборкой на эту тему от руководителя команды претрейна VLM Данила Кашина.
VLM Perception
D…
🔥29❤17👍10❤🔥1
9 Jun 2026, 09:27 UTC≈1,810 views22 reactionsread 7 August 2026 Photo
Thinking with Visual Primitives
Сегодня в области мультимодальных моделей основной упор делают на языковой ризонинг. А для VLM интересно было бы перенести его в визуальное пространство. В своей статье авторы из DeepSeek предлагают делать это с помощью визуальных примитивов: точек и bounding-боксов.
Архитектура решения довольно стандартная. Берут DeepSeek-V4 (LLaVA) на 284 млрд параметров (13 млрд — активных) и прик…
❤9👍8🔥4👌1
5 Jun 2026, 09:16 UTC≈1,340 views15 reactionsread 7 August 2026 В эти дни в Вене проходит международная конференция по робототехнике ICRA 2026. Среди докладов — много работ на стыке робототехники и компьютерного зрения, как, например, в этом посте. Ещё больше разборов читайте в канале @DriverNotFound ⬇️
🔥7❤4👍4
5 Jun 2026, 09:16 UTC≈1,770 views23 reactionsread 7 August 2026 Forwarded from @DriverNotFoundPhoto
Земной автомобиль, луноход или марсианский ровер — на ICRA 2026 припаркуются все
Позади второй день конференции — продолжаем делиться самым интересным об автономном вождении. Слово Максиму Спорышеву:
Среди докладчиков были те, кто буквально делает космолёты. Они рассказали о локализации для lunar landing, навигации на Марсе и детекции аномалий в космосе — только представьте, какие у них байки про продакшн.
Понрави…
❤10🔥8👍5
Showing the 12 most recent of 13 posts we hold for @timeforcv. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.