16 Sept 2024, 22:10 UTC178 views5 reactionsread 9 August 2026 Ого уже месяц прошел) Сори, выпал из-за переезда + меня повело в сторону разбора вещей из чемодана ахаха я убью себя
В общем в этот раз будет не продолжение по диффузионкам, а внезапно GAN Face Animation Models. Поразительно, какую живучую архитектуру придумали в MonkeyNet, что она сохранилась до наших дней только с точечными улучшениями прямо как архитектура таунхаусов в Англии
GAN Face Animation Models
MonkeyNet, …
🔥4🤪1
16 Aug 2024, 18:24 UTC206 views1 reactionsread 9 August 2026 Diffusion Models Part 5: Video Diffusion Models
VDM, Gen-1, AnimateDiff, SparseCtrl
https://telegra.ph/Diffusion-Models-Part-5-Video-Generation-08-13
👍1
vlivashkin reads pinned «Привет! Захотелось систематизировать свои знания по диффузионкам, и для этого хочу пописать серию постов. Начну с самой базы, дойду до SOTA, посмотрю как делают прикладные штуки, как дообучают и тд. Если вы не очень погружены, то, надеюсь, вам будет это интересно!…»
12 Aug 2024, 18:51 UTC233 views2 reactionsread 9 August 2026 Diffusion Models Part 4: Finetuning
LoRA, DoRA, DreamBooth, ControlNet, Uni-ControlNet, T2I-Adapter, IP-Adapter
https://telegra.ph/Stable-Diffusion-Part-4-Finetuning-08-11
👍2
11 Aug 2024, 13:07 UTC171 viewsread 9 August 2026 Дописал в этом же посте про Flux ^
9 Aug 2024, 17:51 UTC200 views3 reactionsread 9 August 2026 Diffusion Models Part 3: SD3 + Flux
https://telegra.ph/Diffusion-Models-Part-3-SD3-08-07
👍3
7 Aug 2024, 11:49 UTC176 views1 reactionsread 9 August 2026 Вторая часть! В этот раз рассматриваем SD1-2 и SDXL
Diffusion Models Part 2: Stable Diffusion
https://telegra.ph/Diffusion-Models-Part-2-Stable-Diffusion-08-06
👀1
4 Aug 2024, 16:59 UTC207 views8 reactionsread 9 August 2026 Привет! Захотелось систематизировать свои знания по диффузионкам, и для этого хочу пописать серию постов.
Начну с самой базы, дойду до SOTA, посмотрю как делают прикладные штуки, как дообучают и тд.
Если вы не очень погружены, то, надеюсь, вам будет это интересно! А если вы все знаете лучше меня, то тогда поправьте меня плз, если я где-то ошибся!
Diffusion Models Part 1: Idea and DDPM
https://telegra.ph/Diffusion-M…
👍6🔥2
24 Dec 2022, 17:59 UTC242 viewsread 9 August 2026 Photo
Photo, posted without a caption
24 Dec 2022, 17:57 UTC199 viewsread 9 August 2026 Audio- and Gaze-driven Facial Animation of Codec Avatars
📝 arxiv.org/abs/2008.05023 (WACV 2021)
🌐 research.facebook.com/videos/audio-and-gaze-driven-facial-animation-of-codec-avatars
Вообще стоило бы начать разбор с Expressive Telepresence via Modular Codec Avatars (ECCV 2020), но там про рендеринг, основанный на съемке на headset, а у админа ща арка про победу над липсинком. Так что читаем сразу липсинковую статью.…
24 Dec 2022, 16:29 UTC124 viewsread 9 August 2026 Video
В ише выше пишут, что
> ICP between the surface of your mesh and the vertices of the provided mesh should give you a good enough alignment.
ICP – это iterative closest point. Эта штука подбирает 4x4 трансформационную матрицу одного меша к другому, и после такого преобразования можно сделать маппинг из одной топологии к другой (просто смаппить ближайшие точки из двух мешей)
Полезно, но для такого по-хорошему нужно и…
24 Dec 2022, 16:14 UTC110 viewsread 9 August 2026 MeshTalk: 3D Face Animation from Speech using Cross-Modality Disentanglement
📝 arxiv.org/abs/2104.08223 (ICCV 2021)
🌐 github.com/facebookresearch/meshtalk
Ребята придумали cross-modal loss, который позволяет разделять audio-correlated и audio-uncorrelated информацию. И победили VOCA in over 75% of cases по юзерстади.
Итак, в чем была проблема. VOCA предсказывал дельты ко всем вершинам, включая глаза. Моргания глаз …
Showing the 12 most recent of 15 posts we hold for @vlivashkin_reads. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.