20 Apr 2026, 07:02 UTC540 views11 reactionsread 8 August 2026 Всем привет 👋
У меня появилась возможность взять ребят к себе в команду, заниматься rnd и рисерчем по темам Efficient DL и различным проектам по работе с LLM
Прямо сейчас на горизонте такие проекты:
1. Обучение маленькой модели под работу с тулколингом (как сильно можно бустануть малую модель на тулколинге?). Уже анонсили, я там чуть участвую
2. Оптимизация фреймворков инференса (sglang) под разные специфичные нагру…
🔥6❤3🥰2
5 Mar 2026, 16:30 UTC726 views21 reactionsread 8 August 2026 Photo
KernelEvo - эволюционный генератор Triton/inline CUDA ядер
Сегодня зарелизили штуку, которую пилил с начала года: кидаешь pytorch операцию, получаешь оптимизированное GPU ядро (Triton или inline CUDA) в одном файле с тем же pytorch интерфейсом.
Работает через цикл
generate new ideas → generate code → repair → eval → repeat
Так что за вас дожимает код до корректного и эффективного решения.
Кому зайдёт:
1. Умеешь пи…
🔥19❤2
31 Dec 2025, 13:59 UTC835 views23 reactionsread 8 August 2026 С наступающим Новым годом! 🎄✨
2025 выдался насыщенным, вот что запомнилось:
Из житейского:
1. LLM стали альтернативой поиску. RAG все чаще дает ответ сразу, а не списком сайтов, которые нужно переварить (галлюцинации, конечно, не нужно забывать).
2. Генеративный контент стал почти неотличим от реального. По ощущениям, каждый третий шортс - из нейросетки. А уж что там в рекламных материалах - баннера, заголовки, опи…
🍾15❤7🔥1
21 Dec 2025, 12:48 UTC713 views6 reactionsread 8 August 2026 В чем устройство LakeHouse и отличие от баз данных?
В этом году чаще слышу о LakeHouse и мыслях его внедрить.
В чем основная суть:
1. Слой хранения выносим отдельно от слоя вычисления -> в s3
2. Формат хранения - универсальный (parquet например)
3. Поверх одного хранилища запускаем разные табличные движки
Похожее произошло с вычислениями пару лет назад с приходом связки kubernetes/s3. Компании смогли динамически ал…
🔥5❤1
23 Oct 2025, 13:35 UTC≈1,060 views15 reactionsread 8 August 2026 Photo
Как именно Alibaba ускорили на 84% мультимодельный инференс?
TLDR: Alibaba Cloud представила Aegaeon (без кода 🙃) [paper] — по-токенный авто-скейлер для мультимодельного инференса.
В проде (Alibaba Model Studio, >3 месяцев) он позволил снизить потребление GPU на 82%: с 1 192 до 213 H200,
а «goodput» (RPS в рамках SLO) вырос в 1.5-9х.
Продовый кластер состоит из 28 моделей размера 1.8–7B models (TP=1) и 19 моделей ра…
🔥15
15 Oct 2025, 09:13 UTC766 views4 reactionsread 8 August 2026 Photo
Как LLM становятся «самостоятельными исследователями»
Наткнулся на статью Barbarians at the Gate: How AI is Upending Systems Research [link] из UC Berkeley.
Тема на слуху, если не в курсе - рекомендую изучить,
чтобы понимать применимость в ваших задачах.
AI-Driven Research for Systems (ADRS):
Многократный generate → verify → select → mutate → repeat.
По сути то же самое, что делает человек при создании решения. Тол…
🔥3❤1
28 Sept 2025, 07:34 UTC804 views13 reactionsread 8 August 2026 Photo
Ещё немного о линейных трансформерах
На прошлой неделе участвовал в воркшопе китайских коллег и выступал на тему edge-cloud collaboration. Рассказывал, как мы ускоряли ARMT.
Проблема edge-cloud:
Смартфон есть почти у каждого, и их вычислительная мощность растёт. Сервер же один — и дорогой. Часто это приводит к подписке $10+ на любого LLM-ассистента.
Цель — максимально задействовать сам телефон (хотя бы для спекулят…
🔥11❤1❤🔥1
6 Sept 2025, 17:23 UTC≈1,090 views9 reactionsread 8 August 2026 Photo
Стоимость инференса LLM снижается до 10x каждый год
Cравниваются модели с похожим качеством на бенчмарках
Год назад была статья от a16z.
В этом году тренд продолжается.
Почему стоимость инференса падает?
1. Не столько инференс дешевеет, сколько модели становятся мощнее и quality-per-parameter растет.
2. Квантизации становятся продвинутее.
3. MoE/Model Router позволяют получать модели с производительностью огромных,…
🔥8⚡1
17 Aug 2025, 17:34 UTC749 views18 reactionsread 8 August 2026 Photo
У меня в последнее время подгорает на cursor, потому что
1. На запрос генерируется несколько файлов (код, тесты, readme, скрипты запуска).
2. Проект превращается в свалку файлов от разных запросов.
3. Лимиты на cursor улетают очень быстро. А ведь они недавно еще их и порезали.
Проблема в том, что в одном продукте смешан функционал для разных целевых аудиторий:
1. Вайбкодеры
Надо быстро и под ключ. Чтобы сразу весь …
😁9💯5🔥4
3 Aug 2025, 10:45 UTC752 views8 reactionsread 8 August 2026 Photo
Как понять, что «тормозит» DataLoader?
Недавно был задан классный вопрос:
"Может ли малая утилизация CPU означать проблемы с DataLoader?"
Утверждать нельзя, потому что в DataLoader:
1. Утилизируют CPU только аугментации и декодинг файла.
Это, пожалуй, единственная вычислительная нагрузка в нем, и ее может не хватать для создания существенной утилизации.
Декодинг файла - актуально для медиа-данных, хранящихся в сжат…
🔥7❤🔥1
8 Jul 2025, 05:20 UTC801 views12 reactionsread 8 August 2026 А вот и слайды.
Небольшой обзор по эффективному обучению и релевантным тематикам для студентов с летней школы.
В начале прикладные материалы + материалы для начинающих.
Для тех кто много знает - в конце начинается более инфровая часть и технические репорты.
На многих слайдах внизу есть ссылки на статьи/технические блоги.
🔥11🦄1
1 Jul 2025, 07:57 UTC799 views13 reactionsread 8 August 2026 Photo
Летняя школа AIRI
Приехал в Томск чтобы провести пару лекций на летней школе по ИИ от AIRI и заменторить проекты.
Ну и поесть окрошку и варенье из шишек.
4 июля буду читать о практичных инженерных штуках в обучении моделей.
Слайдами тут обязательно поделюсь)
🔥10⚡2❤1
Showing the 12 most recent of 14 posts we hold for @deploy_ml. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.