4 Jul 2025, 10:56 UTC≈7,460 views114 reactions2 Starsread 12 August 2026 Video
🧬 Эволюционные алгоритмы
Полтора месяца назад DeepMind выкатил AlphaEvolve, где LLM-агент генерирует, скрещивает и отбирает фрагменты кода на основе эволюционного подхода. Так появляются новые алгоритмы — от рекордов в матричном умножении до оптимальных расписаний вычислений и топологий печатных плат для TPU. Сообщество уже откликнулось опен-сорсным OpenEvolve — можно запустить тот же процесс самому и выращивать сво…
🔥78custom 624424133432076289212👍9custom 52962526051046644667🥰5🤝2🦄1
Signed Даня Меркулов
28 Feb 2025, 13:57 UTC≈16,400 views134 reactions4 Starsread 12 August 2026 Video
QR алгоритм
🥸 Одна из жемчужин численных методов. Он используется для поиска собственных чисел матрицы.
🥰 Простой и стабильный, а при небольших модификациях ещё и быстрый.
Qₖ, Rₖ = qr(Aₖ) - Вычисляем QR-разложение матрицы
Aₖ₊₁ = RₖQₖ - Умножаем факторы в обратном порядке
😑 Для произвольной квадратной матрицы он сходится к верхнетреугольной матрице, на диагонали которой стоят её собственные числа (картинка…
🔥72custom 529625260510466446641👍7custom 62442413343207628927🦄5😁2
Signed Даня Меркулов
12 Feb 2025, 11:38 UTC≈8,530 views90 reactions5 Starsread 12 August 2026 Video
Наглядно о том, зачем нужна нормализация признаков
Простая анимация, которая показывает фиксированное число итераций градиентного спуска, стартующего из одной и той же точки для хороших и плохих задач.
В хороших задачах направления примерно одинаковы с точки зрения значений минимизируемой функции. Для квадратичной функции (aka линейная регрессия) это измеряется числом обусловленности гессиана.
Явление характерно н…
custom 529625260510466446657custom 547195298697026716319🔥11👍2🦄1
Signed Даня Меркулов
31 Jan 2025, 14:59 UTC≈7,080 views71 reactions4 Starsread 12 August 2026 Video
Подбор шага с помощью линейного поиска в градиентном спуске
Если нам известны характеристики сильно выпуклой функции, то мы можем выбрать оптимальный постоянный шаг 2/(μ + L),
где μ и L – наименьшее и наибольшее собственные значения гессиана функции.
Однако на практике эти параметры почти никогда не известны. Да и функции бывают невыпуклые. Приходится подбирать learning rate вручную (перебор), линейным поиком или и…
custom 529625260510466446645custom 547195298697026716316🥰5👍2🤬2🔥1
Signed Даня Меркулов
5 Dec 2024, 14:02 UTC≈6,440 views79 reactions7 Starsread 12 August 2026 Photo
О чем пишут на ICLR 2025
Пока все ждут результаты ревью одной из самых главных конференций по AI, вот анализ ключевых слов работ, поданных на неё.
Всего в датасете около 9600 работ (подано вроде чуть больше), а самые популярные категории (фул картинки и полный датасет в комментариях):
1797: large language models
592: diffusion models
458: reinforcement learning
291: transformers
280: graph neural networks
247: gen…
custom 529625260510466446631✍24custom 54719529869702671639🔥8🤔3👍2🤬2
Signed Даня Меркулов
30 Nov 2024, 17:59 UTC≈6,430 views65 reactions12 Starsread 12 August 2026 Photo
Как ускоряли обучение GPT-2 S в 10 раз
🤩Очень интересный репозиторий Modded-NanoGPT, и набор тредов о том, как спидранили обучение GPT-2 (самой маленькой версии на 125М параметров).
😎 Результат был достигнут на 8xH100 за 4.7 минуты на PyTorch вместо 45 минут в бейзлайне (llm.c). В денежном выражении это экономия с ~$15 до ~$1.56.
Представляете, обучение GPT-2 S с нуля теперь стоит $1.5 и занимает 5 минут. А обучен…
custom 529625260510466446629🔥18👍10custom 54719529869702671636🤔1🥰1
Signed Даня Меркулов
31 Oct 2024, 10:00 UTC≈5,440 views48 reactions3 Starsread 12 August 2026 Photo
В начале октября вышел ежегодный отчет State of AI Report 2024
🔗Ссылка
Помимо обзора прогресса за последний год, в конце есть секция с предсказаниями (в прошлом репорте 5 из 10 предсказаний сбылась, 3 не сбылись). Поставлю интуитивные имхо 🟢/🔴, если согласен/не согласен - проверим через год.
1️⃣ Вложение более 10 млрд $ от государства в крупную американскую AI лабораторию вызовет проверку на уровне национальной бе…
custom 547195298697026716325custom 529625260510466446610👍7🔥5🥰1
Signed Даня Меркулов
13 Oct 2024, 11:58 UTC≈12,000 views100 reactions7 Starsread 12 August 2026 Video
Нейронная сеть Хопфилда
🏆 На этой неделе нобелевскую премию по физике дали Джону Хопфилду и Джеффри Хинтону за
основополагающие открытия и изобретения, которые позволяют использовать машинное обучение с помощью искусственных нейронных сетей.
😲 Я, как и многие в моем окружении, сначала недоумевал, почему так и причем здесь физика. И решил заботать, что вообще такое нейронная сеть Хопфилда, и получил дикое удовольств…
custom 547195298697026716348👍26custom 529625260510466446614😁4🔥3🤔2✍1🤬1
Signed Даня Меркулов
9 Sept 2024, 11:46 UTC≈8,570 views118 reactions13 Starsread 12 August 2026 Video
Почему все используют градиентные методы для обучения больших моделей?
🤩 Продемонстрирую наглядно на примере решения задачи Multidimensional Scaling (MDS). В этой задаче нам надо нарисовать на плоскости объекты, про которые мы знаем только насколько каждый из них далеко друг от друга. Т.е. на входе у нас матрица попарных расстояний, а на выходе координаты объектов на плоскости. Причем эти координаты должны быть таки…
custom 547195298697026716365👍23custom 529625260510466446618🔥10🤔1🥰1
Signed Даня Меркулов
20 Jul 2024, 13:46 UTC≈6,270 views68 reactions2 Starsread 12 August 2026 Video
Мам, я хочу double descent - у нас есть double descent дома!
💀 Феномен двойного спуска - явление, наблюдаемое в моделях машинного обучения, при котором при увеличении сложности модели на тестовых данных сначала наблюдается улучшение качества предсказаний (первый спуск), затем идёт ожидаемый рост ошибки (переобучение), а потом, внезапно, происходит улучшение обобщающей способности модели (второй спуск). Интересно, чт…
custom 529625260510466446635custom 547195298697026716319👍9custom 52177204853069737304✍1
Signed Даня Меркулов
16 Jul 2024, 18:49 UTC≈5,300 views126 reactions3 Starsread 12 August 2026 Photo
Сегодня я планировал быть в Барселоне, рассказывать нашу работу по квантизации LLM на конференции UAI, но т.к. мой шенген делают уже больше месяца, я был вынужден использовать последнюю диффузионную модель Stable Paint, чтобы добавить меня к постеру, который, к моей большой радости, всё же был представлен @Ivan_Oseledets.
Когда приведу в порядок код, напишу пост про сам алгоритм (он прикольный - матрица раскладывает…
custom 547195298697026716377custom 529625260510466446616🔥13🤬12👍5😁2custom 52177204853069737301
Signed Даня Меркулов
10 Apr 2024, 18:50 UTC≈6,610 views80 reactions4 Starsread 12 August 2026 Video
Почему стохастический градиентный спуск не сходится?
👍 Многие привыкли использовать SGD(stochastic gradient descent), но не все знают, что он гарантированно(!) не сходится в случае постоянного шага (learning rate) даже для самой приятной в мире функции - сильно выпуклой квадратичной (даже в среднем).😰
🧠 Почему так? Дело в том, что в SGD на каждой итерации на самом деле решается другая задача, построенная по выбранн…
custom 529625260510466446642custom 547195298697026716316👍14custom 52247080234354046378
Signed Даня Меркулов
Showing the 12 most recent of 20 posts we hold for @fminxyz. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.