10 Jul 2026, 09:06 UTC68 views4 reactionsread 7 August 2026 Photo
Команда из École Normale Supérieure (🇫🇷) собрала CalArena - один из самых больших бенчмарков по post-hoc калибровке на сегодня. Внутри: 2000 экспериментов 🔬 (пары датасет–модель), там почти всё - binary/multiclass, таблички/картинки, линейки/бустинги/сетки/трансформеры + десятки методов калибровки.
Спойлер: не используй Expected Calibration Error (ECE). Она слишком чувствительна к числу бинов и может показать нулеву…
🔥4
17 Jun 2026, 11:22 UTC141 views10 reactionsread 7 August 2026 Листаю статьи про A/B и ML, и это будто две разные вселенные. Только в Causal ML они хоть как-то начинают мэтчиться 🤝. В A/B аналитики задают уровень значимости (alpha) и мощность (1 - beta). Хоть индустрия понемногу и пытается слезть с иглы p-value, эти метрики всё еще захардкожены как дефолт в почти любом эксперименте. При этом, между alpha, beta и метриками классификации есть прямой перевод:
H0 (Нулевая гипотеза)…
❤7🤔3
7 Jun 2026, 18:37 UTC187 views1 reactionsread 7 August 2026 Что по плюсам:
Скорость: Это в разы быстрее любых других методов.
Строгость: На руках честный p-value и доверительные интервалы.
Стабильность: Оценка не дергается от рандома, в отличие от SHAP.
Подводные камни:
OOD (Out-of-Distribution): Вставляя среднее, можно сгенерить франкенштейна - комбинацию признаков, которой в природе не существует. Но этим грешит и Permutation.
Игнор масштаба: Тесту плевать, насколько фича …
👍1
7 Jun 2026, 18:37 UTC177 views7 reactionsread 7 August 2026 Photo
В прошлом году открыл статью, пробежался по диагонали и закрыл. А недавно увидел ее снова и понял какое это золото🏆 Стэнфордские ребята придумали, как дешево и сердито понять: вот эта фича в датасете реально тащит, или она тут для массовки?
Обычно мы берем SHAP, который колбасит от шума, либо Permutation Importance, искусственно раздувая дисперсию оценок. Всё это эвристики и p-value они тебе не дадут. Исследователи …
🔥7
19 Apr 2026, 09:16 UTC270 views3 reactionsread 7 August 2026 Video
Владимир Вапник (один из основателей ML): при решении конкретной задачи не решайте более общую в качестве промежуточного шага.
Это идеально описывает DRE (Density Ratio Estimation). Вместо того чтобы отдельно искать p(x) и q(x), а потом делить, DRE оценивает p(x)/q(x) напрямую. Это проще, стабильнее и требует меньше данных.
Будь то адаптация к сдвигу выборки (train ≠ test), поиск аномалий и точек изменения в рядах,…
🔥3
3 Apr 2026, 18:17 UTC288 views2 reactionsread 7 August 2026 Photo
Photo, posted without a caption
🔥2
3 Apr 2026, 18:17 UTC273 views6 reactionsread 7 August 2026 Photo
Скоро лето значит вырастут продажи мороженного🍦 и количество комаров. Или вот еще - размер ноги ребенка сильно коррелирует с умением читать📖. Корреляция есть, а прямой связи нет. Очевидно включается третий фактор (сезон/возраст). С этим всё просто.
Пример посложнее: возраст и вес.
Если смотреть на всех людей сразу, связи нет (корреляция нулевая). Одни полнеют из-за плохого метаболизма, другие теряют вес из-за ухода …
👍5👎1
19 Mar 2026, 07:41 UTC≈1,280 views5 reactionsread 7 August 2026 Хотите подглядывать в AB тесты? Вот вероятно простейший способ, за который не надают по рукам. Проблема известная: подглядывание в AB тестах увеличивает ложноположительные ошибки (шансы внедрить ерунду в прод).
Авторы статьи предлагают относиться к завершению теста как к задаче предсказания. В любой момент подглядывания вы вычисляете вероятность того, что ваш тест отвергнет нулевую гипотезу когда этот самый тест заве…
✍3👎1🔥1
15 Feb 2026, 10:32 UTC484 views9 reactionsread 7 August 2026 Photo
В продолжение предыдущего поста, про статистику в современном мире. Недавно в универе Квебека показали, что обычный метод наименьших квадратов (OLS) математически полностью эквивалентен упрощенному механизму внимания из трансформеров если softmax заменить на линейную функцию. То, что в Attention называется Query, оказывается просто линейной проекцией ваших тестовых данных (для которых ищем ответ) в новое пространство…
❤9
9 Feb 2026, 12:29 UTC705 views7 reactionsread 7 August 2026 Если Вам кажется что традиционная статистика выглядит "мертвой" на фоне LLM/ViT/GNN, то так кажется не только Вам. В 2024-м топы статистики из Стэнфорда, Гарварда и CMU собрались на конфу "Statistics in the Age of AI".
К чему пришли:
- Колоссальные объемы данных снимают большинство ограничений, накладываемых на выучиваемые распределения.
- Современные модели живут в тысячемерных пространствах и отлично себя чувствую…
🔥7
25 Dec 2025, 10:05 UTC272 views4 reactionsread 7 August 2026 Photo
И вот лайфхак: ребята из Гарварда предлагают безопасно прикрутить сюда LLM, т.е. смешать реальные данные и синтетические. Самое главное - дают гарантию "это точно не навредит оценке теста" и доказывают, что дисперсия не станет хуже, чем при обычном AIPW. Суть подкупает простой: просим LLM предсказать поведение пользователей в эксперименте, и строим новую оценку эффекта по ее прогнозу. Для каждого пользователя в табли…
✍4
25 Dec 2025, 10:04 UTC222 views4 reactionsread 7 August 2026 Если гоняете A/B-тесты, то AIPW (Augmented Inverse Probability Weighting) это популярный вариант их оценки с помощью ML. Моделируем целевую метрику (Y) пользователя X в группе A (флаг группы = 0/1) - f(X), вероятность попадания в группу - prob(X). И сырой Y меняем на скорректированный: Ynew = A*(Y - f(X))/prob(X) + f(X). Итоговый эффект теста это средняя разница между Ynew в тестовой и контрольной группах по всем пол…
👍4
Showing the 12 most recent of 18 posts we hold for @datafunk. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.