4 Aug 2026, 14:03 UTC529 views14 reactionsread 7 August 2026 Чем ещё хотела поделиться — вот прошли выходные (с фикшенными багами), как мы выпустили open-xai.
И я смотрю на эти первые 60 пользователей (спасибо вам!), смотрю на наш начальный дизайн, на модули, на обновления в работе — и так хочется улучшать это всё!
Мой восторг сменился постепенно на рациональность — мало выпустить продукт, надо думать о UI, UX, доходимости, понятности и кому он нужен, прайс-не прайс, retenti…
❤14
4 Aug 2026, 13:48 UTC459 views8 reactionsread 7 August 2026 Зонды в проде и что послушать/почитать
Что такое зонд:
Зонд — мини-ML-вида-модель, которая работает на активациях большой модели. Задача такова:
Наш Х — скрытое состояние LLM на каждом токене — список матриц (для каждого примера — матрица d × n, где n — длина последовательности, d — внутренняя размерность модели). Не тензор, потому что есть нюансы — скину в комменты.
Наш Y на списке матриц — бинкласс — как там сейча…
🔥6❤2
4 Aug 2026, 13:48 UTC528 views3 reactionsread 7 August 2026 Что получили, не работает:
На джейлбрейках уязвимость минимум на 1% запросов — у всех методов без исключения. Под адаптивным ред-тимингом FNR выбранного авторами зонда — 42%. Так что против обычного трафика зонд — хорошо, а против думающего противника — нет.
Общий нюанс: зонду нужен доступ к внутренностям. То есть это инструмент владельца модели или того, кто крутит открытые веса. Сидя на API, зондов нет, но какова …
❤3
31 Jul 2026, 16:02 UTC≈1,350 views73 reactionsread 7 August 2026 Мы выпускаем образовательный ресурс open-xai.
Привет, друзья! Я шла к этому очень долго и наконец-то готова выпустить образовательный ресурс open-xai!
Ресурс построен как точка, где можно учиться просто всему, что есть в интерпретируемости. От классических методов, до геометрии и математики в моделях.
Сейчас в нем:
⁃ 2 трека. XAI Practitioner — объяснять поведение моделей руками, от классики до LLM. Math of LLMs…
❤46🔥19👏4❤🔥1🎉1💅1🤯1
30 Jul 2026, 15:38 UTC871 views15 reactionsread 7 August 2026 XAI для агентов: библиотеки
Консерватор с тревожкой, когда кто-то что-то делает за него (я), наконец докопался до XAI для агентов.
Что у нас есть:
С агентами, вместо модели, нас интересует действие и их последовательность. Отсюда мы ставим вопрос: «почему был выбран этот путь/тула/шаг?». На текущем этапе развития интерпретируемости мы бы умерли, если бы тащили для ответа Mech-Interp, потому что у нас появляется га…
❤13💅1🔥1
30 Jul 2026, 15:38 UTC≈1,020 views16 reactionsread 7 August 2026 В целом, мир observability/трейсинга бОльший — Langfuse, Phoenix/Arize, AgentOps, плюс eval-фреймворки типа Inspect. Они все показывают, ЧТО делал агент (логи, шаги, стоимость), но не объясняют ПОЧЕМУ. Это ближе к мониторингу, а не интерпретируемости и тут очень сложно разводить границы.
Прикольная карта направления — обзор «Agentic-Transparency» (survey + таксономия).
Но сейчас interp (более менее не эксперименталь…
❤12🔥4
28 Jul 2026, 21:12 UTC880 views30 reactionsread 7 August 2026 Photo
Пишу rebuttal эксперименты на NIPS. Статью делали ещё осенью, кажется, так что пришлось заново читать, чтобы осознаться.
Так вот — открыла текст не тем редактором — а там prompt injection 🙂
Оказалось: защита NIPSa от LLM-ревью. Вот вам и "сложные времена рождают сложные решения".
Счастливых всем rebuttals и пусть удача всегда будет с вами.
😱27😁3
27 Jul 2026, 14:34 UTC997 views17 reactionsread 7 August 2026 Photo
Если лень читать — заходите за красивыми картинками.
❤14🔥3
27 Jul 2026, 14:33 UTC≈1,000 views27 reactionsread 7 August 2026 Привет, друзья! Как запаковать мир?
Всё свободное время я ботаю математику, и это рождает побочную красоту. И наконец-то я добила новый туториал — про то, как модели упаковывают концепты в многообразия. Я била его долго — и он побил меня. Надеюсь, вам понравится!
Многообразие — это пространство, которое вблизи каждой точки выглядит как обычная прямая или плоскость, даже если целиком оно замкнуто и искривлено. Мурав…
🔥24❤3
24 Jul 2026, 18:29 UTC≈1,120 views27 reactionsread 7 August 2026 Порадовались (друзья, спасибо вам всем громадное!)— структурируемся — вновь свеженькая библиотека — CircuitKIT.
Идея библиотеки красивая — упростить процесс работы с цепочками (или схемами, выберите тот перевод на русский, который вам ближе) — circuits.
Напоминание:
Circuit — минимальный подграф модели (головы + MLP), причинно отвечающий за конкретное поведение. Пример, задача IOI (indirect object identification).…
🔥15❤7👍3❤🔥2
24 Jul 2026, 18:29 UTC≈1,120 views69 reactions1 Starread 7 August 2026 P.S. Вы — лучшие — я вчера прям на какой-то момент остановилась (вчено куда-то бегу) и поняла, что очень ценю людей вокруг, которые помогают мне двигаться вперед и дальше. Спасибо за все приятнейшие слова и сердечко-огонечки! ❤️🔥
❤50❤🔥11👍8
23 Jul 2026, 16:41 UTC≈1,200 views113 reactionsread 7 August 2026 Video message
Video message, posted without a caption
❤56🎉28❤🔥19👏6🦄4
Showing the 12 most recent of 17 posts we hold for @jdata_blog. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.