31 Jul 2026, 21:12 UTC77 views5 reactionsread 9 August 2026 «Включен» не значит «работает».
На днях вышло интервью Элада Мегеда из Novee Security, который рассказал, как ИИ-агент может успешно пройти встроенные проверки безопасности и все равно украсть секреты или выполнить произвольный код. Детали – на следующей неделе на Black Hat. Со слов исследователя, находки продемонстрированы на агентских конвейерах собственных репозиториев Anthropic, Google и OpenAI.
К примеру, в Cl…
👍3🔥2
27 Jul 2026, 11:28 UTC140 views8 reactionsread 9 August 2026 Слепая зона масштабирования: чему можно научиться из истории побега агента OpenAI на сервера Hugging Face (HF).
Вернёмся к инциденту с HF: расследование Reuters вскрыло деталь не менее интересную, чем сам взлом – похоже, OpenAI сама почти неделю не понимала, что её собственный агент атакует чужую инфраструктуру.
Напомню, как всё было. OpenAI оценивала наступательные кибер-возможности моделей на бенчмарке ExploitGym…
👍6❤2
23 Jul 2026, 16:35 UTC147 views5 reactionsread 9 August 2026 Photo
Kimi K3 (особенно в режиме Swarm) - штука прикольная, действительно очень глубоко копает. Но за пару часов я умудрился потратить четверть недельной квоты $40-го тарифа, при том что это нейронка третьего выбора у меня :)
👍5
22 Jul 2026, 21:59 UTC219 views6 reactionsread 9 August 2026 Пока все обсуждают, как модели OpenAI взломали Hugging Face, поделюсь размышлениями с позиции AI Agent security над не менее интересной статьей. На днях OpenAI выпустила разбор того, чему их научила «долгоживущая» модель.
Напомню, что название "long-horizon" она получила, потому что ей ставят сложную цель и позволяют очень долго работать над ней самостоятельно. Это та самая модель, что недавно опровергла гипотезу Эр…
❤6
20 Jul 2026, 21:16 UTC131 views6 reactionsread 9 August 2026 На днях увидел обзор обновленной команды /doctor (встроенной диагностики Claude Code). В старые добрые времена оптимизаторы Windows чистили автозагрузку, чтобы вместе с системой не запускалось много ненужных программ. /doctor делает что-то похожее с памятью агента: помогает понять, какие инструкции Claude приносит в каждую сессию.
Как вообще происходит замусоривание. В процессе работы с Claude, если какое-то правило…
👍6
14 Jul 2026, 21:31 UTC157 views6 reactionsread 9 August 2026 Сага о Fable
Собрал вместе с ChatGPT 5.6 всю историю с Mythos/Fable. Да, прошло немало времени, но комплексная история интересна тем, как на практике отрабатывают риски, которые часто кажутся умозрительными. Про это писали все, но некоторым моментам уделили недостаточно внимания:
- Как еще до блокировки Белый дом собирался ввести обязательную проверку самых сильных моделей перед публикацией - по слухам до 90 дней з…
👍4❤1🔥1
10 Jul 2026, 21:49 UTC212 views7 reactionsread 9 August 2026 Агент-вымогатель: несколько мыслей после JADEPUFFER
Почти незамеченной прошла новость от 1 июля о JADEPUFFER. По оценке Sysdig, всю атаку провёл LLM-агент: взломал необновлённый сервер, добрался до рабочей базы данных, зашифровал служебные настройки, удалил исходные данные и потребовал выкуп.
Когда скрипты не срабатывали, агент исправлял их по ходу дела. Всего исследователи насчитали более 600 осмысленных действий.…
👍5👏1🔥1
13 Jun 2026, 13:52 UTC201 views13 reactionsread 9 August 2026 На днях Anthropic выпустил публичную версию своей распиаренной Mythos - под именем Fable 5 (та же модель, но с включёнными safeguards), и я сразу попробовал её на самых сложных своих задачах. Пока у меня созревал пост про сильные и слабые стороны новинки, сегодня ночью получил сообщение: "There's an issue with the selected model (claude-fable-5). It may not exist or you may not have access to it."
В целом Fable 5 ме…
👍12🔥1
7 Jun 2026, 20:45 UTC202 views1 reactionsread 9 August 2026 Photo
Есть старая раздражающая проблема - начинаешь набирать текст и оказывается, что он не в той раскладке. Магической утилиты тут нет, и, перепробовав разные, в итоге навайбкодил свою для macOS. Смущало давать Accessibility-доступ, то есть права видеть события клавиатуры, всё-таки неизвестным утилитам. Да и функциональности порой не хватало.
Без спеки и методологии разработка вышла быстрой и увлекательной. Утилита умеет…
👍1
29 May 2026, 07:52 UTC535 views7 reactionsread 9 August 2026 Photo
Слезы по Ассемблеру
На днях делал презентацию к конференции ёPRSTCON, под которую решил попробовать собрать слайды нейронкой. И был приятно удивлен - слайды получились эффектные, и главное не пришлось тратить время на самое нелюбимое дело - подбирать картинки нужного формата и цветового оформления, двигать и выравнивать блоки, чинить постоянно разъезжающуюся верстку. Внезапно все эти муки оформления и форматирования…
👍5❤2
26 May 2026, 11:13 UTC164 views7 reactionsread 9 August 2026 Forwarded from @yoprstconPhoto
🎧@tbiyachuev и Environmental Agentic Threat Model:
модель угроз для ИИ, который видит, слышит и действует во внешней среде. Разбор публичных исследований и инцидентов 2024–2026.
👍7
15 May 2026, 12:34 UTC197 views4 reactionsread 9 August 2026 На первой конференции «ёPRST» расскажу про «дивный новый мир» умных устройств, сред и пространств, которые будут окружать нас уже в ближайшем будущем. А некоторые умные штуки окажутся даже внутри нас — привет, нейроинтерфейсы. Без паники и страшилок - через модель угроз и реальные исследования.
Главная мысль: AI выходит из экрана в физический мир. Он появляется в очках, наушниках, колонках, камерах, роботах, автомоб…
👍3🔥1
Showing the 12 most recent of 17 posts we hold for @tbiyachuev. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.