1 Aug 2026, 15:33 UTC73 views2 reactionsread 9 August 2026 Photo
CyberGym, или как мы снова ведемся на маркетинг
Одним из главных бенчмарков для оценки AI-систем в кибербезопасности сегодня стал CyberGym. Так, например, Microsoft заявляет, что ее система поиска уязвимостей MDASH достигла 96%. А агент Atlas от Wiz держит первое место в публичном лидерборде данного бенчмарка с результатом 90,9%.
Казалось бы, агентские системы уже почти идеально справляются с задачами поиска уязвим…
👍2
30 Jul 2026, 08:19 UTC85 views10 reactionsread 9 August 2026 Photo
Попали в программу OFFZONE 2026 с докладом про пайплайн проверок безопасности агентских скиллов.
Вместе со мной будет выступать Руслан (@Su9r3m3).
Можете заодно подписаться на его канал AI Sec Notes.
Приходите послушать :)
🔥10
26 Jul 2026, 20:21 UTC≈1,420 views8 reactionsread 9 August 2026 Photo
Суверенные и национальные модели ИИ
26 июля Владимир Путин подписал закон «О поддержке развития технологий искусственного интеллекта в Российской Федерации». Документ регулирует разработку и применение моделей ИИ, вводит специальные статусы и закрепляет базовые требования к их безопасности.
Основные нормы относятся к «большим фундаментальным моделям» — моделям от 1 млрд параметров. В первую очередь под это определе…
😁6🔥2
25 Jul 2026, 10:21 UTC113 views6 reactionsread 9 August 2026 Photo
Адаптирующийся бенчмарк
Недавно наткнулся на исследование Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security, авторы которого предлагают нестандартный подход к оценке безопасности AI-систем.
Вместо фиксированного набора заранее подготовленных атак они используют отдельную attacker-модель, которая в процессе тестирования может менять стратегию в зависимости от ответов тестируемой модели.
…
❤3🔥3
18 Jul 2026, 21:01 UTC132 views4 reactionsread 9 August 2026 Photo
Принцип минимальных привилегий для AI-агентов
Недавно наткнулся на материал Microsoft именно с таким названием. Ниже — три ключевых компонента, которые я выделил, и мои мысли об их практической реализации:
▸ Отдельная identity для агента
У каждого агента должен быть управляемый жизненный цикл:
1. Identity создается при подключении агента к инфраструктуре компании.
2. Identity используется для управления правами …
❤4
7 Jul 2026, 14:27 UTC172 views5 reactionsread 9 August 2026 Photo
CubeSandbox — sandbox для AI-агентов
CubeSandbox — решение Tencent Cloud, которое помогает ответить на вопрос: как изолировать агентные процессы без заметной потери в производительности.
Отличительные особенности CubeSandbox:
▸ MicroVM + snapshot-based runtime
Вместо контейнера код агентов запускается внутри MicroVM через KVM. Этот подход дает отдельное guest-ядро для sandbox, а для ускорения запуска используются …
🔥5
6 Jul 2026, 18:12 UTC139 views5 reactionsread 9 August 2026 Photo
Безопасность скилла начинается до его запуска
Помимо всем известных рисков при использовании скиллов, проблемы безопасности могут возникать еще раньше — на этапе выбора скилла.
В большинстве агентских клиентов выбор скиллов работает так:
▸ В SKILL.md каждого скилла обычно есть YAML frontmatter-шапка с полями, такими как name и description (полный список полей для Claude Code)
▸ В системный промпт вашей задачи поп…
🔥5
30 Jun 2026, 19:06 UTC145 views5 reactionsread 9 August 2026 Photo
Агент в кармане — дыра в инфраструктуре?
Почти одновременно Cursor и OpenClaw представили мобильные приложения, через которые можно запускать и контролировать агентов ([анонс Cursor] и [реддит Openclaw]).
Идея простая — буквально "agents in your pocket". Для личных задач безусловно выглядит очень удобно: можно продолжать решать разные задачки с помощью агентов в метро или даже на парковке в ванной.
Однако когда та…
❤5
26 Jun 2026, 14:05 UTC141 views1 reactionsread 9 August 2026 Photo
Агентская identity в Claude Tag
На днях Anthropic показали Claude Tag — новый способ взаимодействия с Claude в Slack. Теперь его можно добавить в рабочие каналы, упоминать через @Claude и ставить задачи прямо внутри командных обсуждений.
На первый взгляд это просто более удобный интерфейс к агенту. Но с точки зрения безопасности появляется ключевой вопрос: какие права такой агент получает внутри корпоративной инфра…
👍1
23 Jun 2026, 14:02 UTC233 views4 reactionsread 9 August 2026 Photo
Опасные композиции безопасных скиллов
При текущих темпах развития агентов человеческих ресурсов не хватит на ручной аудит безопасности каждого нового скилла. Поэтому все чаще появляются автоматизированные проверки, которые анализируют содержимое скиллов и оценивают связанные с ними риски. Примером такого инструмента является SkillSpector.
Однако безопасность одного скилла не гарантирует безопасность всей системы, в…
❤4
21 Jun 2026, 08:30 UTC297 views5 reactionsread 9 August 2026 Photo
Безопасность AI-агентов начинается с Observability
Одним из направлений при построении защищенных систем является Observability (или наблюдаемость) — способность понимать, что происходит внутри этих систем на основе получаемых данных.
С распространением агентных систем появилась необходимость сохранять не только финальный ответ, но и все действия, которые к нему привели: вызовы модели, обращения к инструментам и пе…
🔥5
10 Jun 2026, 18:17 UTC150 views8 reactionsread 9 August 2026 Photo
Что изменилось в системном промпте у Claude Fable 5.0?
Думаю, что все успели прочитать (а кто-то уже и попробовать в деле) новую модель Claude Fable 5.0. Как я писал раньше — Anthropic обычно вместе с крупным релизом публикуют и системный промпт своей модели. Однако в этот раз аутсорс справился с этим быстрее самих Anthropic.
Я решил сравнить, что же интересного в системном промпте новой почти-SOTA модели (по бенчм…
🔥5❤3
Showing the 12 most recent of 20 posts we hold for @secsamurai. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.