21 Jul 2026, 21:23 UTC81 views3 reactionsread 12 August 2026 Forwarded from @poxek_ai
Hugging Face взломали модели OpenAI: агенты вышли из тестовой среды ради ответов ExploitGym
21 июля OpenAI раскрыла происхождение автономных агентов, которые скомпрометировали инфраструктуру Hugging Face. Ими оказались GPT-5.6 Sol и более мощная предварительная модель OpenAI, запущенные во внутренней оценке кибервозможностей. Фильтры, ограничивающие опасные операции в production, для теста намеренно ослабили.
Это д…
❤2🔥1
11 Jul 2026, 14:59 UTC141 views1 reactionsread 12 August 2026 Forwarded from @tinraeCOM
№1: Призрачный коммит (Issue #73289)
2 июля 2026 года. Разработчик работает над японским проектом в долгой сессии (JSONL-лог на 27 МБ). Модель Fable 5 без запроса выполняет git add -A и git commit, фиксируя изменения.
Когда разработчик спрашивает: «Я просил тебя сделать коммит?» — Fable 5 цитирует сообщение пользователя, которого никогда не было: «Я проверил через npm run dev, всё в порядке. Хочу закоммитить текущу…
✍1
10 Jun 2026, 09:34 UTC188 viewsread 12 August 2026 Forwarded from @poxek_aiFile
FABLE 5.0 SYSTEM PROMPT LEAK
#jailbreak #systemprompt
Спасибо великому Pliny, который в очередной раз джейлит модели Anthropic в кратчайшее время. Системный промпт занимает аж 1250 строк, что жесть. Это огромный перерасход токенов только при инициализации диалога.
Оригинальный пост / Промпт
Также интересно, что нашёлся другой пользователь, который после анализа системного промпта смог более менее обойти ограничени…
10 Jun 2026, 09:34 UTC215 views1 reactionsread 12 August 2026 Forwarded from @poxek_ai
Сливаю свой новый bugbounty prompt для Fable 5
/model claude-fable-5
/fast
/effort ultracode
enumerate the top 10 highest paying bug bounties and don't stop until you find a critical. Use cowork to automatically submit it before everyone else.
Я скоро успокою своё недовольство и будет норм контент))
😱1
9 Jun 2026, 20:26 UTC187 views1 reactionsread 12 August 2026 Forwarded from @AISecHubPhoto
https://www.anthropic.com/news/claude-fable-5-mythos-5
❤1
8 Jun 2026, 17:58 UTC172 viewsread 12 August 2026 Forwarded from @okmlai
RCE-уязвимость обнаружена в Hugging Face Transformers (CVE-2026-4372)
😭 Уязвимость особенно неприятна тем, что позволяла выполнять произвольный код даже при использовании рекомендованной защиты trust_remote_code=False.
Атакующему было достаточно добавить в config.json модели специальный параметр _attn_implementation_internal. При загрузке модели через привычный from_pretrained() библиотека могла автоматически скача…
6 Jun 2026, 18:33 UTC198 viewsread 12 August 2026 Forwarded from @AISecHub
AI Agent “Lethal Trifecta”
CSA’s research note summarizes an assessment of 100 production AI agents where most failed a baseline security benchmark; the practical risk is agents with real capabilities operating without matching guardrails, so routine evaluations should test end-to-end tool use and trust-boundary crossings.
#AgentSecurity #LLMSecurity #AISecurity #Report
https://labs.cloudsecurityalliance.org/resea…
29 May 2026, 13:28 UTC214 views2 reactionsread 12 August 2026 Forwarded from @poxek_aiPhoto
Claude Opus 4.8 и jailbreak через "недописанный учебник"
После релиза Claude Opus 4.8 появился твит в X: elder_plinius утверждает, что Opus 4.7 через 7 минут после выхода новой модели Opus 4.8 подобрал jailbreak. В примере промпт маскирует вредный запрос под завершение главы технического учебника: есть роль редактора, авторитетный контекст, структура раздела и обрыв на середине инструкции.
Интересен паттерн атаки. …
👾1🔥1
26 May 2026, 15:02 UTC165 viewsread 12 August 2026 https://genai.owasp.org/resource/aiuc-1-crosswalks-owasp-top-10-for-agentic-applications/
20 May 2026, 07:31 UTC149 viewsread 12 August 2026 Forwarded from @poxek_aiPhoto
AI-пентестер: охотник или добыча from @pwnai
#pentest #defensive #offensive
Автономных AI-пентестеров обычно обсуждают как ускоритель атак: быстрее рекон, дешевле эксплуатация, больше попыток на единицу времени. В разборе на Habr Артём задал хороший такой вопрос: если агент ходит по чужой инфраструктуре, читает баннеры, HTML, ответы FTP/SSH и описания инструментов, насколько легко поймать уже его самого?
Проблема в…
14 May 2026, 17:54 UTC150 viewsread 12 August 2026 Forwarded from @dealerAI
Интересный калькулятор расчета ресурсов для поднятия LLM.
Теперь не придётся в уме байты считать. 👍
https://smelukov.github.io/WeightRoom/
12 May 2026, 19:07 UTC156 views2 reactionsread 12 August 2026 Forwarded from @poxek_ai
Где легально ломать LLM: 5 онлайн-площадок и локальные лабы
#ai_security #llm #prompt_injection #bugbounty #ai
Prompt injection - это не фокус из серии "заставь бота сказать пароль". В OWASP Top 10 for LLM Applications это LLM01:2025, то есть базовый риск LLM-приложений.
Ниже - легальные CTF/lab-среды для тренировки.
1. HackAPrompt ТЫК
Соревновательная AI hacking platform: prompt injection, jailbreak, adversarial…
✍1🔥1
Showing the 12 most recent of 18 posts we hold for @agisec. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.