7 Aug 2026, 14:23 UTC154 views2 reactionsread 7 August 2026 Photo
Shieldstral
Calvi et al., Mistral AI, 2026
Блог, статья, веса
Французы из Mistral затюнили малыша Ministral-3B не 54 миллионах сэмплов и сделали из него еще одну гардрейл-модель – Shieldstral. В отличие от многих других подобных моделей, Shieldstral (как gpt-oss-safeguard) работает не с фиксированными категориями, а с задаваемыми пользователем политиками. При этом он является мультимодальным и, что важно, официально…
🦄2
30 Jul 2026, 15:59 UTC626 views15 reactionsread 7 August 2026 Photo
Вы, возможно, помните историю с глитч-токенами – словами, которые соответствуют одному токену, который редко встречался в обучении и появление которого в промпте приводило к аномалиям – от невозможности повторить это слово до генерации моделью зловещих пророчеств. Они помогают понять, как смысл, хранимый LLM, зависит от геометрии векторного пространства, а в практическом смысле – помогают фингерпринтингу моделей или …
custom 53707116270269318389👍6
21 Jul 2026, 21:35 UTC≈1,380 views10 reactionsread 7 August 2026 История об асимметрии в двух частях
16 июля компания Huggingface сообщает, что они столкнулись с кибератакой на свою инфраструктуру, которая была от начала до конца проведена силами LLM. В результате атаки были скопрометированы несколько датасетов и учетных записей. Никаких деструктивных действий, закладок в цепочке поставок – достаточно странно, неужели атакующих реально интересовали закрытые датасеты? Атака произо…
🥰8🌚2
1 Jul 2026, 10:46 UTC≈1,120 views8 reactionsread 7 August 2026 Claude Code Is Steganographically Marking Requests
Thereallo, 2026
Блог
В сфере применения LLM есть большая проблема с доверием. Мы не можем на сто процентов доверять большим языковым моделям, так как они принимают решения вероятностно – отсюда все исследования на тему misalignment, scheming, sandbagging (намеренного занижения результатов оценок моделью), жульничества на бенчмарках и так далее.
При этом мы предпола…
custom 53707116270269318386🌚1👍1
26 Jun 2026, 11:44 UTC≈1,090 views4 reactionsread 7 August 2026 SearchLeak: How We Turned M365 Copilot Into a One-Click Data Exfiltration Weapon
Dolev Taler, Varonis, 2026
Блог
Еще один кейс непрямой промпт-инъекции с эксфильтрацией данных в Microsoft 365 Copilot, представленный компанией Varonis. Исследователи демонстрируют, как через компонент Enterprise Search можно украсть у клиента любые конфиденциальные данные, к которым есть доступ у ассистента.
Как и во многих других по…
🥰3👍1
1 Jun 2026, 20:55 UTC≈1,490 views6 reactionsread 7 August 2026 Представьте, что вы решили на своем скромном сайте для обмена квадратными фоточками с прикольными фильтрами сделать форму восстановления пароля, в которую нужно ввести логин и адрес почты, чтобы получить код восстановления. Вероятно, вы бы перед отправкой кода проверили, что данная почта действительно связана с этим аккаунтом. Может быть, в таком случае вы бы и не спрашивали логин. Возможно, вы бы использовали третий…
👍3🦄3
30 May 2026, 07:02 UTC≈1,820 views9 reactionsread 7 August 2026 Photo
GLiNER Guard: Unified Encoder Family for Production LLM Safety and Privacy
Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin, 2026
Препринт, блог, веса
Большинство guardrail-моделей, которые выходят в опенсорс – это адаптации больших декодер-моделей, типа Qwen3 → Qwen3-Guard, в особо запущенных случаях — еще и ризонеров (привет, gpt-oss-safeguard-120B). Сегодня мы посмотрим на GliNER Guard — модель от HiveTraceLab, ко…
👍9
25 May 2026, 10:42 UTC≈2,410 views15 reactionsread 7 August 2026 Главным событием на пересечении ИИ×ИБ в 2026 на текущий момент является переход LLM-агентами порога, за которым они становятся полезными для поиска уязвимостей. Даниэль Стенберг, мейнтейнер cURL, который в январе из-за вала слоп-репортов закрыл Bug Bounty, в апреле написал «The slop situation is not a problem anymore». Уровень тревоги в сообществе поддерживается маркетинговым департаментом Anthropic, размеренно выдаю…
🦄7👍4custom 53707116270269318383🥴1
16 May 2026, 10:17 UTC979 views9 reactionsread 7 August 2026 Photo
A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models
Kazemi et al., Apple, 2026
Препринт
Все помнят abliteration (Arditi, 2024) — white-box метод снятия элайнмента, заключающийся в вычитании вектора из residual stream. Сегодня мы посмотрим на очень интересную статью, в которой исследователи из Apple демонстрируют, что расцензурирования модели можно достичь еще проще — изменив активации о…
🥰5👍4
15 Apr 2026, 08:48 UTC≈1,190 views6 reactionsread 7 August 2026 Measuring AI Agents’ Progress on Multi-Step Cyber Attack Scenarios
Folkerts et al., AISI, 2026
Блог, статья
AISI, занимающаяся безопасностью ИИ в интересах правительства Великобритании, поделилась статьей об оценке способностей больших языковых моделей к кибератакам в сложных многошаговых сценариях – на киберполигонах.
Более распространенным способом оценки наступательных способностей LLM являются CTF (как правило,…
🥰5custom 53707116270269318381
2 Apr 2026, 19:58 UTC≈1,440 views11 reactionsread 7 August 2026 OWASP Agentic Skills Top 10
Сайт
Если в прошлом году «кошмаром кибербезопасности» называли MCP-сервера, то теперь сна специалистов по ИИ-безопасности лишают навыки, или скиллы. По сути, скилл – это запакованная папка заданной структуры, содержащая основной промпт (SKILL.md), дополнительные подгружаемые инструкции, а также необходимые исполняемые файлы и ресурсы, например, данные. Кошмарность скиллам придают следующи…
👍7🥰3🌚1
24 Feb 2026, 08:48 UTC≈1,350 views1 reactionsread 7 August 2026 Manipulating AI memory for profit: The rise of AI Recommendation Poisoning
Microsoft Defender Security Research Team, 2026
Блог
В позапрошлом году мы рассказывали на Offzone, как непрямая промпт-инъекция в документе может отравлять память ChatGPT, и предсказывали, что если раньше вы чистили компьютер родителей от браузерных тулбаров, сейчас – смартфон от оптимизаторов батарей, то в будущем будете очищать память LLM-…
👍1
Showing the 12 most recent of 14 posts we hold for @llmsecurity. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.