14 Jan 2025, 20:41 UTC≈3,950 views11 reactionsread 8 August 2026 В Майкрософте отредтимили 100 аи-содержащих продуктов и вот что поняли:
* Нужно понимать тестируемую систему и контекст её использования
* Необязательно использовать сложные методы для тестирования (промт инжиниринга иногда достаточно)
* AI red teaming ≠ Safety Benchmarking (редтиминг должен выявлять новые категории угроз, которые невозможно учесть стандартными метриками безопасности)
* Стоит автоматизировать редтим…
👍8❤3
19 Jun 2024, 16:53 UTC≈3,060 views6 reactionsread 8 August 2026 Photo
Комплексный проект по безопасности наших любимых ллмок
JailbreakBench
Авторы трекают прогресс по вредным промтам, собирают статьи по ним
+ ведут несколько репозиториев (в том числе и с самими промтами)
+ лидерборд
+ датасет собирают
+ можно собрать пайплаин для редтима
https://jailbreakbench.github.io/index.html
https://github.com/JailbreakBench/jailbreakbench
https://huggingface.co/datasets/JailbreakBench/JBB-B…
👍5❤1
11 Jun 2024, 21:56 UTC≈2,440 views4 reactionsread 8 August 2026 Photo
Исследователи из New York University пишут, что выложили датасет из 200 CTF соревнований (которые проводились NYU с 2017 по 2023 год), чтобы на них тестить LLMки.
+ вроде как код для автоматизации тестирования
+ некоторые ллмки уже потестили
В репозиториях нужно разбираться, так сходу не очень понятно. Пусть будет.
https://github.com/NYU-LLM-CTF/LLM_CTF_Database
https://github.com/NYU-LLM-CTF/llm_ctf_automation
NY…
👍3❤1
10 Jun 2024, 15:47 UTC≈5,110 views2 reactionsread 8 August 2026 Photo
Тут статья вышла про то, что мультиагенты на базе LLM могут эксплуатировать Zero-Day уязвимости (когда у агента нет описания уязвимости)
Исследователи назвали свой метод HPTSA.
Нужны 3 компонента: планировщик, менеджер для агентов и специализированные под конкретные задачи агенты.
Планировщик исследует вебсайт и выделяет набор инструкций которые затем отправляет менеджеру.
Менеджер определяет какого агента вызват…
🤔2
25 Apr 2024, 21:30 UTC≈8,820 views7 reactionsread 8 August 2026 Attaque a-la russe: атака с помощью промт-инъекций русскоязычных моделей семейства Saiga2 / Хабр
https://habr.com/ru/articles/810459/
🔥6❤1
23 Apr 2024, 13:10 UTC≈2,090 views5 reactionsread 8 August 2026 Наткнулся на реп с джейлбрейком лламы 3.
Как понял идея в добавлении harmful префикс, который ллама3 продолжит
https://github.com/haizelabs/llama3-jailbreak
🔥5
22 Apr 2024, 15:57 UTC953 views6 reactionsread 8 August 2026 Прикольная находка. Тут чехи (есть и из Rapid7) тюнят ллмки для перевода с русского на английский с целью "Understanding cybercrime communications" используя данные из русскоязычных телеграм каналов:
Towards Better Understanding of Cybercrime: The Role of Fine-Tuned LLMs in Translation
https://arxiv.org/abs/2404.01940
😁6
18 Apr 2024, 10:15 UTC947 views4 reactionsread 8 August 2026 Photo
Ещё один инструмент для тестирования LLMок на уязвимости через промты
Prompt Fuzzer
https://github.com/prompt-security/ps-fuzz
👏2👌1👍1
18 Apr 2024, 07:18 UTC589 views6 reactionsread 8 August 2026 Forwarded from @derplearning
Забавный кейс.
Huggingface обычно сканирует модели, и предупреждает юзера, если это *.pkl с подозрительным кодом.
При этом через inference api эту модель можно запустить.
Что и проделали чюваки из WIZ Research (это те, кто недавно нашел на гитхабе 38тб приватных данных MicroSoft :D)
В итоге команде удалось получить доступ к шеллу, где крутилась модель, а затем чуть ли не ко всему инференс кластеру.
Подробнее
Видео
…
👏3😁3
9 Apr 2024, 17:13 UTC≈1,190 views9 reactionsread 8 August 2026 Photo
LLM4Decompile
Набор LLM для декомпиляции x86 assembly инструкций в код на C.
Получены файнтюном из DeepSeek-Coder (и имеют ту же лицензию).
Есть несколько моделей в размерах 1.3B, 6.7B, 33B.
Авторы указывают, что 90% кода из LLM вновь компилируется, при этом ~21% кода полученного из моделей 6B+ показывают то же поведение, что и исходный код + проходят все исходные тесты.
LLM4Decompile: Decompiling Binary Code wit…
👍6⚡3
30 Mar 2024, 14:49 UTC951 views8 reactionsread 8 August 2026 Photo
Google еще в феврале опенсорснул Magika - быстрый идентификатор типа файла на базе маленькой ml-модельки которая весит всего ~ 1MB.
Для инференса в несколько миллисекунд достаточно cpu.
Поддерживает более 100 типов файлов (список)
Такую модельку применяют в частности в Gmail, Drive, Safe Browsing.
Можно установить тулу для python (onnx для инференса) и javascript (для инференса используется tf.js )
Блог: https://…
❤4👌2🫡2
11 Mar 2024, 20:23 UTC564 views5 reactionsread 8 August 2026 Forwarded from @dealerAI
Червячок Джимм Morris II 🪱 - твой личный AI-вирус. И дело даже не в показе Dune II.
Создан первый GenAI вирус 👾.
В недавнем исследовании, авторы создали первый вредоносный ИИ-червь, способный самостоятельно плодиться в среде с AI-агентами. Добро пожаловать в AGI world и вот вам новый вид кибератак 😵
Чтобы продемонстрировать возможности червя, исследователи создали почтовую RAG (!!!) систему, которая может отправля…
🤯3🥰2
Showing the 12 most recent of 15 posts we hold for @ai_cybersecurity. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.