29 Jul 2026, 10:58 UTC112 views2 reactionsread 7 August 2026 В целом, у нас теперь есть подробнейшие детали того как все происходило. Походу атаки агент ломанул еще одну компанию. Конкретные патчи, которые сделали в HuggingFace для кода в даты атаки известны тоже.
Конспирологическая версия теперь имеет для меня нулевую вероятность, поскольку вся безумная совокупность багов, сводящихся в цепочку, которые были описаны в отчете, могла быть создана только мощной системой ИИ-агент…
👍2
Hidden Heuristic pinned a photo
23 Jul 2026, 23:05 UTC173 views4 reactionsread 7 August 2026 Естественно, что все эти разные баги HuggingFace тоже организовали и спланировали заранее, скажет нам конспиролог. Ради Бога, верьте во что хотите.
И последний мой аргумент против конспирологический теории: намеренное радикальное раздувание страхов перед неподконтрольным ИИ для OpenAI банально не выгодно. Я не знаю в какой реальности живут конспирологи по этому вопросу, но я лично наблюдаю высокую озабоченность ИИ-б…
❤4
23 Jul 2026, 23:04 UTC144 views4 reactionsread 7 August 2026 Photo
Разбор конспирологической теории «никакого побега модели от OpenAI не было - это все коммерческий сговор ради госконтрактов».
Несложно догадаться, что я эту теорию не разделяю, но кто-то находит очень остроумным ее вбрасывать в открытое информационное поле:
https://t.me/researchoshnaya/280
https://t.me/c3po_notes/568
Давайте разбираться.
И первое что я скажу: вообще неважно происходило ли это или не происходило, п…
👍2💯2
22 Jul 2026, 13:13 UTC163 views4 reactionsread 7 August 2026 Какие полезные выводы мы можем сделать для себя из этой истории?
1. Постарайтесь дробить свои задачи и не отправлять агента в очень далекое свободное плавание. Чем больше задача, тем выше вероятность, что он «сойдет с ума».
2. Учитывайте тип задачи. Если вы даете модели таску, где надо применять «агрессивные» тактики для ее решения, то будьте готовы к разного рода неожиданностям. Классический пример: Vending-Bench.…
🔥4
22 Jul 2026, 13:13 UTC154 views6 reactionsread 7 August 2026 Снова о немыслимом происшествии.
Когда ИИ-агенты становятся опасными?
Модель GPT-5.6 Sol от OpenAI взломала платформу HuggingFace, чтобы получить ответы на бенчмарк ExploitGym. В качестве промежуточного этапа ей удалось взломать и инфраструктуру самой компании OpenAI, чтобы вырваться в открытый интернет.
Прежде чем перейти к основному содержанию - небольшая ремарка.
В прошлом посте я ошибочно написал, что взлом де…
❤6
21 Jul 2026, 22:07 UTC191 views3 reactionsread 7 August 2026 GPT-5.6 Sol дала ценную инфу, смотреть в комментарии.
👍3
21 Jul 2026, 22:03 UTC196 views5 reactionsread 7 August 2026 Кстати, мой пост казалось бы задает слишком жесткую перспективу на данную ситуацию. В реальности некоторые следы метаагентности мы вполне видим. Кто внимательно читал, тот заметил пример про sandbagging. Есть еще и alignment faking. И agentic misalignment.
Проблема этих феноменов в том, что они работают именно как мираж в специфических контекстах, об этом можно послушать много у Neel Nanda. А чтобы планету захватыв…
👍4❤1
21 Jul 2026, 21:45 UTC≈5,720 views6 reactionsread 7 August 2026 Photo
В итоге, я думаю, что «ASI системы», которые окажутся в руках общественности через несколько лет смогут доказывать или опровергать гипотезу Римана (в зависимости от верности), но все также останутся на уровне человека с средним интеллектом в вопросе того как захватить мир.
И не потому что мы не будем знать как создать ИИ, способный захватить мир. А потому что нам повезло, что мы можем создать очень мощные системы, …
👍3🔥3
21 Jul 2026, 21:45 UTC≈4,820 views9 reactionsread 7 August 2026 Photo
Добро пожаловать, Азатот!
Азатот - безумный Бог Лавкрафта
Модель GPT-5.6 Sol от OpenAI взломала платформу HuggingFace, чтобы получить ответы на бенчмарк ExploitGym. В качестве промежуточного этапа ей удалось взломать и инфраструктуру самой компании OpenAI, чтобы вырваться в открытый интернет.
Паблик "Сиолошная" прикладывает к посту про данный инцидент фото Юдковского: https://t.me/seeallochnaya/3826
И прямо сейча…
👍3🔥2🤔2❤1💯1
19 Jul 2026, 15:41 UTC211 views7 reactionsread 7 August 2026 Очень смешно, что под кучей страниц Сергей Николенко вынужден давать большую сноску, где он в основном ссылается на уже старые работы, чтобы приклеить к потоку сознания Юдковского хоть какую-то более аккуратную эмпирику. И на фотографиях показаны далеко не самые худшие места книги.
В общем, это забавно, когда русский научный редактор шарит в алайнмент литературе намного лучше отца безопасности ИИ «мирового эксперта…
👍6🤔1
24 Apr 2026, 15:31 UTC394 viewsread 7 August 2026 *Графики как ИИ становится более безопасным. Чем меньше, тем безопаснее.
Showing the 12 most recent of 18 posts we hold for @hidden_heuristic. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.