12 Feb 2025, 07:48 UTC≈1,150 views8 reactionsread 8 August 2026 Photo
📣 Open-call: Курс по основам AI Safety
ИИ меняет мир с безумной скоростью, но вместе с этим несет в себе серьезные риски. Задача AI Safety – позаботиться, чтобы эти изменения были положительными
Цель курса – дать базу для начала карьеры в AI Safety. Программа знакомит с основными концепциями, ландшафтом исследований и работами Anthropic, Redwood Research, MIRI
📖 Программа из двух треков:
➕Учебный (4 недели): Знак…
🔥6❤1🤮1
Signed Anton Zheltoukhov
6 Feb 2025, 21:31 UTC≈1,170 views4 reactionsread 8 August 2026 Курс по теории обучения
Gergely (ALTER) и Kōshin (Monastic Academy)
Cartesian framework for learning theory, MDPs/POMDPs, Learnability, Sample complexity, Bandits, VC dimension, PAC learning
Инфрабайесианство – надстройка над теорией вероятности, которая позволяет приблизить ее свойства к реальности, не теряя математического формализма. Основная цель – решить задачу agent foundations (на сегодня считается лучшей т…
🔥2🤔2
Signed Iuliia Levin
31 Jan 2025, 13:19 UTC≈1,050 views10 reactionsread 8 August 2026 Photo
Evals at METR. Философия и практика. Елена Еричева
Запись доклада
Лена – опытный исследователь машинного обучения с более чем 10-летним опытом в биотехнологиях и медтехе. В METR занимается AI Alignment и AI Safety: исследует возможности ИИ-моделей, разрабатывает бенчмарки и проводит Blue Teaming с фокусом на безопасности. Специализируется на компьютерном зрении, NLP и эффективном применении современных LLM и VLLM. А…
🔥8👍2
Signed Anton Zheltoukhov
19 Jan 2025, 11:30 UTC≈1,990 views6 reactionsread 8 August 2026 AI Alignment Evals Hackathon
25 января – 2 февраля
Оценка возможностей моделей сейчас в топе приоритетов сейфти и туда вливается много улисий:
– Недавно прошла evals bounty программа от AISI с очень сочными призами для _всех_ чьи работы прошли отбор
– Институт MIRI переключился на оценку evals'ов, чтобы помогать направлять усилия на самое важное
– Большая часть фандинга идет на evals'ы
– Было много другого. Это что…
🔥5🤔1
Signed Anton Zheltoukhov
8 Jan 2025, 08:25 UTC≈6,640 views5 reactionsread 8 August 2026 Photo
Photo, posted without a caption
🔥4🤡1
Signed Anton Zheltoukhov
8 Jan 2025, 08:25 UTC≈6,930 views4 reactionsread 8 August 2026 Конференция AI Safety Fundamentals
Участники reading группы Agent Foundations и upskilling группы Runway расскажут о своих первых проектах в сейфти. Эксперты расскажут про текущий ландшафт исследований и как начать свой путь в сейфти.
📅 Когда: 10 января 18:50, 11 января 16:50 МСК
🌐 Где: онлайн, ссылка появится в чате "Минимизаторы скрепок"
Подробности
🔥4
Signed Anton Zheltoukhov
2 Nov 2024, 10:50 UTC945 views4 reactionsread 8 August 2026 Photo
Brief analysis of OP Technical AI Safety Funding
Full data available here
TL;DR
I spent a few hours going through Open Philanthropy (OP)'s grant database. The main findings were:
Open Philanthropy has made $28 million grants for Technical AI Safety (TAIS) in 2024
68% of these are focused on evaluations / benchmarking. The rest is split between interpretability, robustness, value alignment, forecasting, field build…
🤔2👍1🔥1
Signed Anton Zheltoukhov
26 Oct 2024, 17:25 UTC≈2,020 views13 reactionsread 8 August 2026 We are pleased to announce that the 10th version of the AI Safety Camp is now entering the team member application phase!
AI Safety Camp is a 3-month long online research program from January to April 2025, where participants form teams to work on pre-selected projects.
We have a wide range of projects this year again, so check them out to see if you or someone you know might be interested in applying to join one o…
🔥10❤🔥3
Signed Anton Zheltoukhov
24 Oct 2024, 16:40 UTC714 views10 reactionsread 8 August 2026 Photo
про фразочку Юдковского "бомбить дата центры" многие знают, но немногие знают, что есть бот Юдковский, чья единственная задача не продать вам compute 🙃. убедить его реально. удачи
p.s.: если Ю уломать не получится, можно потренироваться на Гендальфе от Lakera AI
🥰5🔥3❤1👍1
Signed Anton Zheltoukhov
22 Oct 2024, 21:48 UTC718 views2 reactionsread 8 August 2026 https://www.apolloresearch.ai/blog/an-opinionated-evals-reading-list
👀1👍1
Signed Iuliia Levin
22 Oct 2024, 21:43 UTC703 viewsread 8 August 2026 File
File, posted without a caption
Signed Iuliia Levin
22 Oct 2024, 21:42 UTC706 views2 reactionsread 8 August 2026 How to Solve It suggests the following steps when solving a mathematical problem:
1 First, you have to understand the problem.[2]
2 After understanding, make a plan.[3] - Devise a plan
3 Carry out the plan.[4]
4 Look back on your work.[5]-Review/extend How could it be better?
If this technique fails, Pólya advises:
"If you cannot solve the proposed problem, try to solve first some related problem. Could you imag…
👀1🤓1
Signed Iuliia Levin
Showing the 12 most recent of 17 posts we hold for @hardbits. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.