6 Aug 2026, 08:31 UTC377 views2 reactionsread 7 August 2026 Photo
Друзья, всем привет 👋🏻
Сможете решить задачку?⬇️
02:17. Pager разрывается. Продакшн падает. А вы — дежурный SRE.
Успеете среагировать за 15 минут?
Слёрм подготовил интерактивный симулятор реального инцидента: API отвечает 500-й ошибкой, задержка растёт, разработчики спят, а бизнес уже требует ответов.
Вам предстоит принять 5 решений — ровно так, как это делают дежурные инженеры в проде:
⏩ что проверить первым
⏩ к…
👍1🔥1
22 Jul 2026, 14:10 UTC771 views4 reactionsread 7 August 2026 Photo
Друзья, всем привет 👋🏻
Слёрм запускает Интенсив по SRE⚡️
За 7 учебных дней разберёте:
➡️как SRE измеряет надёжность — SLI/SLO и error budget не на словах, а на цифрах
➡️как работать с инцидентами так, чтобы фиксить систему, а не искать виноватого дежурного
➡️как системно улучшать сервисы, а не тушить одни и те же пожары по кругу
На выходе два реальных артефакта:
🔹SRE-пакет по вашему собственному, знакомому сервису…
👍2👏1🔥1
18 May 2026, 08:25 UTC≈1,320 viewsread 7 August 2026 Photo
Введение в ИИ: от LLM и MCP до ИИ-агентов
Привет всем! Приходите сегодня в 19:00 на вебинар по ИИ. Эксперты обсудят:
🔸 как работает LLM;
🔸 полезные приемы написания запросов для ИИ на выполнение задачи (промптов);
🔸 как работать с внутренними данными с помощью ИИ-агентов;
🔸 что такое MCP и зачем это нужно;
🔸 как создать своего первого ИИ-агента.
Вы скорее всего слышали про сертификацию CKAD (Certified Kubernetes A…
5 Apr 2026, 16:03 UTC≈1,470 views1 reactionsread 7 August 2026 Forwarded from @slurmnewsPhoto
Я вроде что-то знаю, но цельной картины нет 🧩
Мы знаем, что путь в управление надежностью (SRE) может быть непростым — нужно разбираться и в коде, и в железе, и в процессах, и даже в психологии. Становится особенно трудно, когда не понимаешь, что от тебя требуется и с чего начать.
Если вы готовы реально потрудиться, чтобы сделать большой шаг в направлении SRE, то приходите на обучение.
📌 Старт уже завтра — 6 апрел…
❤1
6 Mar 2026, 17:13 UTC≈1,820 views24 reactionsread 7 August 2026 ➡️Время безотказной работы (Uptime, не по-нашенски).
Друзья, всем привет!
Сегодня погорим о почти бесполезной метрики надёжности: uptime.
Инженеры любят говорить, что соглашение об уровне сервиса (SLA)= 99.99. Но это число почти ничего не говорит о реальной надёжности системы, потому что uptime не связан с пользовательским опытом и бизнес-результатом.
Простой пример: 99.99% доступности = примерно 52 минуты простоя …
👍16❤5🔥3
2 Mar 2026, 16:14 UTC≈1,660 views12 reactionsread 7 August 2026 Красные флаги на собеседованиях 🚩
Друзья, всем привет! Сегодня хочу поговорить про фразы, которые не стоит использовать на собесах, чтобы не поймать мгновенный отказ. Начнем с самой явной:
▶️Люблю, когда всё горит, инциденты бодрят, иначе скучно
Такое высказывание почти всегда значит, что человек не различает хаос и управляемую надёжность. Он не хочет строить системы так, чтобы они реже падали, ему интересен адрена…
❤4👍4💯2🤔2
28 Feb 2026, 16:58 UTC≈1,500 views17 reactionsread 7 August 2026 Какой самый дорогой P0?
Может, вы удивитесь, но не падение кластера, не DDoS, не Kubernetes. Это обычный ALTER TABLE❗️
Именно в миграциях чаще всего горит прод. Миграция – это:
🔸Код уже новый, а данные ещё старые
🔸Реплики живут своей жизнью
🔸Часть сервисов работает на старой версии
🔸Вдобавок, кто-то зачем-то деплоит в пятницу
Разберём несколько рецептов «идеального» инцидента
1. Удалили колонку — сломали всё🙂
ALT…
🫡8❤4👍4🥴1
26 Feb 2026, 14:33 UTC≈1,610 views15 reactionsread 7 August 2026 ▫️Если ты хоть раз чинил прод в 3 ночи — ты поймёшь▫️
Посмотрите на индустрию – половина команд не может внятно сформулировать SLA. Потому что никто не договорился, кто вообще владеет сервисом и что значит «он работает»
Все ставят Grafana, рисуют красивые дашборды и… никто на них не смотрит. Постмортемы пишут ради галочки, а задачи на надежность гниют в бэклоге до следующего факапа. Мониторинг-то есть – реакции нет…
🔥12⚡2❤1
20 Feb 2026, 14:43 UTC≈1,600 views11 reactionsread 7 August 2026 🔥SRE 2026: кто подорожает х3, а кто станет не нужен
Через 3–5 лет половина SRE-ролей сильно изменится, и это нормально. Надо просто это принять.
Но важно понимать: автоматизация не убивает профессию.
🔹Что будет умирать и кому следует задуматься:
1. Ручная «админщина»
Если ваша ценность заключается в том, что вы можете зайти на сервер, перезапустить его, поправить конфиг руками, то наверное вы знаете, что это уже ав…
🔥7❤4
18 Feb 2026, 13:38 UTC≈1,300 views17 reactionsread 7 August 2026 ⚡️Если разработчики ненавидят вашу инфраструктуру — это не их проблема, а ваша.
Мы, инженеры, любим думать так: Надёжно. Масштабируемо. Задокументировано. Значит — хорошо. А для разработчика это часто выглядит иначе, например как чёрный ящик с 17 кнопками, где любая ошибка — его вина.
➡️И вот неприятная правда: инфраструктура без продуктового мышления почти всегда обречена.
🔹Почему разработчики бесятся
• Чтобы заде…
❤7🤝6🔥4
13 Feb 2026, 15:36 UTC≈1,250 views14 reactionsread 7 August 2026 Друзья, всем привет 👋🏻
Хочу продолжить наш разговор про методы поиска корневых причин.
➡️Вы наверняка это видели:
P0-инцидент. Разбор. В выводах: виновата БД, дежурный не так среагировал, неудачный релиз. Причем через месяц картина такая же, только под другим соусом.
Проблема в том, что мы часто ищем кто ошибся, а не почему система вообще позволила себе так сломаться.
Тут и появляется CAST. Разберемся, что это тако…
👍5🔥5❤3😁1
11 Feb 2026, 15:18 UTC≈1,180 views16 reactionsread 7 August 2026 ⚡️Зачем нам FMEA
Недавно в канале видел запрос про методы поиска корневых причин.
Сегодня поговорим про один из них, FMEA. Это способ заранее подумать, как именно система может сломаться, и чем это кончится. А не разбирать завалы уже после инцидента.
Расшифруем: Failure Mode and Effects Analysis— это структурированный what if?-разбор.
🔹Берём систему или процесс и по шагам отвечаем на вопросы:
• Как это может слома…
👍11❤3🔥2
Showing the 12 most recent of 20 posts we hold for @sre_community. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.