11 Feb 2026, 12:45 UTC729 views9 reactionsread 7 August 2026 🥊 Helm vs Kustomize: Вечная битва или идеальный симбиоз?
Салют! 👋
Сегодня затронем тему, из-за которой в курилках девопсов доходит до драки. Как управлять манифестами?
В левом углу ринга - Helm (пакетный менеджер, шаблоны, {{ .Values }}).
В правом углу - Kustomize (оверлеи, патчи, native k8s).
Многие пытаются выбрать один инструмент на всё. И это ошибка. Давайте разберем, где каждый из них король.
⚓️ Helm: Корол…
❤4😱3👍1💩1
30 Jan 2026, 09:31 UTC700 views5 reactionsread 7 August 2026 ⚖️ Requests vs Limits: Почему твой под тормозит на пустой ноде?
Всем привет! 👋 Сегодня о наболевшем - о ресурсах в Kubernetes.
Я часто вижу манифесты, где секция resources либо отсутствует вовсе ("пусть берет сколько надо"), либо настроена "на глаз". А потом начинаются вопросы: "Почему приложение тупит, хотя CPU загружен на 5%?" или "Почему мой под постоянно убивает OOMKilled?"
Давайте разберем главную ловушку нов…
👍5
28 Jan 2026, 15:05 UTC599 views5 reactionsread 7 August 2026 🛑 Не убивай меня сразу! Настраиваем Graceful Shutdown
Коллеги, бывало такое? Вы делаете kubectl rollout restart, Kubernetes обещает бесшовное обновление, но в момент переключения подов пару юзеров все равно ловят 502 Bad Gateway или обрывы соединений.
Проблема часто не в балансировщике, а в том, что ваше приложение не умеет "красиво уходить" (Graceful Shutdown).
Когда Kubernetes хочет остановить под, происходит сл…
👍4🤩1
27 Jan 2026, 15:58 UTC546 views6 reactionsread 7 August 2026 🚑 HEALTHCHECK: Спасательный круг или выстрел в ногу?
Продолжаем тему стабильности. Сегодня про Healthchecks (в Docker) и Probes (в K8s).
Казалось бы, что сложного? Написал curl -f http://localhost/ || exit 1 и пошел пить кофе. Но именно такие "простые" решения часто становятся причиной того, что ваш прод лежит, хотя нагрузка детская.
Разберем две крайности и как делать правильно.
❌ Ошибка №1: "Зомби-апокалипсис" …
👍4👏1🔥1
11 Jan 2026, 07:54 UTC818 views13 reactionsread 7 August 2026 🐳 Хватит тащить curl и vim в продакшн! (Используем Ephemeral Containers)
Салют, коллеги, всех с прошедшими праздниками! 👋
Сколько раз я видел Dockerfile, который начинается за здравие (FROM alpine), а заканчивается установкой половины интернета: apk add curl vim net-tools bind-tools...?
Аргумент всегда один: "Ну мне же надо как-то дебажить, если под отвалится!"
В итоге мы получаем:
1. Раздутый образ. (Платим за …
👍13
17 Dec 2025, 08:15 UTC920 views7 reactionsread 7 August 2026 Photo
Одна из самых недооценённых вещей в DevOps - подготовленные сценарии отказов.
Большинство инцидентов выглядят одинаково:
💚 02:37 ночи
💚 CPU 100%, latency растёт
💚 кто-то пишет «у нас всё легло?»
💚 начинается хаотичный SSH-тур по серверам
Проблема не в том, что система упала.
Проблема - никто не знает, что делать дальше.
Что реально спасает
Runbook, но не «для галочки».
Хороший runbook - это:
✅ конкретный триг…
👍4👎2❤1
9 Dec 2025, 20:48 UTC927 views5 reactionsread 7 August 2026 Почему операционные runbook - это спасение, а не бюрократия
Когда случается инцидент, мозг отключается первым.
Остаются только привычка и инструкции.
Хороший runbook - это документ, который:
1. Снимает стресс
Когда всё горит, видеть перед собой понятный чеклист - половина успеха.
Меньше паники - меньше ошибок.
2. Повышает MTTR
Чёткие шаги ➞ предсказуемые действия ➞ быстрый возврат сервиса.
3. Уменьшает bus-fac…
👍4❤1
28 Nov 2025, 04:04 UTC≈3,120 views7 reactionsread 7 August 2026 Почему большинство инцидентов происходят ночью?
Если посмотреть на статистику SRE-команд, почти 70% серьёзных инцидентов случаются после 23:00. Причина не в “мистике”, а в том, что ночью сходятся три фактора:
1. Накопленный technical debt
Патчи, которые “временно” залили месяц назад, начинают стрелять именно в момент минимального трафика - когда сервисы активнее пересобираются, переезжают, чистят очереди, крутят бэ…
👍7
24 Nov 2025, 06:02 UTC731 views2 reactionsread 7 August 2026 Почему сервисы «плывут» после релиза
Одна из самых болезненных проблем, когда вроде всё протестировано, всё зелёное, деплой успешен… а сервис внезапно начинает деградировать под реальной нагрузкой.
3 причины, которые чаще всего находил на проде:
1. Непредсказуемые паттерны трафика
Локальные и staging-тесты воспроизводят лишь типовые сценарии. Пользователи же способны создать такие комбинации запросов, о которых…
👍2
20 Nov 2025, 08:12 UTC694 views2 reactionsread 7 August 2026 Тестирование отказоустойчивости: как DevOps проверяет «что будет, если всё сломается»
Что стоит тестировать регулярно:
1. Падение ноды/инстанса
Проверка, что оркестратор (Kubernetes, Nomad) перезапускает поды и перераспределяет нагрузку.
2. Недоступность внешних сервисов
Отказы DNS, очередей, баз. Важно увидеть, где нет таймаутов и ретраев.
3. Замедление дисков и сети
Часто не «падает», а деградирует. М…
👍2
13 Nov 2025, 20:38 UTC846 views7 reactionsread 7 August 2026 Как я тестирую отказоустойчивость сервисов без боли и слёз
Один из самых частых вопросов в работе SRE а что будет, если упадёт X?
Чтобы не гадать, я регулярно использую небольшой собственный «чеклист хаоса». Он простой, но реально спасает от катастроф.
1. Отключаю один из инстансов сервиса
Если балансировщик начинает вести себя странно - фиксирую. Часто проблемы всплывают именно в момент деградации, а не отказа.
…
👍7
23 Oct 2025, 09:05 UTC≈1,150 views3 reactionsread 7 August 2026 🚨 Когда “сам себя перезапустил” — это не баг, а фича
Недавно один под обетом «никогда больше не трогать продакшн ночью» всё-таки зашёл “на минутку”.
Проверил pods, увидел CrashLoopBackOff, сделал kubectl delete pod, и - чудо - всё ожило!
Только через 10 минут понял, что просто три раза подряд перезапустил контейнер с тем же багом.
Moral of the story:
Не каждый автоперезапуск - спасение. Иногда Kubernetes просто смо…
👍3
Showing the 12 most recent of 20 posts we hold for @devopslib. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.