13139
Присоединяйтесь к нашему каналу и погрузитесь в мир DevOps Сотрудничество, реклама: @devmangx Менеджер: @Spiral_Yuri РКН: https://clck.ru/3P8kFH
В этом туториале пошагово разбирается полноценная GitOps-настройка на minikube: Argo CD деплоит Go-сервис напрямую из Git, а HPA масштабирует поды под нагрузкой
https://medium.com/clerion/kubernetes-gitops-from-scratch-a-hands-on-guide-with-argocd-hpa-and-karpenter-3188a99c7647
👉 DevOps Portal
В этом туториале пошагово разбирается полноценная настройка GitOps на minikube: Argo CD разворачивает Go-сервис напрямую из Git, а HPA масштабирует поды под нагрузкой
➜ https://itnext.io/sveltos-clusterpromotion-progressive-rollouts-and-the-mistake-that-made-the-architecture-better-a1471b92ee8f
👉 DevOps Portal
‼️У вас 50 алертов‼️
А какой из них реально должен разбудить в 3:00?
Когда мониторинг строится вокруг всего, что можно измерить, команда получает много данных — но не обязательно больше понимания.
Чтобы нормально разобраться сделали мини-интенсив по SRE
На нем вы работаете с надёжностью как с системой:
SLI/SLO, error budget, мониторинг, алертинг, incident response и postmortem
👉Посмотреть программу
⚡️⚡️Инциденты, Kubernetes и мок-собеседования — на DevOops 2026
Уже этой осенью на конференции DevOops 2026 будет пять практических воркшопов, где недостаточно просто слушать. Участники будут расследовать продакшен-инциденты, работать с живой инфраструктурой, собирать Kubernetes-платформу, разбираться с runtime security и проходить техническое мок-собеседование.
📆12–13 октября, Санкт-Петербург + онлайн
Здесь важен именно офлайн: эти форматы не будут транслироваться и не попадут в запись. Воркшопы и мастер-классы построены вокруг командной работы, живых стендов, вопросов участников и задач, которые нужно решать прямо в зале.
Все подробности — в карточках и на сайте.
Если интересны именно эти форматы, нужен офлайн-билет.
На месте также можно попасть на вечеринку, посмотреть стенды партнеров и остаться на живые дискуссии после каждого доклада.
🌟По промокоду: loosecode персональные билеты со скидкой.
[Купить билет]
В iximiuz Labs появился новый сложный челлендж по контейнеризации:
Отладить Go-контейнер, который перестал запускаться после недавнего изменения.
Разберите этот сценарий troubleshooting в Kubernetes
При развёртывании Kubernetes-кластера на базе kubeadm в AWS с Calico CNI можно столкнуться с таймаутами соединения между Pod'ами и CoreDNS.
Авторы столкнулись с этой проблемой и подготовили подробную статью, в которой разобрали:
- почему возникает эта проблема;
- как пошагово её диагностировать;
- реальную первопричину;
- как сетевая инфраструктура AWS взаимодействует с Calico;
- как правильно исправить проблему.
Читать статью:
https://blog.techiescamp.com/docs/fix-dns-timeout-kubeadm-calico-aws/
👉 DevOps Portal
🤖 DevOps в эпоху AI трансформации: что работает уже сейчас!
17 сентября Сбер собирает DevOps-инженеров, SRE и платформенные команды на встречу о том, как AI меняет работу с инфраструктурой, релизами и безопасностью.
Обсудим:
🔘Platform Engineering и IDP: как строить внутренние платформы без лишней сложности
🔘Agentic engineering: каких агентов уже можно доверить пайплайнам
🔘Security на скорости: как закрывать уязвимости, когда счет идет на часы
Своим опытом поделятся практики из Авито, Сбера, Cloud․ru и Т-Банка.
Встречаемся 17 сентября в 17:00 в Сбер.Среде (Москва, Земляной Вал 9А) или онлайн. Мест всего 150 — успей занять своё по ссылке!
Мощнее — не значит дороже
Главные расходы при расширении 1С и баз данных — это не само железо, а лицензии ПО за каждое ядро.
Оптимизировать затраты можно с помощью высокочастотных процессоров. Selectel запустил кластер AMD HiFreq в публичном облаке на базе VMware. Частота процессоров до 4.8 ГГц позволяет получить нужную производительность на меньшем количестве ядер.
Высокая частота процессоров сглаживает разницу в производительности при переходе с Oracle и MS SQL на российские СУБД: Postgres Pro, Tantor и другие. Быстрые диски снимают ограничения при обработке тяжелых нагрузок в 1С и аналитике.
Рассчитайте стоимость в удобном калькуляторе и разверните кластер для ваших задач: https://slc.tl/0r7gf
Реклама. АО "Селектел". erid:2W5zFHFQWR7
Как понять, что пора перейти из сисадмина в DevOps⚡️
Собрали карту навыков на 2026 год — чтобы не хвататься за всё подряд, а двигаться по чёткой траектории.
Что внутри:
✅6 уровней - от Linux и Bash до Kubernetes и мониторинга. Видно, что идёт за чем и почему.
✅Что реально спрашивают на собеседованиях - конкретные вопросы и то, какой ответ от тебя ждут.
✅Чек-листы для самопроверки на каждом уровне - сразу видно, где пробел, а что уже закрыто.
✅Интерпретация результата - сколько пунктов чек-листа нужно закрыть, чтобы считать себя готовым к позиции DevOps Junior.
Особенно полезно, если давно администрируешь серверы руками и хочешь понять, в каком порядке закрывать пробелы, а не учить технологии вслепую.
Забрать карту навыков 👉 ПОЛУЧИТЬ КАРТУ НАВЫКОВ
Когда ты уже станешь настоящим DevOps?
Открываешь вакансию: Linux, Docker, Kubernetes, CI/CD, сети…
Закрываешь вакансию.
Полгода учишься и всё ещё не понимаешь: «А меня уже возьмут?»
Проверь это в бесплатном тесте Pigeon Careers.
За 4–5 минут узнаешь:
✅ что уже знаешь
✅ где пробелы
✅ что учить дальше
✅ сколько примерно осталось до первой работы
Можно также сравнить DevOps с аналитикой и Python.
Без покупки курса и многочасовых лекций.
Кстати, Pigeon Careers помогли устроиться 20+ ребятам за последний год. Средний оффер — 245к.
Пройти тест: @test
keda-gpu-scaler — это внешний scaler для KEDA, который считывает GPU-метрики через NVML на каждом узле. Благодаря этому deployments с vLLM и Triton масштабируются по реальной нагрузке на GPU, а не по CPU, включая scale-to-zero
➜ https://github.com/pmady/keda-gpu-scaler
👉 DevOps Portal
Разворачиваем Llama 3 с Docker и vLLM
Запуск LLM – это не просто поднять контейнер.
Здесь важны производительность, память и эффективное использование GPU.
В этом гайде разберём:
- Настройку GPU-окружения: Docker + NVIDIA Runtime
- Деплой модели с Llama и vLLM
- Оптимизацию памяти с помощью флага --gpu-memory-utilization, чтобы сбалансировать VRAM между весами модели и KV Cache
- Техники квантизации, которые позволяют увеличить throughput более чем в 2 раза — с 1,62 до 3,64 req/s — и вдвое сократить потребление VRAM
- Как работает Continuous Batching
Подробный гайд:
https://devopscube.com/deploying-llama-with-docker-and-vllm/
Следуя экспериментам по оптимизации из гайда, можно получить:
- рост общего throughput в 2,2 раза
- Time to First Token (TTFT) в 3 раза быстрее
- от 5 до 20+ одновременных пользователей на том же железе — NVIDIA RTX 4000
Примечание: этот гайд предназначен для обучения и экспериментов. Используйте его, чтобы разобраться в основных концепциях.
👉 DevOps Portal
Все мониторят поды, но почти никто не следит за этим критически важным компонентом
А потом в Kubernetes-кластере что-то ломается – и внезапно etcd становится самым важным компонентом всей инфраструктуры.
Потому что etcd – это мозг Kubernetes.
Каждый Deployment, Secret, ConfigMap и Node хранится в etcd в виде данных.
И вот что многие понимают неправильно:
Только API Server взаимодействует с etcd напрямую.
Поэтому если с etcd возникают проблемы, кластер перестаёт принимать любые новые изменения. Вы не сможете ничего задеплоить, масштабировать или обновить.
Даже сейчас многие инженеры допускают базовые ошибки при работе с etcd.
Не делают регулярные бэкапы. Запускают etcd на том же диске, где находится ОС. Или игнорируют проблемы с latency в распределённых конфигурациях.
В продакшене etcd должен работать на быстрых SSD и быть изолирован от других workloads. Бэкапы должны выполняться автоматически.
В подробном гайде разобрали бэкап и восстановление etcd
Читать: https://devopscube.com/backup-etcd-restore-kubernetes/
👉 DevOps Portal
Подборка всегда актуальных DevOps-песочниц
В каждой песочнице можно запустить до 5 Linux VM и использовать окружение до 24 часов:
* Ubuntu 26.04, Debian Trixie, Fedora 44
* Kubernetes 1.37, Docker и Podman
* Go 1.27, Python 3.14, Node 26
Практикуйтесь как профи: https://labs.iximiuz.com/playgrounds
👉 DevOps Portal
Kubernetes In-Place Pod Resize
Раньше в Kubernetes нельзя было изменить CPU или memory для уже запущенного Pod без его перезапуска.
Но функция In-Place Pod Resize решает эту проблему.
Вот подробный материал, в котором разобрали:
* Что такое In-Place Pod Resize
* Как это работает под капотом
* Зачем нужен VPA для изменения ресурсов Pod без перезапуска
* Что происходит, если на ноде не хватает ресурсов
* Когда стоит использовать Resize Policy
* С какими проблемами можно столкнуться при уменьшении ресурсов и многое другое
https://devopscube.com/vpa-in-place-pod-resize
👉 DevOps Portal
🎇Главная идея DevSecOps: безопасность перестаёт тормозить разработку.
Вместо проверок «после релиза» всё встроено в пайплайн: код проходит SAST, контейнеры сканируются, инфраструктура проверяется на комплайенс. В итоге релизы выходят быстрее и при этом безопаснее.
Этому и учит курс DevSecOps от Академии Codeby на практике:
⏺️9 модулей, 48 занятий, 90% практики
⏺️Стек: Docker, Kubernetes, Terraform, Vault, Ansible, Prometheus
⏺️Финальный экзамен в стиле OSCP — только реальные задачи
⏺️Авторы — практики: внедрение Zero Trust, построение SOC, разработка DevSec-инструментов под Burp Suite
Инженеры, которые умеют встраивать безопасность в CI/CD, сегодня в дефиците на стыке ИБ и DevOps — компании поняли, что «сначала сделать, потом чинить» обходится дороже.
👉 Старт курса 5 октября
➡️️️Программа и регистрация
Бесплатная консультация — @CodebyAcademyBot
Как conntrack обеспечивает работу Kubernetes Services
В этом гайде вы разберётесь, как работает conntrack на реальных сценариях Kubernetes-сетей, и поймёте, почему он играет критически важную роль в работе Kubernetes Services, kube-proxy, NAT и DNS-трафика.
Вы узнаете:
- что такое conntrack и зачем он нужен;
- почему Kubernetes Services зависят от него;
- как посмотреть таблицу conntrack;
- что происходит, когда таблица переполняется;
- как диагностировать и устранять исчерпание conntrack в продакшене.
Подробный гайд:
https://newsletter.devopscube.com/p/conntrack-in-kubernetes
👉 DevOps Portal
kubectl tree — плагин для kubectl, который проходит по ownerReferences и выводит полное дерево объектов под Deployment или кастомным ресурсом, чтобы было видно, какой объект что создал.
➜ https://github.com/ahmetb/kubectl-tree
👉 DevOps Portal
Изучайте Linux-сети на практике
Новый практический челлендж — потренируйтесь разбираться в сетевой конфигурации Linux-хостов: находить имена интерфейсов, IP- и MAC-адреса, шлюз по умолчанию, а также определять, какие маршруты сервер использует для доступа к разным адресам.
https://labs.iximiuz.com/challenges/linux-inspect-network-interfaces-and-routes
👉 DevOps Portal
Гринатом — ИТ-интегратор Росатома — ищет системного администратора виртуализации в Нижнем Новгороде!💼
Мы ищем специалиста с глубокими знаниями Linux и опытом администрирования высоконагруженных инфраструктур, систем виртуализации и распределённых хранилищ. Важно уверенно работать с LDAP, Kerberos, мониторингом, логами и системными метриками, а также владеть Bash и Python для автоматизации задач.
✅От нас — все возможности для комфортной работы: от ДМС со стоматологией до скидок от партнёров. А ещё в первые месяцы вас ждут обучение, внутренние аттестации и получение сертификатов по продуктам.
Hermes Agent Operator запускает AI-агентов Hermes в Kubernetes как кастомные ресурсы, поэтому конфигурация, навыки и рабочее пространство каждого агента хранятся в одном манифесте, а не разбросаны по чьему-то ноутбуку.
➜ https://github.com/hermeum/hermes-agent-operator
👉 DevOps Portal
GitLab Architecture: A Complete Guide
В этом вводном гайде вы узнаете:
- Основные компоненты GitLab
- Хранилище GitLab
- Высокая доступность и масштабируемость
- Аутентификация и авторизация
- Мониторинг GitLab с помощью Prometheus и Grafana
Подробное руководство: https://devopscube.com/gitlab-architecture/
👉 DevOps Portal
Самый красивый сайт, который я сегодня видел:
https://kubernetes3d.com/rack
Он визуализирует кластер Kubernetes в виде серверной стойки, причём всё выполнено в полноценном 3D - выглядит действительно впечатляюще. Есть отдельные виды спереди, сзади и сбоку, и каждый показывает один и тот же кластер с разных ракурсов. Настоящее произведение искусства.
Обратите внимание: все кнопки и сцены здесь интерактивны, поэтому сайт отлично подходит ещё и для изучения концепций. Я уже довольно долго с ним играюсь
👉 DevOps Portal
Новый челлендж по Kubernetes на iximiuz Labs:
Получите доступ к приватному Kubernetes-кластеру через SSH SOCKS-прокси 🧙♂️
Попрактикуйтесь в удобном способе подключения к Kubernetes API Server без проброса конкретного порта и без необходимости менять адрес сервера в kubeconfig:
https://labs.iximiuz.com/challenges/access-kubernetes-api-through-ssh-socks-proxy
👉 DevOps Portal
Что такое Distroless-образ контейнера? 🧐
Go известен своими статически слинкованными бинарниками. Можно взять исполняемый файл Go, положить его в контейнер с FROM scratch - и на этом закончить.
Но у такого подхода есть несколько проблем...
1. В контейнерах FROM scratch нет нормального управления пользователями
Базовый образ scratch — это буквально пустой образ. Поэтому файлов /etc/passwd и /etc/group там просто нет.
Из-за этого контейнеризированный процесс в большинстве случаев запускается от root.
2. В FROM scratch отсутствуют некоторые важные директории/tmp, /root, /home, /var, /etc — ничего из этого в scratch-контейнере нет, если, конечно, вы не примонтируете нужные директории самостоятельно.
Из-за этого приложение может работать некорректно — попробуйте, например, создать временный файл и посмотрите, что произойдёт 😉
3. В FROM scratch нет CA-сертификатов и данных о часовых поясах
Нужно обратиться к HTTPS-эндпоинту? Не получится.
Нужно выполнить преобразование времени между часовыми поясами? Тоже не получится.
4. В FROM scratch нет runtime вашего языка
Если поддержка статической линковки в вашем языке не настолько хороша, как в Go, либо приложению нужен интерпретатор или runtime-окружение, использовать scratch-контейнеры становится практически невозможно.
Distroless-образы как раз решают эти проблемы, при этом оставаясь максимально близкими к подходу FROM scratch.
Хороший пример — проект GoogleContainerTools/distroless. В нём есть следующие базовые образы:
- distroless/static = scratch + структура директорий, похожая на обычный дистрибутив, /etc/{passwd,group}, CA-сертификаты и данные о часовых поясах
- distroless/base = distroless/static + glibc
- distroless/cc = distroless/base + libgcc
Также есть несколько специализированных под конкретные языки, но всё ещё distroless-образов:
- distroless/java — для Java 17, 21 и 25
- distroless/nodejs — для Node.js 22, 24 и 26
- distroless/python3 — соответственно, для Python 3
Но существуют и другие проекты и продукты.
Подробнее о distroless-образах - в туториале iximiuz Labs:
https://labs.iximiuz.com/tutorials/gcr-distroless-container-images
👉 DevOps Portal
🐧 Хочешь освоить Linux и Python, но без скучных лекций и боли?
В PyLinux всё по-другому:
🔵 Простые объяснения, даже сложных тем
🔵 Полезные скрипты и примеры
🔵 Книги, шпаргалки, гайды
🔵 и многое другое....
👉 Всё, чтобы ты рос в IT без стресса и хаоса!
Друзья!
Осенью этого года в День тестировщика 9 сентября в Москве пройдет очередная ежегодная конференция по обеспечению качества ИТ-систем «Перфоманс Конф 12».
Формат: онлайн и оффлайн
Конференция полезна инженерам по нагрузочному тестированию, руководителям отделов QA, DevOps, SRE-специалистам и всем тем, кто занимается производительностью, надёжностью и нагрузкой.
На мероприятии выступят спикеры из таких компаний, как: VK, Сбер, Т‑Банк, Yandex.Cloud и многих других. Без воды, только практика.
Вся дополнительная информация на сайте https://perfconf.ru и в канале конференции: /channel/performanceconf
В этой статье рассказывается, как спроектировать AI-агента для SRE-задач, который анализирует алерты, логи, данные Kubernetes, ранбуки, деплои и сигналы observability, чтобы диагностировать инциденты и предлагать безопасные действия.
https://blog.stackademic.com/building-an-ai-agent-that-runs-your-sre-operations-what-i-learned-what-works-and-how-you-can-do-8a3801124bdc
👉 DevOps Portal
На Stepik запустили годный курс по «Troubleshooting Docker и Kubernetes: поиск и устранение проблем»
В программе только важные аспекты:
— troubleshooting Docker и образов
— диагностика сетевых проблем
— настройка readiness/liveness probes
— отладка pod’ов, деплоев и ingress
— анализ логов контейнеров и кластера
— разбор ошибок CrashLoopBackOff, OOMKilled, ImagePullBackOff и других
Собеседования на DevOps/SRE сейчас всё чаще строятся вокруг реальных инцидентов. Данный курс фокусируется именно на таких сценариях и помогает в подготовке к практическим вопросам
48 часов доступен со скидкой 25%
↗️ Пройти курс на Stepik
DevOps-инструмент недели: RAGFlow
Собрать RAG-пайплайн с нуля - непростая задача.
Нужно самостоятельно реализовать:
• Парсинг документов
• Чанкинг и создание эмбеддингов
• Хранение в векторной базе
• Логику поиска и re-ranking
При этом большинство документов - это далеко не чистый текст: в них есть таблицы, изображения, отсканированные страницы и сложное форматирование.
Для базового RAG-пайплайна корректно обрабатывать всё это может быть сложно.
Здесь и помогает RAGFlow.
RAGFlow — open-source RAG-движок, который умеет работать со сложными и плохо структурированными документами, отвечать на вопросы по их содержимому и показывать, из каких источников были взяты данные.
Вот что он умеет
• Парсит сложные документы: PDF с таблицами, сканы, Word, Excel, изображения и веб-страницы
• Использует шаблонный чанкинг, позволяя контролировать, как именно документы разбиваются на части
• Показывает, какие именно чанки использовались для каждого ответа, чтобы можно было отследить источники
• Синхронизирует данные из S3, Notion, Confluence, Google Drive и Discord
• Поддерживает агентные workflows и MCP
• Работает с любыми LLM и моделями эмбеддингов
https://github.com/infiniflow/ragflow.git
👉 DevOps Portal