SRE-инженер отвечает за три базовых участка работы: определять измеримые показатели надёжности; автоматизировать эксплуатационные операции; проектировать мониторинг и алерты. Итог оценивают по конкретному результату — например, «sLI/SLO и политика error budget» — и по тому, может ли команда этот результат проверить, использовать и поддерживать.
Опытным инженерам, которым интересно измерять и улучшать надёжность сложных сервисов с помощью программирования и системных практик. До покупки курса попробуйте одну небольшую задачу из профессии и разберите требования в свежих вакансиях. Так вы проверите интерес к реальной работе, а не к образу профессии.
SRE отличается от реактивной эксплуатации: команда задаёт цели надёжности, управляет допустимым риском и системно уменьшает ручной труд. В вакансии сверяйте название с задачами, полномочиями и критериями готовности. Если под одной должностью перечислены несколько полноценных ролей, заранее уточните приоритеты и состав команды.
Кто такой SRE-инженер и какой результат он создаёт
Главный результат роли — sLI/SLO и политика error budget. Чтобы получить его, нужно определять измеримые показатели надёжности, а затем доказать качество: воспроизвести расчёт, пройти проверку, показать метрику или передать понятный рабочий материал.
Junior выполняет ограниченную часть этой работы по известному процессу и часто сверяет решения. Middle самостоятельно ведёт участок «автоматизировать эксплуатационные операции». Senior отвечает за системные последствия, разбирает риск «не превращать мониторинг сотрудников в скрытое наблюдение» и улучшает способ работы всей команды.
Профессия подойдёт тем, кто готов развивать спокойствие, системное мышление, культура без обвинений. Проверьте себя на практике: возьмите проект «sLO и error budget для учебного сервиса» и доведите его до состояния, когда другой человек сможет проверить ход решения без устных пояснений.
Чем профессия отличается от соседних ролей
- DevOps улучшает взаимодействие разработки и эксплуатации; SRE формализует надёжность через SLI/SLO и error budget.
- Системный администратор поддерживает инфраструктуру, но не всегда пишет код и управляет продуктовой надёжностью.
- Backend-разработчик отвечает за функцию сервиса, SRE — за системные свойства в production.
Границу роли проверяйте по владельцу результата «sLI/SLO и политика error budget». На собеседовании спросите, кто ставит задачу, кто принимает итог и с кем придётся согласовывать смежные решения. Ответ покажет реальный объём ответственности точнее названия вакансии.
Специализации и отрасли
Две частые траектории — Service reliability и Observability. Новичку не нужно выбирать специализацию навсегда: достаточно взять один проект, изучить типовые вакансии и понять, какие задачи повторяются именно в выбранном сегменте.
Распространённые специализации
- Service reliability
- Observability
- Incident management
- Capacity и performance engineering
Где востребована роль
- Финтех
- Маркетплейсы
- Телеком
- Облачные и высоконагруженные платформы
Роль встречается в таких отраслях, как Финтех, Маркетплейсы, Телеком. Вместе с отраслью меняются данные, регламенты и цена ошибки. Для первой работы важнее не громкость бренда, а доступ к ревью, понятные критерии качества и возможность закончить цельный участок работы.
Чем занимается SRE-инженер
1. Определять измеримые показатели надёжности
Рабочий результат: sLI/SLO и политика error budget. До начала работы специалист уточняет критерий готовности и ограничения, а после — оставляет доказательство, по которому коллега может проверить решение.
Контроль качества: посчитать и выбрать SLO. Отдельно учитывают риск: не превращать мониторинг сотрудников в скрытое наблюдение.
2. Автоматизировать эксплуатационные операции
Рабочий результат: дашборд и алерты по симптомам. До начала работы специалист уточняет критерий готовности и ограничения, а после — оставляет доказательство, по которому коллега может проверить решение.
Контроль качества: провести диагностику инцидента. Отдельно учитывают риск: проводить разбор без поиска виноватых.
3. Проектировать мониторинг и алерты
Рабочий результат: blameless postmortem. До начала работы специалист уточняет критерий готовности и ограничения, а после — оставляет доказательство, по которому коллега может проверить решение.
Контроль качества: спроектировать мониторинг и алерты. Отдельно учитывают риск: ограничивать автоматические действия и проверять rollback.
4. Координировать реакцию на инциденты
Рабочий результат: автоматизация toil и runbook. До начала работы специалист уточняет критерий готовности и ограничения, а после — оставляет доказательство, по которому коллега может проверить решение.
Контроль качества: объяснить безопасный релиз и capacity plan. Отдельно учитывают риск: не превращать мониторинг сотрудников в скрытое наблюдение.
5. Проводить постмортемы без поиска виноватых
Рабочий результат: sLI/SLO и политика error budget. До начала работы специалист уточняет критерий готовности и ограничения, а после — оставляет доказательство, по которому коллега может проверить решение.
Контроль качества: посчитать и выбрать SLO. Отдельно учитывают риск: проводить разбор без поиска виноватых.
6. Планировать ёмкость и устойчивость систем
Рабочий результат: дашборд и алерты по симптомам. До начала работы специалист уточняет критерий готовности и ограничения, а после — оставляет доказательство, по которому коллега может проверить решение.
Контроль качества: провести диагностику инцидента. Отдельно учитывают риск: ограничивать автоматические действия и проверять rollback.
В небольшой команде один специалист может пройти весь цикл — от «определять измеримые показатели надёжности» до «планировать ёмкость и устойчивость систем». В крупной компании участок уже, но больше зависимостей, проверок и требований к передаче результата.
Инфографика 2 из 5
Рабочий цикл: SRE-инженер
Определять измеримые показатели надёжности
Автоматизировать эксплуатационные операции
Проектировать мониторинг и алерты
Координировать реакцию на инциденты
Проводить постмортемы без поиска виноватых
Схема показывает не должностную инструкцию, а повторяемый цикл: от постановки задачи до результата, который можно проверить и передать команде.
Что остаётся после работы: результаты и артефакты
- SLI/SLO и политика error budget
- Дашборд и алерты по симптомам
- Blameless postmortem
- Автоматизация toil и runbook
Артефакт «sLI/SLO и политика error budget» должен содержать контекст, принятое решение и способ проверки. Второй человек должен понять ограничения и продолжить работу без пересказа автора. В портфолио показывайте не только финальный экран или файл, но и цепочку «задача → решение → проверка».
Мини-проверка перед передачей. Сначала попробуйте «посчитать и выбрать SLO» на собственном результате. Затем дайте материал коллеге без устных пояснений и попросите воспроизвести вывод или следующий шаг. Добавьте один ошибочный либо граничный сценарий, зафиксируйте вводные, версию данных или инструмента и известные ограничения. Если проверка зависит от внешней системы, сохраните доказательство: лог, расчёт, запись теста или контрольный скриншот. Работа не завершена, пока команда не понимает риск «не превращать мониторинг сотрудников в скрытое наблюдение» и способ безопасного исправления.
Как выглядит рабочий день
Типовой рабочий цикл выглядит так: определять измеримые показатели надёжности → автоматизировать эксплуатационные операции → проектировать мониторинг и алерты → координировать реакцию на инциденты. Между этапами специалист уточняет вводные, показывает промежуточный результат и фиксирует решение. Поэтому день делится между самостоятельной работой, короткими обсуждениями и проверкой качества.
Junior чаще получает готовую постановку и ревью по артефакту «sLI/SLO и политика error budget». Middle сам уточняет требования и отвечает за цельный участок. Senior разбирает системные риски, помогает коллегам и меняет процесс, если одна и та же ошибка повторяется.
На удалёнке особенно нужны спокойствие и системное мышление. Решения, блокировки и договорённости фиксируют письменно. Если срок или качество под угрозой, об этом сообщают до дедлайна вместе с вариантами действий.
Что нужно знать и уметь
1. Linux и сети
Осваивайте навык на задаче «sLO и error budget для учебного сервиса». Рабочий инструмент для первого подхода — Kubernetes. Результат обучения можно считать устойчивым, когда вы способны объяснить выбор, найти ошибку без подсказки и назвать ограничения своего решения.
2. Программирование
Осваивайте навык на задаче «наблюдаемость с полезными алертами и трассировкой». Рабочий инструмент для первого подхода — Prometheus. Результат обучения можно считать устойчивым, когда вы способны объяснить выбор, найти ошибку без подсказки и назвать ограничения своего решения.
3. Распределённые системы
Осваивайте навык на задаче «chaos-сценарий, runbook и постмортем с планом улучшений». Рабочий инструмент для первого подхода — Grafana. Результат обучения можно считать устойчивым, когда вы способны объяснить выбор, найти ошибку без подсказки и назвать ограничения своего решения.
4. SLI, SLO и error budgets
Осваивайте навык на задаче «sLO и error budget для учебного сервиса». Рабочий инструмент для первого подхода — OpenTelemetry. Результат обучения можно считать устойчивым, когда вы способны объяснить выбор, найти ошибку без подсказки и назвать ограничения своего решения.
5. Наблюдаемость
Осваивайте навык на задаче «наблюдаемость с полезными алертами и трассировкой». Рабочий инструмент для первого подхода — Terraform. Результат обучения можно считать устойчивым, когда вы способны объяснить выбор, найти ошибку без подсказки и назвать ограничения своего решения.
6. Управление инцидентами
Осваивайте навык на задаче «chaos-сценарий, runbook и постмортем с планом улучшений». Рабочий инструмент для первого подхода — Python или Go. Результат обучения можно считать устойчивым, когда вы способны объяснить выбор, найти ошибку без подсказки и назвать ограничения своего решения.
Рабочие инструменты
- Kubernetes
- Prometheus
- Grafana
- OpenTelemetry
- Terraform
- Python или Go
Для первого проекта хватит набора: Kubernetes, Prometheus, Grafana. Добавляйте следующий инструмент, когда текущий упирается в конкретное ограничение. На собеседовании важнее объяснить выбор и проверить результат, чем перечислить все программы из вакансии.
Гибкие навыки
- Спокойствие
- Системное мышление
- Культура без обвинений
- Приоритизация риска
- Письменная коммуникация
Гибкие навыки проверяют по поведению, а не по самооценке. Для этой роли особенно нужны спокойствие и системное мышление: специалист задаёт уточняющие вопросы, предупреждает о риске и спокойно разбирает замечания. Тренировать это можно уже в учебном проекте через ревью и короткую письменную ретроспективу.
Инфографика 3 из 5
Карта компетенций
Профессиональная база
- Linux и сети
- Программирование
- Распределённые системы
- SLI, SLO и error budgets
- Наблюдаемость
- Управление инцидентами
Рабочий набор
- Kubernetes
- Prometheus
- Grafana
- OpenTelemetry
- Terraform
- Python или Go
Командная зрелость
- Спокойствие
- Системное мышление
- Культура без обвинений
- Приоритизация риска
- Письменная коммуникация
Junior, middle и senior: чем различается ответственность
| Уровень | Тип задачи | Самостоятельность | Критерий результата |
|---|---|---|---|
| Junior | Ограниченная задача с известным контекстом | Регулярно сверяет план и получает ревью | Корректно выполнено, проверено и понятно описано |
| Middle | Цельный участок с несколькими вариантами решения | Сам уточняет вводные, оценивает срок и риск | Результат устойчив в рабочих сценариях и не создаёт скрытого долга |
| Senior | Неопределённая системная проблема | Формирует подход, согласует компромиссы и помогает команде | Улучшены не только решение, но и повторяемый способ работы |
В этой профессии грейд определяют по масштабу задачи, самостоятельности и цене ошибки, а не по числу лет. В резюме покажите, как менялась ваша роль в задаче «определять измеримые показатели надёжности»: какие решения вы принимали сами и кто проверял итог.
Пошаговый план обучения
На базовую подготовку закладывайте 14–24 месяцев. Срок зависит от исходной базы и недельной нагрузки; он не гарантирует оффер. Переходите к следующему этапу после самостоятельного результата, например «sLI/SLO и политика error budget», а не после последнего просмотренного урока.
Этап 1. Получить опыт разработки или системной эксплуатации
Контрольная точка этапа — sLI/SLO и политика error budget. Ограничьте теорию тем, что нужно для этой работы, затем проверьте результат на ошибочном или граничном сценарии и зафиксируйте следующий пробел.
Этап 2. Углубить Linux, сети и распределённые системы
Контрольная точка этапа — дашборд и алерты по симптомам. Ограничьте теорию тем, что нужно для этой работы, затем проверьте результат на ошибочном или граничном сценарии и зафиксируйте следующий пробел.
Этап 3. Освоить метрики, логи и трассировки
Контрольная точка этапа — blameless postmortem. Ограничьте теорию тем, что нужно для этой работы, затем проверьте результат на ошибочном или граничном сценарии и зафиксируйте следующий пробел.
Этап 4. Научиться формулировать SLI и SLO
Контрольная точка этапа — автоматизация toil и runbook. Ограничьте теорию тем, что нужно для этой работы, затем проверьте результат на ошибочном или граничном сценарии и зафиксируйте следующий пробел.
Этап 5. Практиковать автоматизацию, нагрузку и отказоустойчивость
Контрольная точка этапа — sLI/SLO и политика error budget. Ограничьте теорию тем, что нужно для этой работы, затем проверьте результат на ошибочном или граничном сценарии и зафиксируйте следующий пробел.
Этап 6. Провести учебный инцидент и оформить постмортем
Контрольная точка этапа — дашборд и алерты по симптомам. Ограничьте теорию тем, что нужно для этой работы, затем проверьте результат на ошибочном или граничном сценарии и зафиксируйте следующий пробел.
Раз в четыре недели сравнивайте план с вакансиями и практикой. Если тема не помогает освоить «определять измеримые показатели надёжности» или собрать «sLO и error budget для учебного сервиса», отложите её. Освободившееся время направьте на повторяющийся пробел.
Инфографика 4 из 5
Маршрут на 14–24 месяцев
- 1
1–5 мес.
База
Linux и сети
- 2
6–14 мес.
Практика
Kubernetes + Prometheus
- 3
14–19 мес.
Портфолио
Определять измеримые показатели надёжности
- 4
19–24 мес.
Выход на рынок
Отклики, интервью и разбор пробелов
Переходите к следующему этапу по готовому результату, а не по числу просмотренных уроков. Срок — ориентир при регулярной практике, а не гарантия оффера.
Вуз, курс или самостоятельное обучение
| Маршрут | Сильная сторона | Ограничение | Кому подходит |
|---|---|---|---|
| Вуз или колледж | Фундамент, среда и длинная практика | Не гарантирует актуальный прикладной стек | Тем, кому важна широкая база и диплом для выбранной отрасли |
| Онлайн-курс | Структура, дедлайны и обратная связь | Качество программ различается, оффер не гарантирован | Тем, кому нужен управляемый маршрут и ревью |
| Самостоятельно | Гибкость и низкая стоимость | Сложнее заметить пробелы и получить качественную проверку | Тем, кто умеет планировать и находить практиков для обратной связи |
Маршруты можно сочетать. Считайте не только цену курса, но и время, оборудование, подписки, английский и период поиска работы. Какой бы формат вы ни выбрали, закончите проект «sLO и error budget для учебного сервиса» и получите внешнее ревью.
План первых 90 дней
- Дни 1–30. Освоить базу «Linux и сети» и выполнить по инструкции небольшую задачу: определять измеримые показатели надёжности.
- Дни 31–60. Повторить похожую работу без пошагового урока, оформить «sLI/SLO и политика error budget» и получить внешнее ревью.
- Дни 61–90. Собрать кейс «sLO и error budget для учебного сервиса», сравнить его с 30 актуальными вакансиями и записать пробелы на следующий квартал.
Через 90 дней у вас должен быть законченный результат и список навыков, которых пока не хватает. Если задачи вроде «определять измеримые показатели надёжности» стабильно не вызывают интереса, сравните соседние роли до покупки длинной программы.
Что положить в портфолио
Проект 1. SLO и error budget для учебного сервиса
В кейсе покажите исходную проблему, ограничения, два ключевых решения и способ проверки. Будьте готовы на собеседовании посчитать и выбрать SLO. Не приписывайте учебной работе коммерческие показатели, которых не измеряли.
Проект 2. Наблюдаемость с полезными алертами и трассировкой
В кейсе покажите исходную проблему, ограничения, два ключевых решения и способ проверки. Будьте готовы на собеседовании провести диагностику инцидента. Не приписывайте учебной работе коммерческие показатели, которых не измеряли.
Проект 3. Chaos-сценарий, runbook и постмортем с планом улучшений
В кейсе покажите исходную проблему, ограничения, два ключевых решения и способ проверки. Будьте готовы на собеседовании спроектировать мониторинг и алерты. Не приписывайте учебной работе коммерческие показатели, которых не измеряли.
В командном проекте отделите личный вклад от общего результата. Если использовали шаблон или ИИ-инструмент, покажите свои проверки и изменения. Для кейса «sLO и error budget для учебного сервиса» отдельно опишите ограничения и решение, которое пришлось пересмотреть после обратной связи.
Как искать первую работу
Соберите 30–50 вакансий нужного уровня. Отметьте, как часто встречаются Linux и сети, Программирование, Распределённые системы, и сравните требования со своими проектами. Не пытайтесь закрыть весь список: подтвердите базовые навыки законченными работами и объясните, как проверяли качество.
В резюме замените «изучал Linux и сети» на конкретный результат: «собрал sLO и error budget для учебного сервиса». Укажите ограничения, личный вклад и способ проверки. Все ссылки должны открываться без запроса доступа, а файлы — не содержать секретов и чужих данных.
Вакансия может называться иначе: Site Reliability Engineer, Инженер надёжности. Ищите стажировки и соседние позиции, где есть задача «определять измеримые показатели надёжности». Не берите бесплатную коммерческую работу под видом стажировки без договора, наставника и учебного плана.
Как готовиться к собеседованию
Подготовьте три блока: короткое объяснение базы, разбор практической задачи и рассказ о своём проекте. Для этой роли потренируйтесь «посчитать и выбрать SLO». Во время решения вслух уточняйте вводные, называйте допущения и способ проверки.
Составьте вопросы по темам Linux и сети, Программирование, Распределённые системы. После каждого ответа приведите пример и контрпример. Отдельно разберите ошибку в проекте «sLO и error budget для учебного сервиса»: как нашли, что исправили и что изменили в процессе.
На встрече спросите, какие задачи дадут в первые месяцы, кто проводит ревью и по каким критериям повышают грейд. Уточните, как команда работает с риском «не превращать мониторинг сотрудников в скрытое наблюдение». Ответы помогут оценить среду до выхода на работу.
Что особенно часто проверяют для этой роли
- Посчитать и выбрать SLO
- Провести диагностику инцидента
- Спроектировать мониторинг и алерты
- Объяснить безопасный релиз и capacity plan
Не угадывайте недостающие данные. Сначала задайте вопросы, затем обозначьте допущения и критерий готовности. Для задачи «провести диагностику инцидента» такой ход рассуждения важнее мгновенного идеального ответа.
Зарплата и рост
Редакционный ориентир по России: от 130 000 ₽ для junior, от 270 000 ₽ для middle и от 450 000 ₽ для senior. Это не обещание дохода: регион, отрасль, формат работы и реальная зона ответственности меняют вилку.
| Уровень | Ориентир от | Что обычно подтверждает уровень |
|---|---|---|
| Junior | 130 000 ₽ | База, законченные проекты, способность работать по обратной связи |
| Middle | 270 000 ₽ | Самостоятельность в своей зоне, оценка рисков, стабильное качество |
| Senior | 450 000 ₽ | Системное влияние, сложные решения, наставничество и ответственность за результат |
Возможные траектории развития:
- Senior SRE
- Reliability lead
- Platform architect
- Head of infrastructure
Доход растёт вместе с самостоятельностью и ценой принимаемых решений. Ведите журнал достижений по задаче «определять измеримые показатели надёжности»: исходная проблема, ваш вклад, проверка результата и влияние на команду. Эти записи пригодятся для пересмотра грейда и резюме.
Инфографика 5 из 5
Рост дохода связан с ростом ответственности
Junior
от 130 000 ₽
Работает в ограниченном контексте и регулярно получает ревью.
Middle
от 270 000 ₽
Самостоятельно ведёт цельный участок и отвечает за качество.
Senior
от 450 000 ₽
Решает системные задачи и повышает качество работы команды.
Значения — редакционные ориентиры до вычета налогов. Регион, отрасль, формат работы и фактическая зона ответственности заметно меняют вилку.
Плюсы и сложности профессии
Что привлекает
- Прямое влияние на устойчивость продукта
- Глубокие системные задачи
- Сильная инженерная культура
С чем придётся считаться
- Высокая ответственность
- Дежурства
- Трудно имитировать реальный опыт инцидентов
Не выбирайте роль только по зарплате. Проверьте на небольшом проекте, готовы ли вы регулярно работать в таких условиях: высокая ответственность. Несколько вечеров практики и разговор с действующим специалистом дадут больше данных, чем рекламная программа курса.
Как ИИ меняет профессию в 2026 году
ИИ помогает суммировать инциденты и искать аномалии, но не определяет приемлемый бизнес-риск, не командует аварией и не подтверждает безопасность автоматического remediation.
ИИ может подготовить черновик для задачи «определять измеримые показатели надёжности», но специалист проверяет исходные данные, ограничения и итог. В портфолио укажите, что сгенерировал ассистент, что вы изменили и как проверили «sLI/SLO и политика error budget».
Безопасность, этика и профессиональные риски
- Не превращать мониторинг сотрудников в скрытое наблюдение
- Проводить разбор без поиска виноватых
- Ограничивать автоматические действия и проверять rollback
Для этой роли один из базовых принципов — не превращать мониторинг сотрудников в скрытое наблюдение. Если действие трудно отменить, заранее согласуйте границы, способ отката и вторую проверку. Учебные проекты тоже должны использовать безопасные данные и тестовый контур.
Красные флаги вакансии или обучения
- SRE используют как название круглосуточной техподдержки
- Нет SLO, но есть сотни алертов
- После инцидента ищут виновного вместо системной причины
Красный флаг не всегда означает отказ, но требует фактов. Если работодатель говорит «SRE используют как название круглосуточной техподдержки», попросите показать пример задачи, ревью и действий после ошибки. Конкретный процесс надёжнее обещаний о быстром росте.
Как выбирать курс
В программе должны быть Linux и сети, Программирование, Распределённые системы и самостоятельный проект уровня «sLO и error budget для учебного сервиса». До оплаты запросите критерии проверки, пример обратной связи и число работ, которые ученик делает без пошагового шаблона.
Сверяйте темы по Kubernetes и Prometheus с первичной документацией, а обещания о рынке — со свежими вакансиями. «Гарантия трудоустройства» имеет смысл только тогда, когда условия и определение трудоустройства записаны в договоре.
Короткий вывод
SRE-инженер подойдёт, если вам интересна задача «определять измеримые показатели надёжности» и вас не отталкивает сложность: высокая ответственность. Начните с проекта «sLO и error budget для учебного сервиса», получите ревью и сравните результат с требованиями вакансий. После этого решайте, нужен ли длинный курс.
Курсы по профессии
Редакционная подборка из каталога школ. Проверяйте программу, преподавателей, договор и условия возврата перед оплатой.
Otus
SRE практики и инструменты
- Длительность
- Уточняется
- Уровень
- Любой
Где изучать направление
Это не автоматический рейтинг и не обещание трудоустройства. Редакция выбрала школы, у которых есть релевантное направление; перед оплатой сравните программу, преподавателей, объём практики и условия договора.

Слёрм
Слёрм занимает обособленную нишу на рынке образовательных технологий. Проект начинался как инициатива практикующих инженеров для устранения кадрового голода в узкоспециализированных сферах инфраструктурной разработки.

Otus
Онлайн-школа Otus начала работу в 2017 году. Основатель платформы — Максим Царцахнели, имеющий опыт работы в крупных технологических компаниях, включая Intel и Яндекс.

Merion Academy
Merion Academy — образовательный проект, выросший из крупного IT-сообщества и интегратора Merion (ранее известного как Merion Solutions). Изначально компания специализировалась на IT-аутсорсинге, системной интеграции и технической поддержке корпоративных клиентов. База знаний wiki.merionet.
Вопросы и ответы
DevOps описывает культуру и практики поставки, а SRE формализует надёжность через инженерные методы, SLO и error budget. В компаниях названия ролей могут пересекаться.
Для системного старта редакционный ориентир — от 14 до 24 месяцев при регулярной практике. Срок зависит от исходной базы, недельной нагрузки и качества обратной связи. Один курс без самостоятельных проектов не гарантирует трудоустройство.
Да. Нужны последовательная программа, первичные источники, регулярная практика и внешняя проверка результата. Курс полезен структурой и обратной связью, но не заменяет самостоятельную работу и портфолио.
Лучше два-три законченных кейса, чем десяток учебных заготовок. Покажите исходную задачу, ограничения, ход решения, проверку качества, результат и выводы. Для этой роли подойдут: SLO и error budget для учебного сервиса; Наблюдаемость с полезными алертами и трассировкой; Chaos-сценарий, runbook и постмортем с планом улучшений.
Это ориентиры, а не обещание оффера. Зарплата зависит от города и формата работы, отрасли, масштаба компании, реального уровня ответственности и качества подтверждённого опыта. Перед переговорами сверяйте свежие вакансии и калькуляторы рынка.