Поиск по тексту · все 310 страниц

Из разговоров инженеров — в книгу
SRE:Коллективный
разум
Сервисы падают, алерты мешают спать, а на работу с надёжностью не хватает времени. В этой книге инженеры рассказывают, как справляются с этим у себя.
Можно выдохнуть?
Три часа ночи. Релиз прошёл, графики спокойные. Проверяете ещё один заказ. Кажется, можно выдохнуть.
Прокрутка меняет события. К сценам можно перейти кнопками.

SRE Pub и ALLSLO · 2022–2026
Как это делают другие команды
В чатах SRE Pub и ALLSLO инженеры обсуждают свою работу: почему упал сервис, какие алерты нужны и как устроить дежурства. Делятся решениями и рассказывают об ошибках.
Мы, Андрей Герасимов и Кирилл Борисов, собрали эти обсуждения в книгу. Разделили по темам и добавили свои рекомендации. Если мнения расходились, оставили несколько вариантов — с объяснениями, почему каждый из них может сработать.
Свою задачу можно обсудить с нами на консультации.6 частей / 17 глав / 5 приложений
С какой главы начать
Не обязательно читать с первой страницы. Найдите свою задачу в оглавлении: алерты, дежурства, SLO или разборы сбоев.
Каждая тема — отдельная глава. В приложениях — шаблон постмортема, списки инструментов и материалы для дальнейшего чтения.
IОсновыстр. 5
- 1.Что такое SRE и зачем это нужно6
- 2.SLO, SLI, SLA: от теории к практике17
- 3.Конструирование SLI28
- 4.Error Budget42
IIНаблюдаемостьстр. 53
- 5.Мониторинг54
- 6.Логирование и трейсинг68
- 7.Алертинг82
IIIПроцессыстр. 99
- 8.Инцидент-менеджмент100
- 9.Постмортемы116
- 10.Дежурства (On-Call)130
IVИнженерные практикистр. 157
- 11.Архитектура надёжности158
- 12.Kubernetes и надёжность171
- 13.Хаос-инжиниринг и нагрузочное тестирование186
- 14.Toil и автоматизация202
VКультура и людистр. 215
- 15.SRE и бизнес216
- 16.Культура надёжности в России и СНГ229
VIWar Storiesстр. 243
- 17.Истории из окопов244
+Приложениястр. 273
- A.Инструментарий SRE: сводная таблица274
- B.Тулинг для SLO282
- C.Шаблон постмортема288
- D.Классификация причин инцидентов295
- E.Рекомендованные ресурсы301
Из первой главы
«Мы в целом решаем одинаковые проблемы параллельно всем селом, но в отрыве».

310 страниц
ISBN 978-5-0069-3498-6
Книга напрямую от составителя
В PDF или на бумаге
Содержание одинаковое — все 310 страниц. В PDF удобно искать по тексту. В бумажной книге можно делать пометки и оставлять закладки.
PDF скачивается сразу после оплаты. Бумажную книгу отправим в ПВЗ Яндекса или Ozon. Доставка по Москве — бесплатно, по остальной России — 300 ₽.
SRE-консультации и помощь командам
Можно обратиться к нам
В книге разбираем общие вопросы. На консультации можно обсудить именно вашу систему: показать схему, рассказать о сбоях и спросить, с чего начать.
Мы работаем в ИТ 15 лет. Поможем разобраться с одним вопросом или возьмём часть работ на себя. Стоимость и объём согласуем до начала.
Обсудить один вопрос
КонсультацияПоможем выбрать SLO, пересмотреть дежурства или разобраться с мониторингом. Вы расскажете, как всё устроено сейчас. Мы предложим, что можно изменить и почему.
После встречи пришлём короткие заметки: о чём договорились и что делать дальше.
Понять, что чаще всего ломается
Разбор надёжностиПосмотрим на устройство системы и последние сбои. Проверим, как проходят релизы и что видно в мониторинге. Найдём места, с которых стоит начать.
Составим список работ: что исправить сначала, а что может подождать.
Помочь с настройкой и внедрением
Помощь с внедрениемНастроим алерты, поможем ввести SLO и организовать дежурства. Покажем команде, как с этим работать. Можно начать с одной задачи.
Заранее запишем, что сделаем, сколько это стоит и как проверим результат.
Расскажите в двух-трёх предложениях, с чем нужна помощь. Напишите @msk_devops или @silabeer.
Перед покупкой
Частые вопросы
Я давно работаю с продом. Здесь будет что-то для меня?
Скорее всего, часть тем вы уже знаете. Книга полезна, чтобы сравнить свой опыт с опытом других команд. Посмотрите оглавление и прочитайте фрагмент — так проще решить, нужна ли она вам.
А если я только знакомлюсь с SRE?
Начинаем с основных понятий, но дальше пригодится опыт разработки или эксплуатации. Книга рассчитана на middle и выше. Если вы уже выпускали релизы или искали причины сбоев, примеры будут знакомыми.
Эта ночная история есть в книге?
Эту историю мы придумали для сайта. В книге есть отдельная глава с историями сбоев. Ещё разбираем мониторинг, работу во время инцидента и постмортемы.
Что можно взять в работу?
В приложениях есть шаблон постмортема, таблицы инструментов SRE и материалы по SLO. Их можно использовать в своей команде. Там же — список причин сбоев и ссылки, по которым можно почитать дальше.
Можно сначала почитать?
Да, бесплатно. Кнопка «Читать фрагмент» открывает страницы главы о SLO. Там же можно посмотреть оглавление.
Как получить книгу?
PDF стоит 650 ₽. После оплаты появится кнопка «Скачать PDF». Бумажная книга — 2 250 ₽. Отправим в выбранный ПВЗ Яндекса или Ozon: по Москве бесплатно, в другие города России — за 300 ₽. Полная сумма будет видна до оплаты.
Можно обсудить нашу задачу с вами?
Да. Можно обсудить один вопрос, разобрать систему целиком или позвать нас помочь с настройкой. Напишите, с чем нужна помощь.
Посмотреть варианты работы