Base/Knowledges/Библиотека/Книги/Site Reliability Engineering. Надежность и безотказность как в Google.md

60 lines
3.6 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
Тип: Книга
Статус: Запланировано
Название: "Site Reliability Engineering. Надежность и безотказность как в Google"
Автор:
- Бетси Бейер
- Крис Джоунс
- Дженнифер Петофф
- Ричард Нил Мёрфи
Количество страниц: 560
Прогресс: 0
Формат: Электронная
Обложка: Библиотека/Книги/covers/sre-google.jpg
Начата:
Закончена:
Оценка:
Сложность:
Теги:
- sre
- devops
- надёжность
- google
- системное_администрирование
- распределённые_системы
Категории:
- Программирование
- DevOps
Источник:
Ссылка:
---
# Site Reliability Engineering. Надежность и безотказность как в Google
![[covers/sre-google.jpg]]
## 📖 О книге
Бетси Бейер, Крис Джоунс, Дженнифер Петофф и Ричард Нил Мёрфи — инженеры и менеджеры Google SRE — собрали в одной книге принципы и практики, которые позволяют Google запускать крупнейшие производственные системы в мире с высокой надёжностью. Книга описывает дисциплину Site Reliability Engineering: как Google применяет программные инструменты для решения задач, которые традиционно решают системные администраторы. Издательство «Питер», 2018, ISBN 978-5-4461-0976-0.
## 🧠 Ключевые идеи
- **SRE как дисциплина**: SRE — это то, что получается, когда инженер-программист занимается операционной деятельностью; Software Engineering + Operations = надёжные системы без ручного труда
- **Error budget**: бюджет ошибок как инструмент баланса между скоростью разработки и надёжностью — команда разработки тратит бюджет, SRE его защищает
- **SLI/SLO/SLA**: индикаторы, цели и соглашения об уровне сервиса — формальный язык для договорённостей о надёжности между командами и пользователями
- **Устранение toil**: автоматизация рутинных операций как системный подход — если задачу можно автоматизировать, её нужно автоматизировать; toil не должен превышать 50% времени SRE
- **Культура постмортемов**: бесклассовые анализы инцидентов без поиска виноватых — фокус на системных причинах, а не на ошибках людей
## 💬 Важные цитаты
- «Hope is not a strategy» — надежда не является стратегией
- «SRE is what happens when you ask a software engineer to design an operations team»
## 💡 Как применить в моих проектах
## 🔗 Связанные заметки
- [[Site Reliability Workbook. Практическое применение]]
- [[Безопасные и надёжные системы]]