[ FIXED PLAN ] →
Operate readiness audit. За 48ч оценим текущую инфру, runbook gap'ы и SLO-готовность.
Подходит, когда вы не уверены, готова ли инфра к подписанному SLA.
> services / operate
Мы берём пейджер на себя: PagerDuty-ротации, подписанный SLA и постмортем после каждого Sev-1. MTTA измеряется минутами, а алерты идут инженерам, а не на автоответчик.
Эксплуатация обычно начинается после передачи из деплоя, либо когда мы подключаем месячный контракт на уже существующую инфру.
| Scope | На нас | На вас |
|---|---|---|
| Дежурство 24/7, PagerDuty-ротации, эскалации | ✓ Owned | - |
| Triage инцидентов и runbook-driven response | ✓ Owned | - |
| Версионирование и обновление раннбуков | ✓ Owned | - |
| Патчинг ОС, security updates, certificate rotation | ✓ Owned | - |
| Постмортемы по Sev-1, отчёты с трендами | ✓ Owned | - |
| Релизы новых версий ваших приложений / контрактов | - (выполняем по вашему cue) | ✓ Owned |
| Решения по архитектурным изменениям | - (рекомендуем) | ✓ Owned |
| Биллинг с провайдером и стейкхолдерами | - | ✓ Owned |
Каждый алерт проходит severity-классификацию до того, как поднимет дежурного. Sev-1 — это когда под угрозой деньги или ключи: пропуск блоков валидатором, double-sign risk, GPU OOM на проде, прерванный proof-job под дедлайн. Sev-2 — деградация SLO без немедленных потерь. Sev-3 — баг, который спокойно ждёт рабочего дня.
Под каждый Sev-1 у нас есть раннбук: шаги восстановления, кого эскалировать и какие side-effects учитывать. Раннбуки версионируются в Git вместе с IaC, так что каждое изменение проходит ревью и ничего не делается «по памяти». Сейчас в библиотеке 147 раннбуков по 4 ICP.
MTTA на Sev-1 — <15 минут p95. MTTR зависит от характера сбоя, но оба числа мы фиксируем в ежемесячных SLA-отчётах. После каждого Sev-1 делаем разбор инцидента в течение 24 часов — без поиска виноватых, со списком исправлений и владельцами.
Observability-стек по умолчанию — Prometheus + Grafana + Loki + OpenTelemetry, а для on-call используем PagerDuty. Если у вас уже стоит Datadog, Honeycomb или своя сборка, то работаем поверх неё.
Operate по природе — длительный engagement, поэтому модель мы подбираем под зрелость инфры и критичность.
Operate readiness audit. За 48ч оценим текущую инфру, runbook gap'ы и SLO-готовность.
Подходит, когда вы не уверены, готова ли инфра к подписанному SLA.
Подписанный SLA + дежурство. Тиры Bronze / Silver / Gold, месячная оплата.
Основная модель эксплуатационной фазы — здесь живёт большинство клиентов.
Дежурство под пик. Под одно событие — запуск mainnet, hard-fork или incentivized testnet с дедлайнами.
Когда нужно усилить вашу команду на 2-8 недель.
Что мы считаем каким Sev и какие targets применяются по умолчанию.
| Severity | Примеры | Ack (p95) | Разбор |
|---|---|---|---|
| Sev-1 | Пропуск блоков валидатором, double-sign risk, потеря инференса, prover offline под дедлайн | <15 мин 24/7 | В течение 24ч |
| Sev-2 | Деградация SLO без потерь, single-node failure при наличии redundancy, p95 latency drift | <1ч business hours, <2ч ночью | В течение 5 рабочих дней |
| Sev-3 | Бэклог-баг, ожидающее обновление, плановое окно | Next business day | - |
Реальные примеры того, как выглядит покрытие под каждый из четырёх ICP.
Мониторинг валидаторов 24/7 с авто-фейловером и эскалацией пропущенных блоков. Алерты на double-sign signals, slashing watch, рекомендации по апгрейдам сети.
Контроль GPU, авто-восстановление после OOM, плейбук отката моделей. p95 latency SLO, мониторинг cost-per-token, capacity planning под пики.
Liveness-проверки prover'ов под дедлайны сети. Мониторинг очереди proof-job'ов, GPU utilization, эскалация при риске пропустить блок.
Трекинг аптайма по нодам со сверкой выплат. Авто-перезапуски, региональный мониторинг, weekly reward reconciliation против сетевых дашбордов.
Три уровня покрытия, а выбираете вы под свою критичность и бюджет.
| Tier | Response p95 (Sev-1) | Coverage | Incident report | Engineer hours / мес |
|---|---|---|---|---|
| Bronze | 30 мин | Business hours, 5×8 | В течение 48ч | 40 |
| Silver | 15 мин | 24/7 on-call ротация | В течение 24ч | 80 |
| Gold | 5 мин | 24/7 с выделенным инженером | В течение 12ч | 160+ |
Да. Сначала проводим operate readiness audit (48ч): проверяем мониторинг, раннбуки, SLO и эскалационные пути. Если находим пробелы, то закрываем их перед подписанием SLA.
Тиры: Bronze (5×8, 30 мин), Silver (24/7, 15 мин), Gold (24/7 выделенный инженер, 5 мин). Цели по реакции, срокам разбора и часам в месяц мы фиксируем в контракте, а компенсацию при срыве SLA обсуждаем отдельно по проекту.
Дежурство 24/7 значит именно 24/7 — holiday и weekends включены в Silver и Gold. Никаких «попробуем дозвониться»: есть PagerDuty-ротация и эскалационная цепочка.
Общие. Хранятся они в вашем Git, а пишем и поддерживаем их мы. После окончания engagement раннбуки остаются у вас, так что никакой блокировки на наш инструментарий.
Retainer мы ре-квотируем при значимом изменении scope — например, +50% нод или новый ICP. А мелкие изменения внутри Silver/Gold tier'а покрыты engineer hours, уже включёнными в тариф.
Прикиньте, во сколько встанет 24/7 on-call и подписанный SLA в месяц — примерно за минуту.