> services / operate

Дежурство SRE 24/7 для Web3 и AI инфраструктуры

Мы берём пейджер на себя: PagerDuty-ротации, подписанный SLA и постмортем после каждого Sev-1. MTTA измеряется минутами, а алерты идут инженерам, а не на автоответчик.

[ План деплоя за 48ч ]

что входит в OPERATE

Эксплуатация обычно начинается после передачи из деплоя, либо когда мы подключаем месячный контракт на уже существующую инфру.

Scope На нас На вас
Дежурство 24/7, PagerDuty-ротации, эскалации ✓ Owned -
Triage инцидентов и runbook-driven response ✓ Owned -
Версионирование и обновление раннбуков ✓ Owned -
Патчинг ОС, security updates, certificate rotation ✓ Owned -
Постмортемы по Sev-1, отчёты с трендами ✓ Owned -
Релизы новых версий ваших приложений / контрактов - (выполняем по вашему cue) ✓ Owned
Решения по архитектурным изменениям - (рекомендуем) ✓ Owned
Биллинг с провайдером и стейкхолдерами - ✓ Owned

как реагируем на инциденты

Каждый алерт проходит severity-классификацию до того, как поднимет дежурного. Sev-1 — это когда под угрозой деньги или ключи: пропуск блоков валидатором, double-sign risk, GPU OOM на проде, прерванный proof-job под дедлайн. Sev-2 — деградация SLO без немедленных потерь. Sev-3 — баг, который спокойно ждёт рабочего дня.

Под каждый Sev-1 у нас есть раннбук: шаги восстановления, кого эскалировать и какие side-effects учитывать. Раннбуки версионируются в Git вместе с IaC, так что каждое изменение проходит ревью и ничего не делается «по памяти». Сейчас в библиотеке 147 раннбуков по 4 ICP.

MTTA на Sev-1 — <15 минут p95. MTTR зависит от характера сбоя, но оба числа мы фиксируем в ежемесячных SLA-отчётах. После каждого Sev-1 делаем разбор инцидента в течение 24 часов — без поиска виноватых, со списком исправлений и владельцами.

Observability-стек по умолчанию — Prometheus + Grafana + Loki + OpenTelemetry, а для on-call используем PagerDuty. Если у вас уже стоит Datadog, Honeycomb или своя сборка, то работаем поверх неё.

стек, с которым приходим

Web3: Cosmos SDK Geth Reth OP Stack Arbitrum Orbit Polygon CDK EigenDA Celestia
AI / LLM: vLLM Triton TensorRT-LLM NVIDIA H100 / A100 Ray Kubeflow
ZK: SP1 RISC Zero Boundless Brevis Jolt Halo2
DePIN: Filecoin Akash Render io.net Gensyn
Platform: Kubernetes Terraform Ansible Prometheus Grafana Loki OpenTelemetry PagerDuty

engagement models

Operate по природе — длительный engagement, поэтому модель мы подбираем под зрелость инфры и критичность.

severity matrix

Что мы считаем каким Sev и какие targets применяются по умолчанию.

Severity Примеры Ack (p95) Разбор
Sev-1 Пропуск блоков валидатором, double-sign risk, потеря инференса, prover offline под дедлайн <15 мин 24/7 В течение 24ч
Sev-2 Деградация SLO без потерь, single-node failure при наличии redundancy, p95 latency drift <1ч business hours, <2ч ночью В течение 5 рабочих дней
Sev-3 Бэклог-баг, ожидающее обновление, плановое окно Next business day -

что соберём

Реальные примеры того, как выглядит покрытие под каждый из четырёх ICP.

Web3 / Validators

Мониторинг валидаторов 24/7 с авто-фейловером и эскалацией пропущенных блоков. Алерты на double-sign signals, slashing watch, рекомендации по апгрейдам сети.

AI / LLM Inference

Контроль GPU, авто-восстановление после OOM, плейбук отката моделей. p95 latency SLO, мониторинг cost-per-token, capacity planning под пики.

ZK / Prover Farms

Liveness-проверки prover'ов под дедлайны сети. Мониторинг очереди proof-job'ов, GPU utilization, эскалация при риске пропустить блок.

DePIN / Distributed Networks

Трекинг аптайма по нодам со сверкой выплат. Авто-перезапуски, региональный мониторинг, weekly reward reconciliation против сетевых дашбордов.

SLA tiers

Три уровня покрытия, а выбираете вы под свою критичность и бюджет.

Tier Response p95 (Sev-1) Coverage Incident report Engineer hours / мес
Bronze 30 мин Business hours, 5×8 В течение 48ч 40
Silver 15 мин 24/7 on-call ротация В течение 24ч 80
Gold 5 мин 24/7 с выделенным инженером В течение 12ч 160+

смежные услуги

FAQ

Да. Сначала проводим operate readiness audit (48ч): проверяем мониторинг, раннбуки, SLO и эскалационные пути. Если находим пробелы, то закрываем их перед подписанием SLA.

Тиры: Bronze (5×8, 30 мин), Silver (24/7, 15 мин), Gold (24/7 выделенный инженер, 5 мин). Цели по реакции, срокам разбора и часам в месяц мы фиксируем в контракте, а компенсацию при срыве SLA обсуждаем отдельно по проекту.

Дежурство 24/7 значит именно 24/7 — holiday и weekends включены в Silver и Gold. Никаких «попробуем дозвониться»: есть PagerDuty-ротация и эскалационная цепочка.

Общие. Хранятся они в вашем Git, а пишем и поддерживаем их мы. После окончания engagement раннбуки остаются у вас, так что никакой блокировки на наш инструментарий.

Retainer мы ре-квотируем при значимом изменении scope — например, +50% нод или новый ICP. А мелкие изменения внутри Silver/Gold tier'а покрыты engineer hours, уже включёнными в тариф.

готовы передать пейджер?

Опишите задачу: ответим в течение 24 часов.

[ План деплоя за 48ч ]

оцените проект

Прикиньте, во сколько встанет 24/7 on-call и подписанный SLA в месяц — примерно за минуту.

[ Оценить operate → ] [ Смотреть тарифы ]