System
Health
Service status, performance and usage. Each subsystem scales independently, so issues stay contained.
Runtime nominal
p95 latency
182 ms
API gateway → worker
Error rate
0.08%
last 24 hours
Queue depth
14
jobs waiting
Worker fleet
6 / 8
pods busy
Services
API gateway
Decision engine
Execution workers
Memory index
Model router
Event bus
Scheduler
Usage · 7 days
182kThu
240kFri
96kSat
74kSun
268kMon
311kTue
287kWed
1.46M
tokens
111
missions
Resilience
RPO
5 min
max data loss
RTO
30 min
time to recover
Last backup
12 min ago
point-in-time enabled
Deploy strategy
Rolling
canary for DNA updates
