opsmith / llm-production-ops / Modul
Reliabilität, SLOs & Incident
Einen probabilistischen Dienst betreiben: SLIs/SLOs definieren, Tail-Latenz, graceful degradation, Provider-Rate-Limits als Kapazitätsgrenze, Incident-Response ohne Stacktrace und Provider-Ausfallrisiko.
EINFÜHRUNGReliabilität, SLOs & Incident: einen probabilistischen Dienst betreiben~8 Min
ADR-001SLI-SLOsenior
ADR-002TAIL-LATENCYsenior
ADR-003FALLBACK-DEGRADATIONsolide
ADR-004RATE-LIMIT-CAPACITYsenior
ADR-005QUALITY-INCIDENTprincipal
ADR-006PROVIDER-RISKsenior