Checkcle 實戰:自託管系統監控平台,Docker 一鍵部署的輕量替代方案
維運一段時間後就會發現一個尷尬的事實:每個團隊都需要監控,但能扛得起 Prometheus + Grafana + Alertmanager 那一整套基礎建設的並不多。如果只是想知道「我這幾台服務還在不在、SSL 還剩幾天到期、API 端點有沒有 5xx」,全套 observability stack 顯得過於厚重;可…
標籤「monitoring」相關文章共 4 篇 — Tony.Wu Blog
維運一段時間後就會發現一個尷尬的事實:每個團隊都需要監控,但能扛得起 Prometheus + Grafana + Alertmanager 那一整套基礎建設的並不多。如果只是想知道「我這幾台服務還在不在、SSL 還剩幾天到期、API 端點有沒有 5xx」,全套 observability stack 顯得過於厚重;可…
小團隊導入 SRE 實踐時,PagerDuty / Opsgenie 這類商業工具一人 $29~39/月起跳,五人團隊一年就要 $2000 USD。功能很強,但「事件追蹤、timeline、post-...
團隊導入 SRE 實踐時,Error Budget 跟 SLO 是入門必備。問題是:手刻 Prometheus recording / alerting rules 是一場災難。一條 99.9% av...
重度使用 Claude Code 約半年,團隊內部開始討論一個問題:每個人每天到底花了多少 token?哪些任務吃最兇?。靠 Anthropic 後台只能看到每月總額,拆不出 per-session、...