904· 65 forks· TypeScript· Apache-2.0开源替代

Superlog - AI 自愈式可觀測性平臺

superloglabs/superlog

YC 孵化的開源 AI 監控工具,自動聚合 OpenTelemetry 資料為事件並生成調查報告,讓系統在你睡覺時自我修復

成熟度維護活躍,最近提交1天前,19個開放 issue,YC P26 孵化專案處早期階段

项目体检

部署 · docker compose 一键启动(Postgres+ClickHouse+OTel Collector 三服务),Web 默认 5173 端口,API 4100,OTLP 接收 4101/4317/4318

成本 · 需 Node.js 20+、pnpm 9+、Docker,开箱即用无需外部 Key(社区版),ClickHouse 建议 8GB+ 内存

技术 · TypeScript + React(Vite) + Drizzle ORM,后端 Node.js,数据存储 Postgres + ClickHouse

许可 · Apache-2.0,可商用且允许修改分发,需保留版权声明

活跃 · 1天前刚提交,5位贡献者,18天内创建仓库属新项目但更新频繁

解決什麼

傳統監控工具會產生海量告警,工程師需要在凌晨三點爬起來翻日誌找根因。Superlog 通過 AI 代理自動完成這個過程:接收 OpenTelemetry 標準的 traces、logs、metrics 後,用指紋演算法將相似訊號聚合成"事件"(incidents),然後啟動 AI 代理自主調查,生成結構化報告甚至嘗試修復。本質是把 SRE 的初步排查工作自動化,讓人類只處理真正需要決策的問題。

為何火

  1. YC 背書:作為 Y Combinator P26 批次專案,天然獲得創業圈關注
  2. AI 原生設計:不是在傳統監控上加 ChatGPT,而是從架構層就圍繞 Agent 編排設計
  3. 開源 + 開放標準:基於 OpenTelemetry 生態,避免廠商鎖定,Apache 2.0 協議可自由商用
  4. 降噪剛需:Kubernetes 時代微服務爆炸,告警疲勞是普遍痛點,智慧聚合直擊要害

核心功能

  • OTLP 全棧接收:相容 OpenTelemetry 協議的 traces/logs/metrics,無需改造現有埋點
  • 智慧事件聚合:通過 fingerprint 演算法將相似錯誤歸類,減少 90% 重複告警
  • AI 代理調查:社群版提供基礎 community runner 記錄摘要,可插拔接入自定義 LLM 做深度分析
  • 本地優先設計:資料儲存在自己的 Postgres + ClickHouse,符合合規要求
  • 技能系統:通過 npx skills add 讓 AI 編碼助手自動完成專案整合配置

安裝

# 1. 克隆倉庫
git clone https://github.com/superloglabs/superlog.git
cd superlog

# 2. 安裝依賴(需 pnpm 9+)
pnpm install

# 3. 啟動基礎設施(Postgres + ClickHouse + OTel Collector)
docker compose up -d

# 4. 執行資料庫遷移
pnpm --filter @superlog/db db:migrate

# 5. 啟動開發伺服器
pnpm dev

訪問 http://localhost:5173 開啟 Web 介面,應用通過 http://localhost:4101 傳送 OTLP 資料。

適合誰

  • 中小型 SaaS 團隊:需要可觀測性但預算有限,自建比 Datadog 年費便宜
  • 合規敏感行業:金融/醫療等需要資料不出內網的場景
  • AI 探索者:想在監控領域試驗 Agent 能力,程式碼庫清晰可二次開發
  • OpenTelemetry 使用者:已有 OTel 埋點,換個後端即可接入

不適合:超大規模(日均 TB 級日誌)需定製 ClickHouse 叢集;完全不懂 Docker 的個人開發者上手成本較高。

社群評價

HN 討論熱度較低(3 點 1 評論),聯合創始人 Nico 在帖子下表示願意答疑,但未見深度技術討論。作為 18 天新專案,社群認知尚在建立期。以下為基於專案本身的中立評估:

技術亮點:架構分層清晰(proxy/api/worker 分離),用 Drizzle ORM 管理 schema 便於遷移,ClickHouse 做時序查詢是業界標配選擇。Agent runner 介面設計體現擴充套件性,允許使用者接入 Claude/GPT-4 等不同模型。

潛在爭議:社群版的 community runner 功能有限(僅記錄摘要),核心 AI 能力可能在閉源的 Cloud 版。README 未明確說明開源版與商業版的功能邊界,需進一步觀察是否會走 "open-core 陷阱"(關鍵功能逐步閉源)。

選型對比

維度SuperlogDatadogGrafana + Loki
成本自託管免費,Cloud 版按用量年費數萬美元起開源免費但需自己運維
AI 能力原生 Agent 自動調查有 Watchdog 但規則驅動無,需手動配置告警
資料主權完全自控儲存在廠商完全自控
學習曲線中等(需懂 Docker + OTel)低(SaaS 開箱即用)高(需組合多個工具)
生態成熟度新專案,外掛少成熟,整合 500+成熟,社群活躍

取捨建議:預算緊張且有運維能力選 Superlog;追求穩定省心選 Datadog;極客玩家選 Grafana 棧自己搭。

已知坑

  1. ClickHouse 資源佔用:官方建議 ulimit nofile 26 萬,實測 8GB 記憶體以下機器可能 OOM,生產環境建議 16GB+
  2. 社群版 AI 功能受限:預設 runner 只生成文本摘要,要實現"自愈"需自己對接 LLM API 並編寫 skills
  3. 文件不全:README 提到 skills 系統但未給示例,需翻 superloglabs/skills 倉庫學習
  4. 中文支援未知:UI 和 AI 輸出均為英文,中文日誌的指紋演算法效果待驗證
  5. 無現成告警通知:未見 Slack/釘釘整合說明,可能需自己通過 webhook 對接

中文使用者特別注意:ClickHouse 在國內網路環境下 Docker 映象拉取較慢,建議配置映象加速;LLM API 若用 OpenAI 需梯子,國產模型(通義/文心)相容性需自測。

安装方式:docker compose + pnpm