1,003· 3 forks· Python· MIT开发工具

Agent Chief - 本地优先的智能注意力守门员

SmileLikeYe/agent-chief

本地部署的 AI 注意力过滤层,用三级判断引擎(硬规则→相似度→LLM)拦截 96% 噪音事件,只在真正值得时打断你

成熟度维护活跃,最近提交 0 天前,0 个 open issues,版本 0.7.0 已进入 Beta

项目体检

技术 · Python 3.12+ + FastAPI + SQLite + Typer CLI,可选 sentence-transformers 做嵌入

许可 · MIT 协议,可自由商用无限制

活跃 · 最新版本 v0.7.0 于 0 天前发布,2 位贡献者,活跃维护中

解决什么

现代开发者每天被各种"需要注意"的信息轰炸:Agent 心跳报告、CI 构建结果、RSS 订阅、监控告警。大部分是"一切正常"的零信息噪音,少数真正紧急的反而被淹没。Chief 是一个本地部署的智能过滤层,坐在你和所有信息源之间,用三级判断引擎决定每个事件该:立即打断你(🔔)、派发给 Agent 处理(🤖)、还是归档到记忆库(📚)。官方演示显示 24 个事件进来,14 个直接拦截,6 个批处理,3 个派发处理,只打断你一次,拦截率 96%。

为何火

项目在 17 天内获得 1003 stars,核心吸引力在于可解释的本地 AI 决策。不同于黑盒 SaaS 通知管理,Chief 的每个判断都带有:五维评分(紧急度/相关性/可操作性/新颖度/置信度)、匹配的规则、LLM 推理成本(DeepSeek 价格下每千事件 $0.104)、完整决策链可用 chief trace 回溯。它用 Shadow 模式运行 7 天只观察不打断,让用户先验证判断质量再授权。所有数据存在本地 SQLite 和 Markdown,无云服务无遥测,策略文件 POLICY.md 可直接编辑立即生效,符合开发者对透明度和控制权的需求。

核心功能

三级过滤引擎:硬规则(微秒级,正则+关键词)→嵌入相似度分类器(毫秒级,过滤"All clear"类空报告)→LLM 判断(仅边界案例)。官方数据显示 75% 事件在前两级解决,最吵的 25% 在微秒内免费拦截。

场景感知时机:同一事件在"深度工作"场景可能立即打断,在"睡眠"场景会进摘要。支持自定义场景(通勤/会议)和每场景的打断阈值。

验证式派发:Agent 报告"完成"后,Chief 会二次验证(执行验收命令或 LLM 复查),失败则关闭任务,避免虚假"Done"。

学习与可编辑策略:用户的 👍/👎 反馈训练每主题的 EMA 权重,每晚蒸馏成人类可读的 POLICY.md。手动编辑立即生效,无需重训练。自带 100 用户学习基准测试,路由一致性从 0% 收敛到 100%。

协议而非管道:统一 POST /v1/events 接口(或 MCP propose,或命令行 chief push "…"),任何工具几分钟接入。支持 Telegram Bot 双向交互。

安装

零配置演示(完全离线,无需 API Key):

uvx agent-chief demo

持久安装:

uv tool install agent-chief  # 或 pip install agent-chief
chief init                   # 60 秒向导,所有问题可跳过
chief run                    # 启动常驻进程 + 本地控制台(127.0.0.1)

可选安装嵌入模型增强相似度过滤:

pip install agent-chief[embeddings]

适合谁

被通知淹没的开发者:运行多个监控 Agent、订阅大量 RSS、CI 频繁触发的团队。典型场景是心跳 Agent 每小时报"All clear",Chief 的嵌入相似度过滤专门拦截这类零信息报告。

需要本地部署的隐私敏感用户:所有数据在 ~/.chief 的 SQLite 和 Markdown,无云端依赖。中国大陆用户可用 DeepSeek 等国内 LLM 后端,无需梯子。

要求决策透明的工程师:每个判断可追溯到具体规则、Prompt 版本(v1/v2)、Token 消耗。Prompt 变更必须通过 200 案例黄金集的 eval diff 才能合并。

不适合:需要移动端 App 的普通用户(目前仅 CLI + 本地 Web 控制台),或希望开箱即用 SaaS 的团队。

社区评价

暂无足量社区公开讨论,以下为基于项目本身的中立评估:

项目在短时间内获得千星关注,主要因其工程化的可解释 AI 决策设计。README 包含实测指标(96% 拦截率、70% 缓存命中、$0.104/千事件成本),每个数字可用 make readme-metrics 从确定性演示重现,这种"可证伪"的透明度在 AI 工具中罕见。401 个离线测试、200 案例黄金集、100 用户学习基准的测试覆盖显示作者对质量的重视。

潜在争议点:项目仍处 Beta 阶段(v0.7.0),仅 2 位贡献者,长期维护能力待观察。学习算法基于简单的 EMA 权重而非深度学习,对复杂偏好的拟合能力有限。MCP 协议支持是亮点,但生态集成案例尚少。

选型对比

vs 商业通知管理(如 PagerDuty/Opsgenie):Chief 完全本地免费,但缺少团队协作、排班、升级策略等企业功能。适合个人开发者或小团队,不适合需要 On-call 轮换的 SRE 场景。

vs Zapier/n8n 自动化:Chief 专注"该不该打断"的判断,而非工作流编排。两者可互补:n8n 做事件路由,Chief 做最终的注意力守门。

vs 自建规则过滤:Chief 的增量是 LLM 判断边界案例 + 学习反馈闭环。纯规则系统处理不了"这次 CI 失败是否值得立即看"(取决于分支、作者、历史),Chief 的场景感知和相似度检索能覆盖这些灰色地带。

已知坑

LLM 后端依赖:虽然支持降级到纯规则模式,但核心价值在 LLM 判断。需自备 OpenAI/DeepSeek 等兼容 API,官方推荐 DeepSeek(成本低+国内可用)。

Shadow 模式 7 天:首次运行不会真正打断,需手动确认 chief shadow --end 结束试运行。急性子用户可能觉得"不工作"。

嵌入模型可选但推荐:不装 sentence-transformers 会跳过相似度过滤,拦截效果打折扣。首次加载模型需下载约 400MB。

单用户设计:所有配置在 ~/.chief,多用户共享机器需各自安装。团队共享策略需手动同步 POLICY.md

Python 3.12+ 要求:利用了较新语法特性,老系统需升级 Python 或用 Docker(虽然官方未提供镜像)。

安装方式:pip/uvx