1,086· 117 forks· TypeScript· MIT开发工具

LLM Space - 本地优先的 AI Agent 调试与评估桌面工具

deer-flow/llm-space

为 Agent 开发者打造的桌面应用,可视化追踪每步执行、回放失败场景、评估性能,数据本地存储,支持 macOS 原生体验

成熟度维护活跃,最近提交0天前,11个 open issues,项目始于2023年已迭代至 v4

项目体检

技术 · TypeScript + Electrobun 桌面框架 + React + Tailwind CSS,集成 Pi Agent Core 轻量 Agent 框架

许可 · MIT 协议,可自由商用、修改和分发

活跃 · 最新版本 v4.2.0 发布于2天前,11位贡献者参与,最近提交0天前,维护活跃

解决什么

在开发 LLM Agent 时,开发者常面临"黑盒调试"困境:不知道模型在循环中具体调用了哪些工具、哪一步出错、为何某次运行成功另一次失败。LLM Space 将 Agent 执行过程完全可视化,把每个模型调用、工具运行、上下文变化都记录为可回放的时间线,让开发者像使用浏览器开发者工具一样调试 Agent。所有数据存储在本地 ~/.llm-space 目录,API 密钥不上传云端,符合数据敏感场景需求。

为何火

该项目是字节跳动开源 Agent 框架 DeerFlow 的姊妹工具,团队自己用它开发和调试 DeerFlow 的每个版本(dogfooding)。从2023年3月启动至今已迭代到 v4,积累了1000+ stars。核心吸引力在于三点:一是完整的执行追踪能力,可逐步回放历史运行找出问题根源;二是本地优先设计,数据不离开开发者机器;三是针对 macOS 优化的原生体验,提供轻量版(使用系统 WebView)和性能版(内嵌渲染引擎)两种安装包,开发者可根据需求选择。

核心功能

  • Prompt 版本管理:集中编辑系统消息、工具定义、模型参数,支持版本对比
  • 实时执行追踪:Agent 循环运行时,可视化展示每次模型调用的输入输出、工具执行结果
  • 失败场景回放:从历史记录选择任意运行,单步调试定位错误发生的具体环节
  • 性能评估:跨多次运行统计成功率、延迟、Token 消耗等指标
  • 本地文件存储:所有对话线程以文件形式保存在本地,方便备份和迁移

项目基于 Pi Agent Core 轻量框架构建 Agent 逻辑,前端使用 React + Tailwind CSS + shadcn/ui 组件库,桌面壳采用 Electrobun(比 Electron 更轻量的方案)。

安装

macOS 用户:直接从 Releases 下载 DMG 安装包,支持 Apple Silicon 和 Intel 芯片。两个版本可同时安装且共享数据:

  • LLM Space(27MB):使用系统 WebView,省内存省电
  • LLM Space Performance(130MB):内嵌渲染引擎,性能更稳定

从源码构建:需先安装 Bun(JavaScript 运行时和包管理器),然后执行:

bun install
mise run dev  # 开发模式
mise run build:canary  # 构建测试版

适合谁

  • Agent 框架开发者:需要深度调试 Agent 执行逻辑,尤其是 DeerFlow 用户
  • Prompt 工程师:频繁调整 Prompt 并需对比不同版本效果
  • 对数据隐私敏感的团队:要求 API 密钥和对话记录不上传云端
  • macOS 用户:目前仅提供 macOS 安装包(Windows/Linux 需自行构建)

中国大陆用户可使用火山引擎 Coding Plan 作为模型提供商,项目文档已提供中文版本

社区评价

HN 上有一条 Show HN 帖子但暂无评论,无法提取社区公开讨论。以下为基于项目本身的中立评估:该项目技术选型务实(Bun + Electrobun 组合兼顾性能和包体积),本地优先架构符合企业数据安全需求。作为 DeerFlow 配套工具且团队自用,功能迭代方向贴近实际开发痛点。不过目前仅接受核心团队成员的 PR,外部贡献者只能通过 issue 参与,开放度有限。项目依赖 Electrobun 这一相对小众的桌面框架,长期维护存在一定不确定性。

选型对比

vs Langfuse/LangSmith(商业 LLM 可观测平台):LLM Space 主打本地部署和零配置,数据不出本地;Langfuse 需自建服务端或用云服务,但支持团队协作和更丰富的分析图表。若团队规模小且重视数据隐私,LLM Space 更合适;需要多人协作和生产环境监控则选 Langfuse。

vs LangChain 自带调试工具:LangChain 的 set_debug(True) 只能在终端输出日志,LLM Space 提供图形化界面和历史回放能力,调试效率更高,但仅支持 Pi Agent Core 框架(需适配其他框架)。

vs 自建日志系统:自建方案灵活但需投入开发成本,LLM Space 开箱即用且 MIT 协议可自由修改,适合快速验证 Agent 想法的场景。

已知坑

  • 平台限制:当前仅提供 macOS 安装包,Windows/Linux 用户需自行从源码构建(需配置 Bun 和 Electrobun 环境)
  • 框架绑定:深度集成 Pi Agent Core 框架,若使用 LangChain/AutoGPT 等其他框架需自行适配追踪逻辑
  • 外部贡献受限:官方说明暂不接受非核心团队的 PR,社区功能需求响应可能较慢
  • 遥测数据:默认收集匿名使用数据(可通过 TELEMETRY.md 说明的方式关闭),介意者需手动禁用
  • 模型提供商:需自备 OpenAI/火山引擎等 API Key,不提供内置免费额度

据 README,项目收集少量匿名使用数据用于改进,具体内容和退出方式见仓库中的 TELEMETRY.md 文件。轻量版依赖 macOS 系统 WebView,在旧版本 macOS 上可能出现渲染兼容问题,此时建议使用性能版。

安装方式:bun install 或下载 DMG 直接安装