第 1 章 从按钮到文件:一次对话的解剖
你在 WorkBuddy 里打了一句话:「帮我把这个文件夹里的照片按月份整理成相册,生成一份索引文档」。十几秒后它开始列文件、读图片、建目录、写文档,中途弹了两次确认框,几分钟后交付了一个文件夹和一份 HTML 索引。整个过程你按过的按钮不超过三个。
这是 WorkBuddy 想要的体验:把复杂性全部藏起来。但藏起来不等于不存在。这一章我们把这次对话放慢一千倍,看每一秒背后是什么在运转。这是全书的地基——后面十四章讲的每一个机制,都出现在这一次对话里。
读完本章,你应能把「WorkBuddy 帮我干活」这句模糊的话,拆成五个可指认的环节,并能说出每个环节在本地磁盘上的证据位置。
1.1 第一环:你的话加上它的记忆,一起出发
你按下回车的那一刻,发生的第一件事不是「发给大模型」。WorkBuddy 先组装上下文:你的这句话,加上系统提示词(第 5 章)、三层记忆里相关的内容(第 4 章)、当前项目的工作区信息(第 4、9 章),如果这次对话挂在某个专家身上,还有那个专家的人设提示词(第 7 章)。
这些零件几乎全部来自本地磁盘上一个你从没打开过的目录。打开 Finder,按 Cmd+Shift+G,输入 ~/.workbuddy——从安装那天起,WorkBuddy 就把你的一切配置存在这里:身份、记忆、插件、技能、会话记录,几十上百兆的文件。**这本书要拆解的东西,物理上就是这个目录

图 1-1:WorkBuddy 的全部复杂性,都安静地躺在 ~/.workbuddy 这个目录里。
**。
1.2 第二环:模型只做一件事
上下文组装完成,请求发往模型。很多人对这一步有误解,以为 WorkBuddy「内置了一个很聪明的 AI」。更准确的说法是:模型收到一份很长的、结构化的请求,其中大部分篇幅是 WorkBuddy 拼进去的规则、记忆和工具说明书,你的那句话只占很小一块。
模型的角色像一位业务娴熟但完全不了解你的外援专家:它读规则、看工具清单、理解任务,然后决定下一步——通常是调用某个工具。模型不碰你的文件、不碰网络,它只输出「我想调用某某工具」的指令。真正动手的是下一环。
模型清单本身也是配置,不是写死的。社区解包研究在应用包内找到五个产品配置文件,声明了从混元、DeepSeek、Kimi、GLM 到 Claude 的几十个模型条目,每个条目标注能力(是否支持工具调用、图片、推理)与计费。你在界面上切换模型,改写的是请求发往哪里,而不是「换了一个 WorkBuddy」。
1.3 第三环:工具执行,风险拦截
模型说「我想执行 mkdir 2026-07」,指令落回到 WorkBuddy 的执行层。这里是安全机制的主场:这个操作在工作空间内、是新建而非删除,放行;下一秒模型想 rm -rf 某个目录,执行层拦下,弹确认框——就是你见过的那两次。
官方把这层叫默认权限模式:写敏感路径、删文件、跑脚本、访问网络四类操作要确认,其余放行;还有一档完全访问权限会关掉二次确认,官方文档明确列了不建议开启的场景(生产资料目录、桌面下载这类杂物目录、批量删除)。本地配置文件里能看到这层机制的落点:一份沙箱写路径白名单。第 12 章专门讲它。
工具执行完,结果连同报错一起回传给模型,进入下一轮。这个「模型思考—调用工具—拿到结果—再思考」的循环,就是 Agent 与聊天机器人的分水岭。聊天机器人一次回答完事;Agent 在循环里干活,一个任务转几十圈很正常。
1.4 第四环:留下痕迹
循环的每一拍都被记录。会话文件(JSONL 格式,按项目分目录存储)里能看到完整事件流:你的消息、模型的推理过程、每次工具调用的名称和参数、每次执行的结果,还有文件快照——每次 WorkBuddy 改你的文件之前,先存一份备份。另有执行轨迹(traces)目录记录执行链和 token 消耗,审计日志按天滚动。
这些记录不是给你看的,但你可以看,而且第 10 章会教你看。它们是这本书的证据来源,也是你排查问题的第一现场:「WorkBuddy 说它做了但文件没变」「昨天那个会话它到底改了什么」,答案全在里面。
1.5 第五环:交付与沉淀
任务结束,交付物落进工作空间。同时还在发生两件安静的事:这次会话的关键信息被写入记忆层(哪层、写了多少,受第 4 章讲的限额约束);如果这是定时任务,下次执行时间写进本地数据库。工作没有真的结束,它只是转成了下次请求的一部分上下文。
1.6 拼起来:一张全景图
五环连起来,就是 WorkBuddy 的骨架:
你的输入
↓
[拼装] 身份+记忆+规则+工具清单+你的话 → 完整请求 ← 第4/5/6/9章
↓
[推理] 模型决策下一步 ← 模型配置
↓
[执行] 工具落地,风险拦截,文件备份 ← 第12章
↓
[记录] 会话/轨迹/审计三路落盘 ← 第10章
↓
[沉淀] 记忆更新,影响下一次拼装 ← 第4章
↺ 回到推理,直到任务完成每一环都有对应的本地文件,每一个「按钮」都落在图上的某个位置:插件按钮往拼装环节注入内容,专家按钮换掉人设插槽,Agents Team 按钮唤起编排工具,记忆开关控制沉淀环节。**
图 1-2:一次请求的五个环节与循环。
UI 上的每个控件,都是这张图某个节点的入口**——这是全书反复回到的一句话。
1.7 这本书怎么读
第 2 章建立 Harness 的完整心智模型,第 3 章带你走一遍本地目录。第 4 到 6 章讲「拼装」环节的三大件:记忆、提示词、身份。第 7 到 9 章讲扩展系统:专家、插件、技能。第 10 到 12 章讲证据与安全。第 13 章把 WorkBuddy 放回腾讯产品矩阵。第 14 章是实战:排查不生效、做第一次安全定制。第 15 章讲这套材料怎么变成课程。
只会按按钮的读者,主线读第 1—3、5、7、12、14 章;想动手定制的实践者,把第 4、6、8、9、10 章补全;要讲这门课的人,再加第 13、15 章的叙事层。
所有证据冻结于 WorkBuddy 5.3.13(2026 年 8 月)。这个产品平均两天发一版,书里的机制会有过时的一天——但拆解方法不会,那是你带得走的东西。