重写了系统提示的分层结构
把「身份、边界、输出契约、工具用法」拆成四段,各自独立维护。改一段不再牵动另外三段,调参的心理负担小了很多。
Personal AI Agent
把一个通用大模型,改造成只替一个人干活的一套系统。它记得我的项目、我的措辞、我踩过的坑, 也知道什么时候该调工具、什么时候该停下来问我一句。这里写的是这套东西怎么长出来的。
我不是在做一款给所有人用的产品,而是在给一个人做助手 —— 那个人就是我自己。 通用的对话模型很强,但它每次开口都像第一次见我:不记得上周那份配置怎么改的, 不知道我讨厌什么样的代码风格,也不会在我没说完之前先把上下文捞出来。
所谓「深度定制」,就是把这几件事一个个补上:把偏好写进系统提示,把项目写进长期记忆, 把重复动作固化成工具,把交付标准变成能自动跑的检查。改完之后它仍然是大模型, 但它说话的方式、判断的顺序、出错时补位的手法,都开始像同一个人。
这件事没有终点。模型在换代,我的项目在变,助手也需要跟着重新长一遍。 所以这里更像一份长期的工作笔记,而不是一次性的成果展示。
把一句含糊的需求拆成可验证的步骤链:先定边界,再定产出,再决定哪几步能并行、 哪几步必须等结果。复杂任务失败,多数时候不是模型不行,而是顺序错了。
分层存放:临时的上下文、跨会话的项目档案、需要长期沉淀的经验条目。 关键是让它在正确的时机捞出正确的那一页,而不是把所有东西一股脑塞进窗口。
读写文件、跑命令、检索资料、批量改写、定时触发。凡是能脚本化的事情都尽量交给工具, 让模型负责判断,让工具负责确定性。
拿真实任务当测试集。改完一轮提示词或工具描述,就跑同一批任务看它有没有变好, 以及有没有把原来能做对的事做坏 —— 这一步最枯燥,也最不能省。
不从「它能做什么」出发,从「我最近哪些活干得最烦」出发。把重复出现、步骤明确、判据清晰的任务先列出来,作为定制的靶子。
输出长度、语气、代码风格、命名习惯、什么时候必须停下来问一句 —— 这些不写下来,模型每次都会给你一个平均答案。
能自动完成的动作固化成脚本,需要跨会话记住的内容沉淀成条目。这一步决定助手是「会说」还是「能干」。
同一批任务跑两遍,对比改动前后的差异。看结果,也看过程:它有没有绕远路、有没有偷偷假设、有没有把不确定当确定。
每次调整都保留上一版。定制是把双刃剑,针对某类任务调得越准,越可能在另一类任务上变窄 —— 所以随时能退回去。
把「身份、边界、输出契约、工具用法」拆成四段,各自独立维护。改一段不再牵动另外三段,调参的心理负担小了很多。
以前每接一个新活都要重写一遍类似的东西。现在开工前先查索引,能复用就不新写,重复劳动少了一截。
不再每次全量重写档案,而是按天追加、按周压缩。检索命中率没降,写入成本降了,翻旧账也更容易。
工具报错不再直接抛给对话层。先按预设策略重试,再退化到最保守的做法,实在不行才回来问。任务中断的次数明显变少。
成功案例没有参考价值,失败案例才有。现在每次翻车都留一条,标清是理解错了、信息不够,还是工具用错了。
聊 AI Agent 的定制、记忆结构、工具编排,或者只是想交换一点踩坑经验,都欢迎来信。 内容我会看,回信不一定及时,但会认真回。