AGENT GENERATION INFRASTRUCTURE
Agent 生成基础设施
让业务 Agent 的创建从单点手工开发,走向可以规模化生产、组合和持续维护的工程体系。
SELECTED WORK / 代表实践
这里不只是展示做过什么,也记录这些系统为什么这样设计、如何被验证,以及哪些数字只是活动证据而不是价值结论。
评估与迭代产生的证据回流,驱动下一轮生成。
AGENT GENERATION INFRASTRUCTURE
让业务 Agent 的创建从单点手工开发,走向可以规模化生产、组合和持续维护的工程体系。
AGENT EVALUATION SYSTEM
用可复现的评估方法,把“感觉能用”转化为可比较、可追踪的质量证据。
CONTINUOUS SELF-OPTIMIZATION
结合运行反馈识别问题、形成优化方案,并用后续结果验证问题是否真正被解决。
SELECTED CASE · CAPABILITY EVALUATION / 能力资产评估
我负责了一套能力资产评估系统的架构设计与全栈实现。核心工作不是做了一块看板,而是把 Agent 级的可观测性,扩展到公司级能力资产的追踪与治理。
从"这个 Agent 跑得好不好",到"公司投入 AI 的产出到底怎样"——资产的覆盖广度、使用深度和实际效果需要同时可见。
看得见,我在评估体系上踩过的四个坑
才有得治。
评估告诉你哪里有问题,但修复需要另一套系统。
SELECTED CASE · SELF-ITERATION OS / 持续迭代系统
我参与设计并推进了一套面向 Agent 的持续迭代机制,重点关注如何从运行反馈中识别问题、形成改进方案,并验证变化是否真正有效。这个项目最重要的收获,不是某个具体模块,而是重新定义系统何时才算“完成”。
早期机制已经能够发现问题并提出改进建议,但一次复盘让我意识到:从信息送达,到使用者采取行动,再到问题真正消失,价值会在每一层继续损耗。
技术链路跑通,
不代表价值闭环成立。
信息已经发出,不代表使用者真正看到。只要没有进入当下的工作流,再好的建议也不会产生价值。
方向正确的大型重构,如果远超日常维护的行动成本,仍然不会落地。系统必须把建议变成足够小、足够明确的下一步。
方案被采纳只代表干预发生了。真正的结果,要看同类问题是否在后续运行中减少或消失。
FROM RECOMMENDATION ENGINE
这次复盘改变了我对终点的定义:不再以“建议已生成”为完成,而是继续关注使用者是否看到、是否行动,以及相同问题是否在后续运行中减少。建议只是过程,真实改变与后续效果才是结果。
识别执行偏差、用户纠正、能力缺口与定义质量问题。
先还原 Agent 的设计决策与执行结构,再用信号验证判断。
经确认后实施修改,并在下一轮运行中追踪真实效果。
这一轮的验证结果,就是下一轮运行要获取的证据。
DESIGN PRINCIPLE / 风险边界
系统可以主动诊断和提出方案,但不会默认直接改写生产中的 Agent。只有经过必要的人工确认与验证后,修改才进入真实交付流程。相比生成了多少建议,我更关注改进是否被采用,以及 Agent 是否因此变得更可靠。
FROM ACTIVITY TO OUTCOME
奖励的对象不应是创建了多少 Agent 或调用了多少次,而应是经过验证的业务增量。阅读这套判断的完整推导