广告
—— 广告位①:导航下方通栏 728x90 ——

AI智能体自己出题自己答,错题变技能,越用越强能走多远?

几十万的 API 额度烧完了,你教会它回邮件。第二天再问它,跟第一次见面似的。丢人。


这就是眼下绝大多数 Agent 的日常——训练完,权重一冻结,今天刚填平的坑,明天照样给你原样漏一遍。于是有人动了心思:让 Agent 自己给自己记笔记、写复盘、攒经验。像个实习生干到第三个月还不认识打印机,那确实该开了。圈里人管这叫,自进化。听着玄乎。

广告
—— 广告位②:文章第二段后插入 ——


把话说明白,就三件事:能存。能用。能进化。走通的路子、踩过的坑、顺手的小技巧——全记下来;新活儿来的时候能翻旧账;旧账还不能越记越乱,该扔的扔,该合的合。一台真长记性的 Agent,不该每次见面都像相亲头一回。


搁以前这事根本推不动。模型权重是死的,上下文开多大都有边儿;想更新一次参数?又贵又慢,训练一回肉疼半年。早年强化学习里那个“经验回放”算是老底子,可那时候模型自己压根不会写总结。现在你看——LLM 能自己记笔记了,Agent 也铺开了,人工标注数据贵得离谱。几根线凑一块,火就点着了。


有人说,这不就是把聊天记录扔进上下文当提示词吗?差远了。存出来的东西是行动指南,不是原始录音带。像厨师记的是菜谱,不是客人吹过的牛皮。现在最前沿的玩法分三拨。第一拨,给 Agent 揣个小本本,模型本体摸都不摸;第二拨,拿经验去训模型,把东西写进权重里,动真格;第三拨最凶——老师也不要了,两个 Agent 互相出题、互相批改,自己跟自己在屋里掰手腕。


你猜哪拨现在最火?


先看第一拨,经验/Skill 存储型。AutoSkill 是代表,外面套了个双环:一个环负责接客——用户提问先改写,再混合检索,最后把技能塞进提示词;另一个环搞进化——从交互信号里抽候选技能,再判断该加、该并、还是该扔。整个模型权重一动不动,成长全在外挂的“脑子”里。


听起来挺美?但你看它的评估报告就让人无语——在 WildChat-1M 上,只报了技能抽取数量,一个性能数字都没给。这算什么?抄了十页错题本,封面贴不少小花,考试照样瞎蒙。存下来容易。用得上?难。


第二拨,RL 训练型,换了个打法:把经验直接写进权重。代表有 EvolveR、SKILL0。路数说穿了就三步——让 Agent 先上手干活,从干砸的活儿里提炼经验;再把这些经验丢进环境里试,挑出高频管用的当奖励偏好;最后用强化学习把偏好揉进模型里。


权重动了,才叫进化。我站这条线。


但代价也明摆着。一次全量训练烧的钱,够我交仨月房租。更没底的是——经验要是错了呢?训练完就是一个更油滑、更自信、更理直气壮犯错的二傻子。这问题没人敢打包票。


第三拨,零数据自学型。我头一回读到的时候人傻了。代表工作叫 Agent0——不靠任何人工标注,两个副本互相考:一个出题,根据已有知识编新任务;另一个答题,答错了就刻成经验;隔一阵拿经验调整策略。


这不自己给自己判卷子吗?我第一反应。


但后来我翻到他们的实验设置就闭嘴了——让 Agent 调工具。工具这玩意儿天然带客观反馈:调没调对,一眼便知。对就是对,错就是错,蒙不了。这种场景下的自循环,疯不到哪去。可你要换个开放式任务……


算了,我就看着它跑。


对了,Agent0 的 GitHub 底下有人问:“这玩意儿进化到最后,会不会把我硬盘里的东西全删了?”最高赞回复是这么写的——“你想多了,它连自己叫什么都记不住。”

广告
—— 广告位③:文末广告(正文结束后) ——
广告
—— 移动端底部轻量广告位 ——