归档 / NO.004 · 深度观察 · Personal AI · 强化学习
AI 记住了你,但它真的学会了吗?
AI 记住你,不等于 AI 学会你:Memory 存的是过去,真正的 Learning 要改变以后。从一次语音对话的别扭体验出发,聊记忆、强化学习与 Personal AI 真正属于用户的那部分。
本文章节 · CONTENTS 10
最近半年我一直在折腾本地语音 AI。
最开始只是把 ASR、TTS 和本地大模型串起来,后来一点点往上加东西:用户画像、短期记忆、长期记忆、声纹识别。到现在的版本,它认识我,记得我们聊过什么,也摸到一些我的习惯,越来越像一个能长期相处的 AI。
前几天我突然冒出一个问题:
如果把它所有的 Memory 都删掉,它还剩下什么?
答案是,模型还是那个模型。
什么都没变。
于是我第一次认真区分这两件事:
AI 记住你,和 AI 学会你,可能根本不是一回事。

Memory 更像一本随身笔记
现在做 Memory 的产品越来越多,方向本身没错——一个每次打开都把你当陌生人的 AI,成不了长期助手。
主流做法是从聊天记录里抽取要点存起来,下次需要时再塞回上下文。比如你以前说过「我不喜欢太长的回答」,以后每次提问,模型都会额外收到一句「这个用户喜欢简洁」,于是它答得短一点。
体验上很像 AI 学会了你的习惯。
但换个角度,更像是每次回答前有人递给它一张纸条:
这个人喜欢短的,注意一下。
纸条抽走,模型一点变化都没有。
Memory、RAG、个人知识库,解决的主要还是同一类问题:
这一次推理,该把哪些旧信息重新告诉模型。
Learning 应该是另一件事。
让我纠结的是一些很小的对话
晚上语音聊天,你说:
有点困了,我感觉还是早点睡觉吧。
AI 很可能会回:
好的,那今天就早点休息吧。对了,你明天有什么安排吗?
单看文字没什么毛病,甚至挺礼貌。
但语音里就很别扭:人已经准备结束了,它还在拼命找下一个话题。
这个问题好解决。
改 Prompt,或者存一条 Memory,都会有效。
但我想的是另一种情况:
这个 AI 已经跟你聊了几个月,它经历过很多次这样的时刻。
有时候它追问,被你打断;有时候它只说一句晚安,对话自然结束;有时候它说了一大段,TTS 还没念完你就按了停止。
这些已经不只是「过去发生了什么」,更像经验。
如果这些经验能让 AI 慢慢形成一个倾向——这种时候少说两句比追问更合适——而且下次遇到类似情况,哪怕 Prompt 里没写,它也倾向这么做,那才有点像「学会」。
这个问题把我逼去补 RL 的课
以前我对强化学习的理解停留在 AlphaGo、RLHF,以及 DeepSeek-R1 之后 RL 的再次爆火。
再往下问就不行了:
PPO 是什么?
GRPO 为什么不要 Critic?
Rollout 具体指什么?
为什么现在做 RL 又会扯上 SGLang 和推理性能?
最近顺着一条线看下来,对我来说最容易理解的说法是:
Rollout → Reward → Policy Update
模型先真的做一次,系统看结果好不好,好的行为以后概率高一点,差的行为低一点。
数学和编程最好办,答案可以验证,代码可以跑测试。
Agent 也好办一些:有没有真的调工具、有没有改到日程、任务最后成没成。
到了陪伴和语音对话,麻烦就来了——「这段聊天舒不舒服」没有标准答案。
而且 Reward 设计错了,还可能往反方向学。
比如把「用户聊得越久越好」当 Reward,最后训出来的多半是个特别烦人的 AI:不停追问、不肯结束,因为把聊天时长做高最容易。
所以我现在觉得,Personal AI 真正难的地方可能不在 PPO、GRPO 这些算法,而在前面那句:
什么才算一次好的 Experience?
最近看的两期访谈,让我发现这条线比我想的长
一期是 Pyromind 创始人 Kevin Ding,讲 AutoRL、Post-training,以及模型上线之后怎么把真实业务里的反馈再送回来。
另一期是朱邦华,聊 PPO、强化学习系统和 SGLang。
Kevin Ding 在节目里还谈到一个我比较有感触的区别。
Prompt、Memory、Harness、Workflow,这些模型外部的东西都很重要。它们可以给模型补信息、加工具、限定流程、做验证,让 Agent 把任务更稳定地跑通。
但它们有一个共同点:
主要是在模型外部增强系统,而不是直接改变模型本身。
如果讨论的是模型自己的行为倾向能不能稳定发生变化,那就开始进入 Post-training:把真实业务里的部分反馈重新变成训练信号,再更新模型。
这两条路也不是谁替代谁。
很多流程明确、异常有限的事情,Harness 可能已经够用了;只有那些决策复杂、环境不断变化,而且确实能定义反馈的任务,RL 才更值得做。
听到这里我停了一下。
这和我前面纠结的 Memory 和 Learning,其实是很像的问题。
Memory、Prompt、Harness 本身当然不是同一个东西,但它们更多是在模型外面帮它。
而我真正好奇的是:
模型自己有没有可能因为过去发生过的事情而改变。
很多概念我是边看边查的,但看完之后有一个感觉越来越清楚。

以前我脑子里模型开发的流程是一条线:
Train → Deploy → User Use
上线之后,模型基本就定型了。
现在越来越多人在想办法把后面重新接回来:
Deploy → Experience → Feedback → Post-training → Deploy
一条线变成一个圈。
这件事比「PPO 和 GRPO 哪个更好」有意思得多。
「同一个模型越用越聪明」可能也想简单了
我一开始很自然地想:
如果 Personal AI 能用用户长期产生的 Experience 做后训练,几年之后,它是不是就会变成一个越来越属于这个人的模型?
再想下去发现有个漏洞:
Base Model 自己会换。
《Densing law of LLMs》提出一个指标叫 Capability Density,能力密度,粗略理解就是同样的参数量能装多少有效能力。
论文分析了公开基础模型,发现最大能力密度大约每 3.5 个月翻一倍。
这是经验规律,不代表每 3.5 个月就得换一次模型,但它说明达到同样性能所需的参数量在快速下降。论文还进一步估算,把算法效率和硬件进步合起来看,固定价格硬件能承载的「有效模型规模」大约每 88 天翻倍。
这对端侧 AI 意义很大。
今天 8B 才能做的事,过段时间 4B 也许就够了;今天 4B 才能做的,以后 1B 到 2B 可能就行。
所以我不太相信一个 Personal AI 会抱着同一个 Base Model 用五年。
模型多半会一直换。
那以前「学到」的那些东西怎么办?
哪些东西应该跟着用户走
以前提到个性化模型,我第一反应是:
给每个用户训一个自己的 LoRA。
查过之后发现没那么简单。
LoRA 是附着在某个 Base Model 上训练的。Base Model 换了,旧 Adapter 不能保证还能直接用。
所以我现在会暂时把 Personal AI 里的东西拆开来看。

Memory 存的是事实:你是谁、说过什么、有哪些资料。
Experience 存的是过程:当时什么上下文、AI 做了什么、你有没有打断、任务最后成没成。
Preference / Reward 存的是判断:这个用户通常喜欢什么、讨厌什么。
Evaluation 是一套相对稳定的测试:模型换了之后,怎么确认新 AI 还留着以前那些好习惯。
最后才是 Adapter / LoRA。
它更像是某个阶段,把这些东西训进当前 Base Model 之后的产物。
我还不知道最终的 Personal AI 是不是一定会这么分层,但至少这样拆开以后,我终于能回答一个以前没想明白的问题:
换掉 Base Model 时,哪些东西应该跟着用户一直留下来,哪些东西可以重新生成?
打个不严谨的比方:
Memory 像笔记。
Experience 像真发生过的事。
Preference 和 Eval 像慢慢形成的判断标准。
Adapter 像一次编译出来的结果。
Base Model 换了,编译结果重新生成就行,但经历不该丢。
这个想法对我触动挺大。
它意味着:
Personal AI 真正属于用户的部分,可能根本不在 Base Model 里。
顺着这条线,我又碰到了 RSI
也是查这些东西的时候,我开始频繁碰到一个词:
RSI,Recursive Self-Improvement,递归自我改进。
为此我还专门去查了田渊栋。
他之前在 Meta FAIR 待了十多年,做强化学习和规划,现在是 Recursive Superintelligence 的联合创始人。
RSI 这个词很容易让人联想到「AI 疯狂修改自己,然后奔向超级智能」。
但 Recursive 现在公开在做的事情要具体得多:
让 AI 参与提出训练想法、改代码、跑实验、验证结果,再根据结果决定下一轮做什么。
也就是:
提出想法 → 实现 → 实验 → 验证 → 下一轮
这已经比我折腾的东西远多了。
我的 Personal AI 问题顶多算:
能不能从过去使用的 Experience 里,让模型以后做得稍微更合适一点。
它更接近 Continual Learning 或持续 Personalization,离真正的 RSI 还很远。
不过顺着这个过程,我至少把这几个词的层次慢慢理顺了:
Memory 是记住。
Continual Learning 是能不能从经历里继续改变。
RSI 再往前一步,是 AI 开始参与改进「怎么让自己变强」这件事。
我自己也还在补课。
至少现在看到 RSI、GRPO、Rollout 这些词,不会像以前一样完全发懵了。

我在自己的 Mac 上先试了一点
想了这么多,我还是想自己跑一次。
我现在本地数字人用的是 Qwen3.5-4B,所以设计了个很小的实验:
先不让 AI 学「怎么说」,只让它判断这次对话该继续,还是该结束。
先用一个 0.6B 模型测试。
20 条测试,表面准确率 50%。
但这个 50% 没有任何意义。
它不管遇到什么情况,一律回答:
END
我把 temperature 调高,同一个场景 Rollout 16 次,还是 16 次全 END。
那一刻我才真正体会到:
RL 不是魔法。
模型连正确行为都几乎探索不到,Reward 连「哪个好」都没机会告诉它。
后来换成我实际在用的 Qwen3.5-4B。
同样一套简单测试,20 条对了 19 条,95%。
于是我把题目加难,专门放一些容易混淆的对话:
明天还要早起,我们明天继续。
我先去开会,晚点有空再聊。
今天工作就到这里,不过我们随便聊会儿。
我本来准备睡了,但还有最后一个问题。
40 条 Hard Case,准确率掉到了 85%。
更有意思的是,CONTINUE 它 20 条全对,END 只有 70%。
它最容易栽在「今天先结束、但以后还会继续」这种话上。
比如:
我先去开会,晚点有空再聊。
模型看到「晚点再聊」,容易判断成 CONTINUE。
但从语音交互的角度,我真正关心的是:
现在这一轮还该不该继续说?
答案应该是 END。
我还挑了几个场景做随机 Rollout。
比如:
嗯,我感觉还是早点睡觉吧。
16 次里:
13 次 END,3 次 CONTINUE。
而:
今天就别聊工作了,我们聊点别的。
16 次里:
13 次 CONTINUE,3 次 END。
这是我第一次比较直观地看到 Policy 是什么感觉。
模型脑子里不是存着一个固定答案。
同一个场景下,它其实有不同的行为概率。
如果继续做 GRPO,理论上就是通过 Reward,把更合适的行为概率慢慢抬上去。
13:3,也许变成 15:1。
甚至 16:0。

然后我决定先不往下做了
我本来打算把 Reward Function、训练数据和 GRPO 一路做下去。
但做到这里先停了。
不是跑不动。
我用的 mlxrl 已经可以在 Apple Silicon 上做本地 GRPO、QLoRA 和多轮 Agent rollout。
而是继续往下以后,实验设计开始比我想象中复杂很多。
哪些数据应该训练?
哪些必须永远留作测试?
模型本来已经会的那 95%,还有没有必要训练?
Reward 到底应该怎么设计?
如果模型根本探索不到正确行为,是应该先做 SFT,还是继续 RL?
做到这里,我反而更能理解前面那些访谈里一直强调的一件事:
真正让 RL work 的,远不只是一个 GRPO 算法。
算法本身可能反而是比较容易理解的那一部分。
先停在这里
所以这次我没有训出一个「越用越懂我的 Personal AI」。
最多算是顺着自己产品里的一个小问题,往里面走了一段。
但这段路还是改变了我对 Memory 的看法。
以前我觉得:
AI 记得越多,差不多就是 Personal AI 了。
现在不这么想。
Memory 很重要,但它记的是过去。
真正有意思的问题是:
这些过去,有没有一天真的会改变 AI 以后怎么做?
而且就算未来能做到,长期留下来的也未必是某个 Base Model,甚至未必是某个 LoRA。
模型会换。
Adapter 会重新训练。
真正值得长期保存的,也许是 Memory、Experience、Preference,以及那套用来判断:
「这个 AI 到底有没有越来越适合我」
的 Evaluation。
我现在对 Personal AI 最感兴趣的,反而落在了这里:
不是它记住了多少,而是有一天,过去真的发生过的事情,开始改变它以后的做法。
最近看的一些资料
[1] Chaojun Xiao 等,Densing law of LLMs,Nature Machine Intelligence,2025
论文提出 Capability Density,并观察到公开基础模型的最大能力密度大约每 3.5 个月翻倍。
[2] Recursive Superintelligence,First Steps Toward Automated AI Research,2026
Recursive 展示了一个自动化 AI Research Loop:提出想法、实现、实验、验证,再根据结果选择下一轮实验。
[3] Yuandong Tian / Recursive Superintelligence
田渊栋参与创办的 Recursive 正在探索 Recursive Self-Improvement 和自动化知识发现。
[4] mlxrl
一个面向 Apple Silicon 的本地 LLM on-policy RL 项目,目前支持 GRPO-family RL、QLoRA 和多轮 GiGPO。
[5] 最近看的两期访谈
Pyromind 创始人 Kevin Ding 关于 AutoRL、Post-training、RSI 的讨论(十字路口播客),以及朱邦华关于 PPO、强化学习系统和 SGLang 的访谈(B 站视频),也是这次思考的起点之一。
订阅 · SUBSCRIBE
扫码关注公众号
文章每周更新,网站和公众号「AITi智能」同步发布。 想在微信里第一时间看到,扫码关注。
- 01 微信搜索「AITi智能」
- 02 关注并加星标
- 03 每周更新,不见不散
扫码关注 · 每周一篇