有钛度的 AI 观察 — 每周更新 EST. 2026 · GETAITI.COM
深度 · 原创 · 周更 WEEKLY · 有钛度

归档 / NO.004 · 深度观察 · Personal AI · 强化学习

AI 记住了你,但它真的学会了吗?

AI 记住你,不等于 AI 学会你:Memory 存的是过去,真正的 Learning 要改变以后。从一次语音对话的别扭体验出发,聊记忆、强化学习与 Personal AI 真正属于用户的那部分。

作者 Jeffrey Hu 2026.08.31 约 5,700 字 阅读 12 分钟
本文章节 · CONTENTS 10
  1. 01 Memory 更像一本随身笔记
  2. 02 让我纠结的是一些很小的对话
  3. 03 这个问题把我逼去补 RL 的课
  4. 04 最近看的两期访谈,让我发现这条线比我想的长
  5. 05 「同一个模型越用越聪明」可能也想简单了
  6. 06 哪些东西应该跟着用户走
  7. 07 顺着这条线,我又碰到了 RSI
  8. 08 我在自己的 Mac 上先试了一点
  9. 09 然后我决定先不往下做了
  10. 10 先停在这里

最近半年我一直在折腾本地语音 AI。

最开始只是把 ASR、TTS 和本地大模型串起来,后来一点点往上加东西:用户画像、短期记忆、长期记忆、声纹识别。到现在的版本,它认识我,记得我们聊过什么,也摸到一些我的习惯,越来越像一个能长期相处的 AI。

前几天我突然冒出一个问题:

如果把它所有的 Memory 都删掉,它还剩下什么?

答案是,模型还是那个模型。

什么都没变。

于是我第一次认真区分这两件事:

AI 记住你,和 AI 学会你,可能根本不是一回事。

AI 记住你,和 AI 学会你,是两件事

Memory 更像一本随身笔记

现在做 Memory 的产品越来越多,方向本身没错——一个每次打开都把你当陌生人的 AI,成不了长期助手。

主流做法是从聊天记录里抽取要点存起来,下次需要时再塞回上下文。比如你以前说过「我不喜欢太长的回答」,以后每次提问,模型都会额外收到一句「这个用户喜欢简洁」,于是它答得短一点。

体验上很像 AI 学会了你的习惯。

但换个角度,更像是每次回答前有人递给它一张纸条:

这个人喜欢短的,注意一下。

纸条抽走,模型一点变化都没有。

Memory、RAG、个人知识库,解决的主要还是同一类问题:

这一次推理,该把哪些旧信息重新告诉模型。

Learning 应该是另一件事。

让我纠结的是一些很小的对话

晚上语音聊天,你说:

有点困了,我感觉还是早点睡觉吧。

AI 很可能会回:

好的,那今天就早点休息吧。对了,你明天有什么安排吗?

单看文字没什么毛病,甚至挺礼貌。

但语音里就很别扭:人已经准备结束了,它还在拼命找下一个话题。

这个问题好解决。

改 Prompt,或者存一条 Memory,都会有效。

但我想的是另一种情况:

这个 AI 已经跟你聊了几个月,它经历过很多次这样的时刻。

有时候它追问,被你打断;有时候它只说一句晚安,对话自然结束;有时候它说了一大段,TTS 还没念完你就按了停止。

这些已经不只是「过去发生了什么」,更像经验。

如果这些经验能让 AI 慢慢形成一个倾向——这种时候少说两句比追问更合适——而且下次遇到类似情况,哪怕 Prompt 里没写,它也倾向这么做,那才有点像「学会」。

这个问题把我逼去补 RL 的课

以前我对强化学习的理解停留在 AlphaGo、RLHF,以及 DeepSeek-R1 之后 RL 的再次爆火。

再往下问就不行了:

PPO 是什么?

GRPO 为什么不要 Critic?

Rollout 具体指什么?

为什么现在做 RL 又会扯上 SGLang 和推理性能?

最近顺着一条线看下来,对我来说最容易理解的说法是:

Rollout → Reward → Policy Update

模型先真的做一次,系统看结果好不好,好的行为以后概率高一点,差的行为低一点。

数学和编程最好办,答案可以验证,代码可以跑测试。

Agent 也好办一些:有没有真的调工具、有没有改到日程、任务最后成没成。

到了陪伴和语音对话,麻烦就来了——「这段聊天舒不舒服」没有标准答案。

而且 Reward 设计错了,还可能往反方向学。

比如把「用户聊得越久越好」当 Reward,最后训出来的多半是个特别烦人的 AI:不停追问、不肯结束,因为把聊天时长做高最容易。

所以我现在觉得,Personal AI 真正难的地方可能不在 PPO、GRPO 这些算法,而在前面那句:

什么才算一次好的 Experience?

最近看的两期访谈,让我发现这条线比我想的长

一期是 Pyromind 创始人 Kevin Ding,讲 AutoRL、Post-training,以及模型上线之后怎么把真实业务里的反馈再送回来。

另一期是朱邦华,聊 PPO、强化学习系统和 SGLang。

Kevin Ding 在节目里还谈到一个我比较有感触的区别。

Prompt、Memory、Harness、Workflow,这些模型外部的东西都很重要。它们可以给模型补信息、加工具、限定流程、做验证,让 Agent 把任务更稳定地跑通。

但它们有一个共同点:

主要是在模型外部增强系统,而不是直接改变模型本身。

如果讨论的是模型自己的行为倾向能不能稳定发生变化,那就开始进入 Post-training:把真实业务里的部分反馈重新变成训练信号,再更新模型。

这两条路也不是谁替代谁。

很多流程明确、异常有限的事情,Harness 可能已经够用了;只有那些决策复杂、环境不断变化,而且确实能定义反馈的任务,RL 才更值得做。

听到这里我停了一下。

这和我前面纠结的 Memory 和 Learning,其实是很像的问题。

Memory、Prompt、Harness 本身当然不是同一个东西,但它们更多是在模型外面帮它。

而我真正好奇的是:

模型自己有没有可能因为过去发生过的事情而改变。

很多概念我是边看边查的,但看完之后有一个感觉越来越清楚。

从 Train → Deploy 的一条线,变成 Deploy → Experience → Feedback → Post-training 的一个圈

以前我脑子里模型开发的流程是一条线:

Train → Deploy → User Use

上线之后,模型基本就定型了。

现在越来越多人在想办法把后面重新接回来:

Deploy → Experience → Feedback → Post-training → Deploy

一条线变成一个圈。

这件事比「PPO 和 GRPO 哪个更好」有意思得多。

「同一个模型越用越聪明」可能也想简单了

我一开始很自然地想:

如果 Personal AI 能用用户长期产生的 Experience 做后训练,几年之后,它是不是就会变成一个越来越属于这个人的模型?

再想下去发现有个漏洞:

Base Model 自己会换。

《Densing law of LLMs》提出一个指标叫 Capability Density,能力密度,粗略理解就是同样的参数量能装多少有效能力。

论文分析了公开基础模型,发现最大能力密度大约每 3.5 个月翻一倍。

这是经验规律,不代表每 3.5 个月就得换一次模型,但它说明达到同样性能所需的参数量在快速下降。论文还进一步估算,把算法效率和硬件进步合起来看,固定价格硬件能承载的「有效模型规模」大约每 88 天翻倍。

这对端侧 AI 意义很大。

今天 8B 才能做的事,过段时间 4B 也许就够了;今天 4B 才能做的,以后 1B 到 2B 可能就行。

所以我不太相信一个 Personal AI 会抱着同一个 Base Model 用五年。

模型多半会一直换。

那以前「学到」的那些东西怎么办?

哪些东西应该跟着用户走

以前提到个性化模型,我第一反应是:

给每个用户训一个自己的 LoRA。

查过之后发现没那么简单。

LoRA 是附着在某个 Base Model 上训练的。Base Model 换了,旧 Adapter 不能保证还能直接用。

所以我现在会暂时把 Personal AI 里的东西拆开来看。

Personal AI 的分层:Memory、Experience、Preference、Evaluation、Adapter

Memory 存的是事实:你是谁、说过什么、有哪些资料。

Experience 存的是过程:当时什么上下文、AI 做了什么、你有没有打断、任务最后成没成。

Preference / Reward 存的是判断:这个用户通常喜欢什么、讨厌什么。

Evaluation 是一套相对稳定的测试:模型换了之后,怎么确认新 AI 还留着以前那些好习惯。

最后才是 Adapter / LoRA

它更像是某个阶段,把这些东西训进当前 Base Model 之后的产物。

我还不知道最终的 Personal AI 是不是一定会这么分层,但至少这样拆开以后,我终于能回答一个以前没想明白的问题:

换掉 Base Model 时,哪些东西应该跟着用户一直留下来,哪些东西可以重新生成?

打个不严谨的比方:

Memory 像笔记。

Experience 像真发生过的事。

Preference 和 Eval 像慢慢形成的判断标准。

Adapter 像一次编译出来的结果。

Base Model 换了,编译结果重新生成就行,但经历不该丢。

这个想法对我触动挺大。

它意味着:

Personal AI 真正属于用户的部分,可能根本不在 Base Model 里。

顺着这条线,我又碰到了 RSI

也是查这些东西的时候,我开始频繁碰到一个词:

RSI,Recursive Self-Improvement,递归自我改进。

为此我还专门去查了田渊栋。

他之前在 Meta FAIR 待了十多年,做强化学习和规划,现在是 Recursive Superintelligence 的联合创始人。

RSI 这个词很容易让人联想到「AI 疯狂修改自己,然后奔向超级智能」。

但 Recursive 现在公开在做的事情要具体得多:

让 AI 参与提出训练想法、改代码、跑实验、验证结果,再根据结果决定下一轮做什么。

也就是:

提出想法 → 实现 → 实验 → 验证 → 下一轮

这已经比我折腾的东西远多了。

我的 Personal AI 问题顶多算:

能不能从过去使用的 Experience 里,让模型以后做得稍微更合适一点。

它更接近 Continual Learning 或持续 Personalization,离真正的 RSI 还很远。

不过顺着这个过程,我至少把这几个词的层次慢慢理顺了:

Memory 是记住。

Continual Learning 是能不能从经历里继续改变。

RSI 再往前一步,是 AI 开始参与改进「怎么让自己变强」这件事。

我自己也还在补课。

至少现在看到 RSI、GRPO、Rollout 这些词,不会像以前一样完全发懵了。

Memory 是记住,Continual Learning 是继续改变,RSI 是改进如何变强

我在自己的 Mac 上先试了一点

想了这么多,我还是想自己跑一次。

我现在本地数字人用的是 Qwen3.5-4B,所以设计了个很小的实验:

先不让 AI 学「怎么说」,只让它判断这次对话该继续,还是该结束。

先用一个 0.6B 模型测试。

20 条测试,表面准确率 50%。

但这个 50% 没有任何意义。

它不管遇到什么情况,一律回答:

END

我把 temperature 调高,同一个场景 Rollout 16 次,还是 16 次全 END。

那一刻我才真正体会到:

RL 不是魔法。

模型连正确行为都几乎探索不到,Reward 连「哪个好」都没机会告诉它。

后来换成我实际在用的 Qwen3.5-4B。

同样一套简单测试,20 条对了 19 条,95%。

于是我把题目加难,专门放一些容易混淆的对话:

明天还要早起,我们明天继续。

我先去开会,晚点有空再聊。

今天工作就到这里,不过我们随便聊会儿。

我本来准备睡了,但还有最后一个问题。

40 条 Hard Case,准确率掉到了 85%

更有意思的是,CONTINUE 它 20 条全对,END 只有 70%

它最容易栽在「今天先结束、但以后还会继续」这种话上。

比如:

我先去开会,晚点有空再聊。

模型看到「晚点再聊」,容易判断成 CONTINUE。

但从语音交互的角度,我真正关心的是:

现在这一轮还该不该继续说?

答案应该是 END。

我还挑了几个场景做随机 Rollout。

比如:

嗯,我感觉还是早点睡觉吧。

16 次里:

13 次 END,3 次 CONTINUE。

而:

今天就别聊工作了,我们聊点别的。

16 次里:

13 次 CONTINUE,3 次 END。

这是我第一次比较直观地看到 Policy 是什么感觉。

模型脑子里不是存着一个固定答案。

同一个场景下,它其实有不同的行为概率。

如果继续做 GRPO,理论上就是通过 Reward,把更合适的行为概率慢慢抬上去。

13:3,也许变成 15:1。

甚至 16:0。

同一个场景随机 Rollout 的结果:行为概率从 13:3 走向 16:0

然后我决定先不往下做了

我本来打算把 Reward Function、训练数据和 GRPO 一路做下去。

但做到这里先停了。

不是跑不动。

我用的 mlxrl 已经可以在 Apple Silicon 上做本地 GRPO、QLoRA 和多轮 Agent rollout。

而是继续往下以后,实验设计开始比我想象中复杂很多。

哪些数据应该训练?

哪些必须永远留作测试?

模型本来已经会的那 95%,还有没有必要训练?

Reward 到底应该怎么设计?

如果模型根本探索不到正确行为,是应该先做 SFT,还是继续 RL?

做到这里,我反而更能理解前面那些访谈里一直强调的一件事:

真正让 RL work 的,远不只是一个 GRPO 算法。

算法本身可能反而是比较容易理解的那一部分。

先停在这里

所以这次我没有训出一个「越用越懂我的 Personal AI」。

最多算是顺着自己产品里的一个小问题,往里面走了一段。

但这段路还是改变了我对 Memory 的看法。

以前我觉得:

AI 记得越多,差不多就是 Personal AI 了。

现在不这么想。

Memory 很重要,但它记的是过去。

真正有意思的问题是:

这些过去,有没有一天真的会改变 AI 以后怎么做?

而且就算未来能做到,长期留下来的也未必是某个 Base Model,甚至未必是某个 LoRA。

模型会换。

Adapter 会重新训练。

真正值得长期保存的,也许是 Memory、Experience、Preference,以及那套用来判断:

「这个 AI 到底有没有越来越适合我」

的 Evaluation。

我现在对 Personal AI 最感兴趣的,反而落在了这里:

不是它记住了多少,而是有一天,过去真的发生过的事情,开始改变它以后的做法。


最近看的一些资料

[1] Chaojun Xiao 等,Densing law of LLMs,Nature Machine Intelligence,2025

论文提出 Capability Density,并观察到公开基础模型的最大能力密度大约每 3.5 个月翻倍。

[2] Recursive Superintelligence,First Steps Toward Automated AI Research,2026

Recursive 展示了一个自动化 AI Research Loop:提出想法、实现、实验、验证,再根据结果选择下一轮实验。

[3] Yuandong Tian / Recursive Superintelligence

田渊栋参与创办的 Recursive 正在探索 Recursive Self-Improvement 和自动化知识发现。

[4] mlxrl

一个面向 Apple Silicon 的本地 LLM on-policy RL 项目,目前支持 GRPO-family RL、QLoRA 和多轮 GiGPO。

[5] 最近看的两期访谈

Pyromind 创始人 Kevin Ding 关于 AutoRL、Post-training、RSI 的讨论(十字路口播客),以及朱邦华关于 PPO、强化学习系统和 SGLang 的访谈(B 站视频),也是这次思考的起点之一。

订阅 · SUBSCRIBE

扫码关注公众号

文章每周更新,网站和公众号「AITi智能」同步发布。 想在微信里第一时间看到,扫码关注。

  1. 01 微信搜索「AITi智能」
  2. 02 关注并加星标
  3. 03 每周更新,不见不散
公众号「AITi智能」二维码

扫码关注 · 每周一篇