梁文锋和 Mind Lab,看向了同一个问题:持续学习

七颜百科 °C 栏目:科技科普
梁文锋和 Mind Lab,看向了同一个问题:持续学习

如今,Agent 已经能够连续调用工具、运行代码,并根据执行结果反复修改,直到完成一项复杂任务。但任务做对一次,不等于模型已经学会了这件事。下一次遇到相似问题时,它仍可能重新走一遍原来的路径,甚至重复同样的错误。

这是持续学习要解决的问题。上下文和记忆可以保存任务信息,供模型下一次重新读取;持续学习则要从行动和结果中筛选有效经验,再通过训练改变模型以后处理同类任务的方式。

在近期一场闭门会议上,DeepSeek 创始人梁文锋谈到,Agent 之后需要解决的问题是持续学习,这也是他认为下一代模型必须具备的能力。他直言:“AI 现在不缺品味和直觉,缺的是持续学习的能力。”随着 Agent 承担更长、更复杂的任务,如何把部署后的经历转化为新的能力,正在成为模型迭代的新课题。

Mindverse 也把持续学习作为旗下前沿研究实验室 Mind Lab 的主要研究方向。今年年初,公司累计完成 5000 万美元融资,由美团战投领投,元禾璞华、韶音科技、变量资本及老股东追加跟投,历史股东包括蚂蚁、源一、红杉中国、真格和高榕。

近期,Mind Lab 发布 Macaron V1,展示了团队在这一方向上的最新进展。模型使用 LoRA 保存可以独立训练和更新的专业能力,让经过筛选的任务经验能够进入后续训练。Mind Lab 将更长期的目标称为“经验智能机器”:模型从行动结果中学习,让过去的经历影响下一次判断。

Macaron V1 的能力分工

对话、工具调用、编程和界面生成对应不同的训练目标,持续更新同一组模型参数,容易造成能力之间的相互影响,也会增加后训练成本。Macaron V1 是面向个人智能体场景发布的开源模型,提供 Venti 和 Tall 两个版本。

Venti 总参数量为 748B,基于 GLM-5.2 完成后训练,原生支持 200 万 token 超长上下文。模型采用 Mixture-of-LoRA 架构:744B 基础参数保持冻结,Chat、Agent、Coding 和 GenUI 四种能力分别写入四个 1B LoRA。四个 LoRA 共享同一基础模型,又可以分别训练和更新;增加新的任务方向时,也可以继续训练新的 LoRA,无需同步更新完整基础模型。

其中,Chat 负责对话和指令遵循,Agent 处理长程任务与工具调用,Coding 负责代码、SWE 和终端操作,GenUI 负责界面生成与操作。

35B 的 Tall 基于 Qwen 3.6 完成后训练,面向本地部署。两个版本的权重、官方 API 和配套工具均已上线。

在覆盖 Chat、Agent、Coding 和 Generative UI 的 12 项评测中,Venti 与 GPT-5.5、Opus 4.8、Gemini 3.1 Pro、Qwen 3.7 Max 等模型进行比较。Venti 在全部项目中超过 GLM-5.2,并取得 6 项最高分;其余项目与前沿模型处于相近水平,部分任务仍有差距。

跑分给出了不同能力在单项评测中的位置,真实任务还要检验这些能力能否在同一条流程中配合。

有新另行设置了一项前端任务,以相同要求测试 Macaron V1 与 ChatGPT 5.6 的界面生成能力。测试通过 Claude Code 调用 Macaron API,要求模型制作一款带有四标签导航的记账 App,覆盖账单流水、新增记账、统计分析和个人数据管理。Macaron V1 生成了相应页面,底部导航、功能模块、图标和文字基本保持对齐,页面结构与视觉样式较为统一。

相比之下,ChatGPT 5.6 也生成了可运行界面,但部分图标的尺寸和位置不一致,个别元素超出容器边界,页面对齐和信息层级相对混乱。

持续学习:让经历改变下一次行动

Agent 执行任务时会留下工具调用、代码运行结果、成功路径和失败步骤。经过验证的任务轨迹可以重新进入训练,影响模型下一次处理相似任务的方式。

强化学习领域奠基者 Richard Sutton 与 AlphaGo 前首席研究员 David Silver 在 2025 年共同发表《Welcome to the Era of Experience》,将 AI 从长期环境互动中获得学习材料的方向称为“经验时代”。代码是否通过测试、工具是否执行成功、任务是否完成,都可以成为训练信号。

在 Mind Lab 的训练流程中,Agent Harness 保留模型执行任务时的环境、行动和工具返回,MindForge 检查任务是否完成,并从中筛选可以用于后训练的轨迹。经过筛选的经验进入 LoRA 更新,新的模型版本再回到任务环境中。

不同任务的结果并不都能直接判断。代码测试和工具执行通常有明确反馈,用户意见和长程任务则需要结合完整过程分析。Hindsight 用于检查行动与最终结果之间的关系,LivingBench 将新出现的场景和问题加入后续评测。

反复更新还需要控制成本。Mind Lab 在总参数量为 1.04T 的 Kimi K2 上完成 LoRA 强化学习,计算与通信开销约为全参数强化学习的 10%。相关训练使用的基础模型已经从 4B 扩展至 1T,下一步还将继续扩大模型和并行训练规模。

LoRA 降低了单次更新需要改动的参数量,也会让同一个基础模型上出现越来越多的专业版本。模型数量增加以后,问题便从“怎样完成一次更新”转向“怎样管理和组合不同的更新结果”。

群体智能:扩大专业模型的数量

持续学习会让同一个基础模型沿着不同任务和训练数据形成多个 LoRA。Macaron V1 的四个专业 LoRA 是这种分工的初步形态;随着更新次数增加,还会出现面向不同用户、织、代码库和工作环境的模型版本。

Mind Lab 将这一方向概括为 “Scale Number of Models”。Macaron V1 中的四个 LoRA 已经形成第一层专业分工:Chat、Agent、Coding 和 GenUI 共享同一个基础模型,同时保留各自的训练结果。相同结构还可以扩展到不同用户、组织、代码库和工作环境。

Mind Lab 在《On the Scaling of PEFT》中测试了不同训练经历能否形成可利用的模型差异。实验使用同一个 Qwen3-30B 基础模型和相同的强化学习方法,只改变数据顺序和 masking。单个 Adapter 在 AIME24 上的准确率为 36.44%;198 个不同 Adapter 进行多数投票后提高至 48.67%;对同一个 Adapter 进行相同规模的重复采样,最高为 43.78%。

这组数学实验说明,不同训练过程产生的 Adapter 可能形成互补,但还没有验证多个 Agent 在真实工作流中的稳定协作。团队计划将参与训练和聚合的模型从约 200 个扩大至 2 万个,再进一步推进到 200 万个。

模型数量扩大后,版本管理成为新的工程问题。MinT 以 Adapter revision 为单位保存 LoRA 的训练记录和评测结果,并完成调度、部署与回滚。目前,其目录已经包含 100 万个 Adapter revision,并支持超过 1T 参数基础模型的训练与服务。

当训练、评测和部署大量 LoRA 的流程可以被重复使用,这套能力也就不再只服务于 Macaron V1,而可以向外提供模型训练服务。

从模型能力到企业服务

大多数模型 API 提供的是推理服务:客户发送请求,模型返回结果。Mindverse 在此基础上增加训练服务,让企业能够利用自身任务、专业数据和环境反馈训练专属 LoRA。

公司将两类服务分别称为 Inference Token 和 Learning Token。前者对应模型当前的推理能力,后者用于专业模型的训练、评测和交付。训练结果保存在 LoRA 中,与共享基础模型分开管理;出现新的数据和任务后,相应的 LoRA 可以继续更新。

Learning Token 所面向的需求主要来自科学研究、金融、能源和智能硬件等领域。这些场景拥有持续变化的专业数据、工具和业务规则,通用模型难以在预训练阶段全部覆盖。

模型 API 已经先获得市场需求。6 月底上线后,API 在 2周内实现 1000 万美元 ARR;调用结构中,Agent Workflow 和 Coding 各占约 30%。这部分收入主要来自模型推理调用,Learning Token 仍处在更早的交付阶段。

早期训练项目仍需 Mind Lab 与客户共同确定训练目标,再完成数据处理、模型训练和结果评测。团队正在将训练脚本、数据处理、评测和模型交付逐步标准化,并让 Agent 承担其中更多环节。

Mind Lab 仍在验证,同一套训练、评测和交付流程能否复用到不同企业任务中。