近几个月来,后训练已成为AI行业最受关注的话题。

基础模型公司正扩大强化学习规模;应用公司也在探索如何基于真实业务中的任务轨迹和用户反馈,构建自身后训练流程。

它们共同指向一个趋势:模型在实际环境中积累的经验,正成为下一代智能的基础。

这也带来一个有趣的现象。

全球最活跃的开源模型多来自中国,但围绕这些模型形成的第三方后训练平台,却在海外发展更为迅速。

Thinking Machines Lab的Tinker、Fireworks、Together AI、Prime Intellect和Applied Compute已从不同角度切入这一市场,而国内类似定位的独立平台却寥寥无几。

如今,Mind Lab开始涉足这一领域。

今年7月,它基于GLM-5.2推出了Macaron V1;9月23日,又发布了基于GLM-5.3的Macaron V1.1,并同步推出后训练平台Mint Recursive。

Mind Lab官方信息显示,作为面向企业的后训练与推理平台,Mint Recursive支持GLM、Qwen、DeepSeek、Kimi、MiniMax等开源模型系列,目前提供FDE专家共同训练、平台自动化训练、企业自主训练三种合作方式。

对一家商业公司内部的Neo Lab而言,这一步很务实:在取得一定技术成果后,它需要从论文和实验室走向市场应用。

Macaron V1证明了Mind Lab能够后训练“自己的模型”,而Mint Recursive则开始回答,它能否将这套能力赋能给更多企业。

1

模型发布后,学习才刚开始

先看此次发布的模型。

延续V1的思路,Macaron V1.1是一款752B参数的模型,由GLM-5.3的744B基础权重和四组各约2B的LoRA组成,分别负责Chat、Agent、Coding和生成式UI。

Mind Lab公布的测试结果显示,V1.1在所有7项评测中得分均超过原始GLM-5.3;并在第三方榜单DeepSWE v1.1、SWE-Marathon、AutomationBench上,超越或追平了Opus 5。

这个跑分直观地说明,新增的约8B参数确实提升了模型表现。而它具体改变了哪些表现,也反映出Mind Lab认为模型需要解决哪些问题。

在长程Coding任务中,V1.1所需步骤和Token更少,核心做法是在数据层面将SWE轨迹标准化为五个阶段——复现、定位、编辑、验证、恢复,从而减少低相关度的探索轮次。

在复杂办公场景中,V1.1则重点加强了工具调用安全,要求模型不仅知道如何调用工具,也知道何时不该动手,避免超出用户意图和授权范围。

这些改动,恰好对应了企业使用模型时最常遇到的几种问题。在使用Mint Recursive的基础上,Mind Lab完成这一轮模型更新,只用了两周。

Mint Recursive的逻辑并不复杂,它将一次模型更新拆解为评测、数据准备、训练、复测和部署几个环节,使后训练能够沿同一套流程反复进行。

按照官方介绍,使用Mint Recursive时,企业的第一步是建立自己的Benchmark,即一组用于判断模型是否完成任务的任务和标准。

平台会先让基座模型经过一轮Benchmark评测,保存任务执行轨迹,帮助团队看到模型在哪个环节出错,再决定哪些问题值得通过后训练解决。

例如,一家企业想训练自己的办公Agent,除了任务是否完成,还可能关心它用了多少步骤和Token。只看最终结果,模型的低效路径容易被忽略。

接下来,企业可以整理现有数据,或根据失败的任务轨迹构造新的训练样本,并选择SFT、DPO或强化学习等训练方法,根据预算和任务需求决定采用LoRA还是全参数更新。

训练完成的新版本可直接部署,或回到最初的Benchmark上接受检验。效果达标就上线,上线后收集的问题,可成为下一轮训练的材料。

这套流程的关键在于,它是一个一体化且可持续的过程,有“同一把尺子”。

许多模型训练项目的问题,出在训练前后用了不同的评价口径:数据团队追求一种效果,训练团队优化另一组指标,业务部门上线后又用第三套标准验收。

借助Mint Recursive,企业可以对模型进行全生命周期管理,从为什么训练,到训练出什么,再到哪一版在生产环境运行,持续沿同一套记录迭代。

一款单独训练出的垂直模型,会随基础模型升级迅速贬值;一套能不断制造“下一个版本”的系统,才有可能成为长期资产。

2

让企业掌握模型的进化方向

这也对应了当下企业的需求。

过去企业使用大模型,核心考量是选择哪一家API。

但基础模型持续开源、模型能力排名不断变化后,选中某一款模型本身越来越难形成长期壁垒。今天最好用的是GLM,几个月后可能变成Kimi、Qwen、DeepSeek或MiniMax。

所有企业都能更换模型,但无论怎么换,最关键的是每家公司对自身业务的理解。

这种差距在Agent场景中更加明显。通用模型会调用工具,却未必理解一家公司的业务规则、成本要求和授权边界。企业越来越需要将任务轨迹、专家判断和用户反馈转化为模型可学习的经验,从而掌握模型的改进方向和上线标准。

从这个角度看,Mint Recursive正在从四个层次服务这种需求:低门槛、高性价比、可持续迭代和高自由度——让企业进得来、用得起、长期训得下去,也让专业团队能按自己的方式继续深入。

低门槛首先来自Benchmark。

过去,许多企业在选择API时,已积累了内部题库和评测标准;进入后训练阶段,这些材料正好可作为判断模型哪里需要改、训练后是否改对的起点。

这也解释了Mint Recursive早期客户为何集中在金融、AI for Science和医疗行业:它们AI化程度较高,已积累明确的业务规则、评测方法和任务数据,不必从零定义什么叫“模型把事情做对”。

第二层,是高性价比,要让企业用得起。

全参数训练对多数企业仍显过重,LoRA只更新少量新增参数,可先用较小投入验证效果。按照Mind Lab官网报价,专项模型训练服务最低1000美元起。

英伟达今年7月将后训练的核心指标概括为“intelligence per dollar”。企业关心的正是有限预算能否换来真实的业务提升。在Mint Recursive上,不同LoRA可共享同一个常驻基座,训练和部署按实际使用量计费,也无需为每个业务版本复制一套完整模型。

第三层,是可迭代。基础模型在迭代,模型进入企业的方式在迭代,甚至企业自身的业务和用户也在迭代。在Mint Recursive中,每个LoRA都可单独训练、评测、上线和撤回;生产环境中出现的新问题,也可进入下一轮训练。旧LoRA可能随基座升级而过期,但企业自己的Benchmark、数据和评价标准仍能继续发挥作用。

最后,也是最重要的,自由度。在整个周期中,企业都可自行调整方案,也可设定目标、预算和约束,让系统协助选择数据、算法与参数。

LoRA只是Mint Recursive提供的一种方案。平台同时支持全参数训练,并可选SFT、DPO、强化学习等方法。企业可直接配置基座模型、数据、算法和常用Loss,也可通过Python SDK自定义损失函数、强化学习环境和训练循环,将原有的verl、TRL、OpenRLHF或PyTorch训练代码迁移进来。

这几层叠加在一起,才能让企业从一次成本可控的实验开始,再根据效果逐步扩大训练规模。

Mint Recursive想得很清楚:企业不必先成为一家模型实验室,也能开始训练自己的模型。

3

从应用到Lab,再回到市场

表面上,Mint Recursive只是将后训练整理成评测、数据、训练和部署几个步骤。但真正支撑这些操作的,是Mind Lab从2025年在Kimi K2等万亿参数模型上做后训练时就开始积累的Infra能力。

为了让这种服务能运行,团队解决了几类问题:将超大模型拆分到大量GPU上训练,避免算力长时间等待;尽量让模型生成数据和接受训练时走过一致的计算路径,减少“学错”;再通过异步训练和LoRA热更新,让训练、推理与版本切换同时进行等。相关能力也被接入Megatron-Bridge、VERL和AReaL等主流生态,减少企业迁移现有训练代码的工作。

这些工作共同指向一个结果——企业看到的是一次API调用,平台承担的是万亿模型背后的分布式训练、状态管理和故障恢复。

在这个节点,回头看这家公司发生的变化,其实很有意思。一个做个人Agent的应用团队,孵化出一家实验室,训练了自己的模型,现在又把训练模型的系统拿出来,开始服务企业。

做个人Agent Macaron,首先要面对的是如何理解一个具体的人:记住他的偏好,熟悉他的习惯,让过去的相处对下一次服务有用。团队从这里关注到个人记忆,Mind Lab又把问题往前推了一步——这些经验,能否进入参数,改变模型处理任务的方式?

围绕这个问题,他们做研究、训练LoRA模型,也积累起支撑这些工作的Infra。到了Mint Recursive,这些原本服务于自身探索的能力,开始被整理成其他企业也可使用的产品。

从应用到Lab,再从Lab回到应用市场,产品中的问题变成了研究方向,研究过程中造出的工具,又成了新的业务机会。

不过,服务自己的产品和服务外部客户,终究有不同的要求。做Macaron和Mind Lab,团队知道自己想解决什么问题,也能不断调整产品和训练方案。面对企业客户,任务、数据、预算都在变化,客户甚至可能还没想清楚,自己究竟希望模型做到什么。

此前,它从自己的应用问题中积累出一套研究和工程能力;接下来,能否用这套能力稳定地解决别人的问题,将决定Mint Recursive能否成为一门长期的生意。若想了解更详细的后训练平台信息,可访问开云体验APP官网入口获取相关内容。

本文来自微信公众号“硅星人Pro”,作者:黄小艺,36氪经授权发布。

评论

张伟

开云体验APP的加密传输让我非常放心。之前担心第三方平台的安全问题,现在通过官方入口下载,再也不用担心恶意软件。而且内容库每周都有新赛事上线,非常满意。

  • 2026年9月1

李娜

作为电竞爱好者,开云体验APP的直播稳定性和画质让我惊喜。多终端切换毫无延迟,7×24小时客服也帮我解决过登录问题,响应速度确实低于30秒,值得信赖。

  • 2026年9月1

王磊

开云体验APP官网入口的界面设计现代简洁,操作直观。从下载到登录全程无广告骚扰,正版通道让人安心。希望未来能增加更多综合娱乐内容,比如音乐和短视频。

  • 2026年9月1

发表评论

李娜

市场专员,博主

我是一名专业博主,专注于数字娱乐与科技趋势。开云体验APP的体验让我印象深刻,希望通过分享真实使用感受,帮助更多用户找到安全、稳定的娱乐平台。

查看完整资料