允中 发自 凹非寺
量子位 | 公众号QbitAI
北京中关村学院7名博士生,用一个暑假,从零训练出了一个7B大模型——ZGCM-1。
随后,他们把各阶段训练数据和配方、模型权重、训练代码、中间checkpoint和日志也开放出来,让每一位感兴趣的研究者都可以追溯、复现整个流程。
在多项通用评测中,ZGCM-1与Qwen3-8B等同规模模型表现相近;在部分数学推理和搜索评测中,它也能与Qwen3-235B-A22B、GLM-5.1等更大规模的模型比较。
但比最终分数更让人好奇的是,数据、训练、集群、评测这一整套工程,在大厂通常需要几百人的团队协作完成,七个人怎么做得过来?
他们给自己组建了一支几百个Agent的团队,分头处理数据、跑实验、看日志、做评测,亲手实践「AI4AI」研发范式。
模型训完后,团队还对整个模型研发流程中Agent的实际表现做了一次评级,希望基于本次完整的大模型训练实践,为RSI现状提供真实的工程结论。
至于为什么开始做这件事,还要从一顿火锅说起。

△ZGCM-1模型能力概览及主要技术路线
看了很多技术报告,还是想自己训一次
七个人最初因为兴趣凑到一起:两人人工智能方向,两人网络方向,另外三人分别来自化学、生物和网安。
平时,他们更多是在现成模型上做微调。技术报告看了不少,许多问题却还是想不明白:数据到底怎么选,训练出了问题怎么查,最后写进报告里的方法,又是经过多少次失败才留下来的?一句“我们进行了数据清洗”,落到实际工程中,究竟意味着多少工作?
吃火锅时,大家聊到了这些困惑,也聊出了一个念头:既然光看报告总有弄不明白的地方,要不要自己从头训练一次?
当时,他们甚至想用一个7B模型去挑战Sonnet这样的模型。参数装不下那么多知识,就让模型多想一会儿,学会搜索、使用工具。
至于能走多远,谁也没有把握。他们想先动手,也把过程留下来,让其他学校里同样好奇的研究者有东西可参考。
老师们半信半疑,还是决定让他们试试,先给了一些算力。
接下来的几天,大家日夜赶着复现已有项目,快速迭代一个小模型。团队较为顺利地把完整流程快速跑通了,也让老师们看到继续投入的可能,团队因此获得了更多资源,饭桌上聊出的想法开始变成每天都要推进的工程。
真正开始7B模型的训练之后,他们才发现还有很多东西没有真正弄懂。有些概念在论文里见过,到了要改代码、解释实验现象的时候,又会卡住。
于是大家就让Agent从基本原理开始调研讲解,讲完再回到代码和实验里验证。原本冷冰冰的知识,开始对应具体的实现,也对应一次训练为什么跑不下去。
七个人忙不过来,就组建几百个Agent的团队
也有觉得干不了的时候,他们把整个工程展开,数据、算法、训练、集群、评测……每一项都能对应大厂里的一个专项团队。
七个人既要推进任务,又要不断补课,各种问题也接踵而至。
数据尤其如此:数万亿token来自不同来源,质量参差不齐,清洗、去重、检查格式、核对分布,做完一轮还要继续检查。
当所有这些环节同时压在七个人身上,工作量便远超他们的承受范围。
于是,他们开始给自己组建一支Agent团队。
几个人调度几百个Agent,逐渐分出了做数据、跑实验和做评测的不同Agent子团队,还搭建了类似论坛的任务发布与汇报系统,让任务有人接、进展有地方看、结果能被检查,也评价不同Agent的工作。
研究者负责提出目标、设定约束和做关键判断,Agent把具体工作持续推进下去。
比如在数据处理上,团队构建的Agent队伍能依据人给出的质量要求编写清洗脚本,检查数据分布是否达标,并根据结果自动调整规则和阈值,形成一个闭环。
在实验环节,它们同样具备从提交任务、监控日志到定位故障、调整配置的完整能力,甚至能主动发现存储与数据传输的瓶颈,优化训练框架的I/O流程,从而提升训练速度。
同时为了优化Agent之间的迭代和沟通效率,团队通过自研的ZGent平台,把会议讨论、研发决策和计划积累成共享上下文,再把验证过的脚本、工作流和debug经验沉淀为可复用的Skill。后来加入的Agent可以接着此前的经验做事。
大家的日常里,也多了把问题讲清楚、把任务组织好,再回来检查结果这几件事。

△人与Agent共同参与研发,会议决策和实验经验在后续任务中持续复用
后来,大家逐渐意识到,这种借助AI来研发AI的做法,正是最近非常流行的“AI4AI”。
不过,如果追问AI到底已经能独立做多少事情,光凭“帮了很大忙”的印象还不够。
于是,团队将研发过程拆成11类任务,请核心参与者按照L1到L5的自主性框架逐项评级。
差别很明显,实验监控和部署到了L4,人给定目标与约束后,Agent可以独立规划、执行,并根据反馈继续调整;模型架构和学习算法设计仍在L2,更多是帮助实现已有方案、运行预设实验。
至于研究什么、关键设计怎么选,还需要人来主导。
几个人带着几百个Agent,确实能把许多工作做起来,但距离让AI独立承担整个研发过程,还有不少问题要解决。

△AI研发自主性的五个等级

△不同研发任务中的AI自主性评级,来自团队9名核心参与者的评分的平均值
loss还在降,模型怎么退步了
有了Agent团队,训练中该踩的坑也没有自动消失。一次训练看起来很正常,loss仍在下降,模型能力却突然出现了明显退步。曲线没有告诉他们出了什么事,只能继续往下查。
最后,问题追到了底层的数据分片和shuffle环节:实际送进训练的数据比例发生了波动,模型吃进去的东西,并不总是他们以为的那份配方。
这次以后,团队不敢再只盯着loss。他们更密集地保存中间checkpoint,追踪知识、数学、代码和推理等能力的变化,还建立了ACE原子能力评测体系,把能力拆成18类、183项,用2503个探针进行检查。
在内部的分布式评测系统中,一轮诊断大约两三分钟。一次修改让哪里变好了,又让哪里退步了,下一步该查数据还是训练方法,都有了更具体的依据。

△ACE原子能力评测结果,帮助团队定位不同能力的优势与短板。
在反复排查和修正之间,也有特别开心的时刻。训练到一半,他们让模型写了一首歌,它真的写出来了。
用别人的模型生成文字,已经不是什么新鲜事,但看着自己从随机参数开始训练的模型写出一首歌,感觉还是不同。
那天晚上,大家回到最初吃火锅的地方,又吃了一顿火锅庆祝。后面还有很多工作,饭桌上那个没有把握的想法,至少已经有了可以看见的进展。
当时模型写的那首歌:






