
Jay 发自 凹非寺
量子位 | 公众号 QbitAI
AI研究AI,这次有了物理世界的答卷。

一家成立仅三个月的公司,亮出了自己的首款通用物理快系统,Simate-beta:展示记忆、长程任务、精细操作与任务适应能力,并据公司披露,登顶RoboDojo。
榜单当然不能代表模型的全部能力,但它提供了一个观察研发速度与实力的切面。
据团队介绍,此次参评的基础模型并未针对该榜单进行任何专门优化。
成立三个月,首版模型就交出这样的成绩,值得关注。

团队叫Simate(Silicon Mate)。
来头也不小。据公司介绍,核心团队曾将一段式端到端智驾模型能力推进至对标Tesla FSD的水平,并完成量产落地。
放眼全球,跨过这道门槛的团队也属极少数;带着这套积累继续推进通用物理AI,就更少见了。
不过,这次最有意思的,是他们从创立第一天就定下的研发方式:
AI for Physical AI,让AI参与物理智能本身的研究与迭代。

公司围绕这条路线组织模型、数据、算力与实验流程。Simate-beta,正是这套AI-native研发体系的第一个实践产物。
而且,研究工具已经开始被外部研究者用起来了。
据公司介绍,来自MIT、加州理工、清华、北大等高校的研究者已参与AutoResearch平台内测。配套其Sinfra基础设施覆盖训练、仿真与推理,具体可用资源按申请确认。
同期,Simate已连续完成多轮数亿元人民币级别融资。
三个月,模型、研究平台、外部试用与融资同步推进。这个速度,确实让人想看看下一步。
团队也给出了预告:已形成面向复杂任务零样本泛化的技术思路,计划于今年年底推出阶段性成果。
在他们看来,GPT-6开始参与物理世界的操作,是预料之中的进展,Physical AI的突破可能比外界想象来得更快。他们希望进一步突破逐任务适配与后训练的依赖,推动物理AI迎来自己的 「GPT-3时刻」。
模型与自动化研究等三项研究工作,也将通过论文和技术报告陆续公布,相关成果计划分阶段开源。
这份研发速度,以及它能否持续,成为Simate接下来最值得关注的事。
所以,首款模型究竟做到了什么?AI又是怎么参与研究的?
Simate-beta:面向零样本泛化的通用物理快系统
Simate最终想逼近的,是零样本(Zero-Shot)与少样本(Few-Shot)的通用物理AI操作。
在一个全新的陌生环境中,系统不应该每增加一项新任务,就重新采集一批数据、训练一次模型、重新调一遍工程。
这正是当下物理AI最热门、也最具挑战的赛道——百家争鸣,各显神通。
而Simate给出的现阶段解法,叫做:通用物理快系统。
也就是系统一。
先用咱人类举个例子:
面对「帮我把桌子收拾一下」这类复杂指令,我们需要「系统二」去理解意图、拆解步骤;
但当手已经伸向杯子,接下来究竟该往左微调几毫米还是往右偏一点,这种毫秒级的动作反应,不可能每一步都依赖深度思考。
物理AI亦然。
一个通用的「慢系统」负责高层规划与复杂推理,而一个足够强悍的「快系统」,则负责实时感知眼前不断变化的物理世界,并极速输出动作。
Simate选择的正是后者——
将快系统的参数量做大,探索零样本泛化能力的涌现,挑战端侧可部署模型的规模与能力上限。
一个通用物理快系统。
不过,大,又要快,很难搞的一个Trade off。
Simate选择从两件事情入手:
1、4D物理感知
理解物理世界,必须同时捕捉空间结构与时间维度的动态变化,让物理表征真正服务于行动。
2、分层时序记忆
长程任务需要记住此前发生的事,连续操作需要追踪状态,即时反应又不能被庞大的历史信息拖慢。

4D物理感知与分层时序记忆,共同指向与人类快系统处理连续世界方式的对齐。
这条路线,也延续了团队在大规模视觉模型、时序建模、实时推理与量产部署上的积累。具体架构和模型规模,将在后续技术报告中披露。
最终希望达到的状态是:模型既清楚眼前正在发生什么,也记得刚才发生过什么,并能及时决定下一步。
再与GPT-6等前沿模型所代表的通用推理能力协同,向复杂任务的零样本执行推进。
从公司目前给出的Simate-beta真机展示来看,测试主要围绕演示驱动的任务适应、记忆、复杂长程执行与精细操作展开。
根据公司提供、更新于2026年9月23日的RoboDojo榜单,simate-beta以平均Score 33.95排名第一,对应SR为27.96%。该成绩属于榜单评测,真机表现另行展示。
这份模型答卷背后,是另一套同样值得展开的系统。

让飞轮转起来
这几年,大家已经越来越习惯AI写代码。
但其实在AI研究里,写代码只是很小一部分。
很多时候,迭代效率,才是决胜的关键。谁能在单位时间内验证完更多研究假设,谁就能先跑出来。
举个最简单的例子。
机器人长程任务总是卡在某个环节,原因无非几种:数据分布失真、模型结构瓶颈、轨迹比例失衡,或者训练策略失效。
每一个方向背后,都对应十几组甚至几十组实验。
如果全靠研究员手动改配置、开任务、盯训练、跑评测,再把结果整理回来,那黄花菜都凉了啊。。。
所以Simate做了AutoResearch,用来加速这一流程——
人类研究员:提出假设、设定目标、划定约束。
AutoResearch引擎:自动接棒,把剩下的实验拆解、跑通、反馈全流程自动化。

最终结果也揭晓了,他们靠这套方法在RoboDojo拿下了第一。
更关键的是速度。
Simate从成立到登顶RoboDojo,前后只用了三个月。
就离谱。。。

所以问题来了:
AI到底该如何「研究AI」?
显然,只丢一个Agent进去是远远不够的。
真正的机器人研发,底层穿透了模型代码、数据管线、训练集群、评测环境、真机反馈,以及过去数月甚至数年的实验记录。
归根结底,这依然是「上下文」的问题。Agent需要一个能够调度一切的超级接口。
为此,Simate搭建了一套三层架构:SiPAI + AutoResearch + AI-native Infra。

SiPAI:让模型架构「AI可研究」
这是一套原生面向「自动化研究」的可插拔模型框架。
简单来说,就是把机器人模型搭建成AI能轻松读懂的结构——模块边界、系统接口、配置项与验证流程都被定义得极其清晰。
只有这样,Agent拿到研究课题后,才能精确知晓:该改哪个模块?改动会波及什么?最后又该如何验证?
目前,Simate已经完成了这套基础设施的搭建,成功接入了世界模型、世界动作模型、VLA、VLM等多种主流架构。
无论是人类研究员还是Agent,都能自由组合组件、调整局部实现,并沿用统一的训练与评测流水线。
AutoResearch:提供实时刷新的「研究上下文」
如果说SiPAI提供了一份静态说明书,那么AutoResearch解决的就是动态信息差:
研究推进到哪了?以前踩过什么坑?最新的证据是什么?
它将外部前沿论文、团队内部研讨材料、模型代码、数据配比、历史实验日志与最新的评测反馈,全部打通并汇入同一份动态研究Context中。
不管是发了新论文、内部代码提交了新版本,还是最新的实验数据推翻了旧假设,这份Context都会实时刷新。
这样,Agent提出的每一个研究建议,才能精确锚定到具体的代码分支与实验版本:
最有趣的地方,在于「人类经验」与「Agent实验」的深度耦合:
人类研究员可以随时注入约束、调优方向;一旦某次实验验证了有效组件,它会立刻沉淀为后续实验的新起点;某个分支总结出的方法论,也能被接下来的Agent无缝复用。
研究成果,真正变成了下一轮研究的生产资料。
AI-native Infra:让7×24小时的研发飞轮滚起来
当然,Agent只会写代码还不够,实验必须高效跑起来。
Simate将训练、推理与评测全流程接入自研Infra,通过极致的任务编排与资源调度,同时并行推进数十条相互独立的研究路线。
为了防止算力浪费,Simate采用了高频筛选机制:所有路线先经由「世界模型 +仿真环境」进行第一轮快速过滤,淘汰掉绝大多数无效方向;
唯有真正具备潜力的方案,才会进入真机实测。
真机上暴露出新问题,再重新流回研究Context,闭环由此形成:
最终呈现的效果是:人类只需抛出一个探索方向,底层系统就能自动并发驱动数十轮实验狂飙突进。
这也是Simate能在三个月内登顶的关键法宝。
不过最令人出乎意料的是,这样一套极其核心的内部生产力工具,他们居然选择直接开源开放!
网页长这样,感兴趣的朋友可以文末自取。

目前,来自清华、MIT、港科大等顶级高校的研究者已率先进驻内测。
弱RSI,只是起点
创始人张颖,前某一线智驾公司核心技术负责人。
工程实战经验非常丰富,参与过有图、无图、端到端三代智驾方案攻坚,也做过很多年量产。
据介绍,其推动打造的智驾系统是国内最接近Tesla FSD的智驾系统。
此外,团队里还有两位灵魂人物。
1、占方能。
香港科技大学助理教授、World Mind Lab负责人,长期研究世界模型和物理AI。
2、季马泽宇。
00后青年科学家,研究方向横跨3D感知、灵巧操作和人形机器人全身控制。
加入Simate前,他还是硅谷Assured Robot Intelligence的创始成员。
ARI后来被Meta收购。
资本市场,也已经用真金白银投票。
成立仅三个月,Simate连续完成多轮每轮数亿元人民币融资。
而这一切,都是在押注同一件事——
Physical RSI。

Simate从创立第一天便瞄准了这个方向,并且定义了三种不同类型的RSI。
1、弱SI:边界明确,快速闭环
人机共驾模式,研究员设定目标与约束,正常执行过程中不再需要研究员逐步参与,异常可以升级处理。
这次登顶RoboDojo,就是第一阶段的工程验证。
2、中SI:方向明确,但答案未知
怎么改善模型记忆?某类任务的数据比例到底怎么配?
方向已经有了,但具体哪个方案有效,还得靠多轮实验去找。
这时候,Agent负责整理上下文、实现方案、跑实验、比较结果;研究员则负责筛假设、解释冲突证据,以及做关键取舍。
这其实也是现阶段最有现实价值的一类。
3、强SI:研究本身都需要被发现
最难,也是最触及智能本质的一类——
怎么提升模型在全新任务里的泛化能力?
这类问题已经没有清晰的解题路径了。系统得自己理解目标、发现真正值得研究的问题,还要在很长时间里保持方向感、不断修正路线。
这就开始涉及所谓的「研究品味」。
现阶段,这类工作依然需要资深研究者主导。Agent更多是在文献、证据、实验和路线探索上提供支持。
值得注意的是,Simate所说的弱、中、强SI并无等级之分,三者可以同时存在于同一套研发系统中。
更重要的还是「进化」这个第一性原理本身吧。
One More Thing
系统的每一次自我改进,都在让下一次改进更容易发生。
当数据、模型与真实部署连成一个会自己转起来的闭环,机器人的上限,才不再只取决于人的上限。
这就是Physical RSI,目前冲线物理AGI最热门的候选路线。
当然,Simate现在展示的,还只是早期形态。
Human-in-the-loop依然存在,而且研究员仍然掌握着整个循环里最关键的方向判断。
但这恰恰也说明,自动化研究未必要等到「完全无人类参与」那一天,才开始产生价值。
在更强的自主研究能力真正出现之前,先把实验设计、训练、评测、反馈这些高成本、可流程化的环节逐步交给Agent,本身就已经能显著提升研究吞吐。
RoboDojo的成绩单,也算是验证了「人机共驾」这条路径,在物理AI领域的可行性吧——
RSI,真的开始了。

对了,还有件事。
AutoResearch科研平台已启动内测,目前正火热招募中!
千卡算力,等你一起来玩儿~
官网:https://mate-robot.cn/
AutoResearch科研平台:https://mate-robot.cn/research/sinfra/
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
🌟 点亮星标 🌟
科技前沿进展每日见