卓世科技王亚:从SOTA到最后一公里

发布时间:2026-08-25 18:00  浏览量:1

8月19日至23日,以“人机共生,产需共融”为主题的2026世界机器人大会于北人亦创国际会展中心(世界机器人大会展馆)正式举办。

作为国家级、全球化机器人产业综合运营平台,世界机器人大会既是产业周期的长期观察者、产业资源的顶层操盘者,也是前沿技术商业化的深度赋能者、新质生产力培育者、全球产业协同的连接者、行业高质量发展的标准引领者。

8月21日,由

亿欧主办的“2026世界机器人大会·具身智能商业落地论坛”在北京·北人亦创国际会展中心会议中心正式开幕

“具身智能商业落地论坛”作为“2026世界机器人大会”的重要系列论坛,以“商业落地”为唯一核心标尺,立足全球机器人产业顶层视角,精准捕捉当下具身智能赛道“技术成熟度领先、商业化落地滞后”的核心矛盾,聚焦商业策略和落地实践,以审慎态度思辨产业发展规律,以产业实战拆解商业化可行路径。

大会现场,

卓世科技联合创始人兼CTO王亚

发表了题为《从SOTA到最后一公里》的主旨演讲。

以下是

王亚

的核心观点:

1、模型不等于作业系统:模型还需要与真实的环境及业务系统深度融合,未来我们需要从“模型智能”走向“系统智能”。

2、单一本体不等于规模复制:硬件本体高度异构,逐机研发无法支撑规模化复制,未来“大脑”与“本体”需要进一步软硬解耦。

3、一次交付不等于持续价值:真正的长期价值,来自于在真实作业场景中的持续学习与能力升级。

以下是

王亚

演讲全文:

当近期我们在世界级权威榜单MolmoSpaces中达到了SOTA水平,打败了英伟达,其中九项任务排名第一。MolmoSpaces是具身泛化能力的权威榜单,吸引来自英伟达、MIT等知名机构同台竞技,它拥有20W+的场景,10W+的物品,拥有地狱级的测评难度。

SOTA成绩的背后,是我们特别加大了对机器人在首次执行失败之后如何恢复环境、如何再次执行并达到较好效果的研究。

我们区别于以往大家更多关注“如何把正确的执行路径采集出来让模型学会”的思路,而是从另一个角度切入——

就像小孩做任何事情第一次没成功,但具备从失败经验中快速二次执行的能力。

我们从持续变形、抓取高度差异等失败数据入手,在整个VLA模型做动作时,同步观察环境的历史变化,考察已经执行了哪个动作,给到模型进一步干预的能力。第一次抓取失败后,可以立即根据现场环境做第二次抓取,这就是我们整个技术的核心思路。将这些核心技术落地到具体产品后,我们的系统不仅具备了应对陌生场景的强大泛化能力和面对异常状态的高鲁棒性,还能基于反馈持续修正动作模型,并凭借极其紧凑的体积实现了端侧的高效部署。

有了好的模型,走向真实作业能不能做得更好?

我们认为落地效能才是关键的分水岭。

当前本体越来越丰富,Agent已经开始进入物理世界,但面临非常多困难:真实世界有太多不确定因素,不同本体的接口多、适配难度大,再到真实环境的部署和长期运维,客户更关注的是机器人能不能用、敢不敢用、值不值得用、能不能复制。这就回到我们从模型突破到产业落地的几个核心思考。

第一,模型不等于作业系统。单一模型在超长任务中不能全面覆盖,还需要和真实环境及业务系统融合。第二,单一本体很难形成规模化复用,大脑和本体需要进一步解耦,能力才能快速规模化复制。第三,一次交付不等于持续价值。客户会问:我的机器人现在是什么情况,未来怎么持续迭代优化?

这需要回答三个系统问题:

快慢思考如何协同、大脑如何适配不同本体、以及如何持续进化。

我们产品定位的方向——通用大脑,类似具身领域的Android系统。从分层智能来讲,实现复杂推理加实时反馈,做到软硬解耦,目前已经适配了主流本体,同时具备持续进化的能力。

接下来,给大家介绍卓世启元Tri-Core™具身通用大脑,启元是我们品牌名,Tri-Core™是我们的核心架构。我们结合类脑神经科学业界首发了Tri-Core架构,它由三个核心系统组成,System 1-直觉系统、System 2-逻辑系统,System 3-共情系统,借此实现从任务理解-》技能调用-》物理执行-》情感调制-》安全反馈-》持续进化的具身智能闭环。

System 1类似小脑,负责机器人的执行,以VLA模型为主,同时布局世界模型,并结合分层架构方案实现更精准的执行。System 2类似大脑,依托我们在传统大模型领域、特别是行业模型积累的丰富经验,做任务拆解、记忆系统以及和自有系统的深度融合。System 3负责情感交互和伦理安全,机器人未来更像人一样,不仅要会干活,还要提供情绪价值。共情系统可以感知人的面部表情变化,进行有温度的关怀。前一段时间在三亚,我们的机器人看到团队凌晨一点还在连夜加班,做出了有趣的互动反应,这块的共情能力让我们非常惊讶。

这三套系统如何更好地融合?我们需要一个底座,打通从感知、规划、执行到能力进化的全链路闭环。为此,我们打造了工程化运行与进化底座——ZoeInside Embodied Agent Harness。

在这个底座的支撑下:

首先,在任务前端,我们利用多模态大模型结合行业 Know-how 进行精准的任务规划;

其次,在场景落地时,面对复杂的本体适配需求,我们凭借强大的 AI-Coding 能力,只需让系统读取本体SDK说明书,AI 就能自动生成代码完成适配,极大降低了落地门槛;

最后,进入物理执行层(System 1),系统不仅能精准执行,更能利用多模态模型对结果进行严格验证(Verify),发生偏差时自动异常恢复(Recover),并转化为经验沉淀(Learn)。

整个闭环的核心,都是基于 Tri-Core 通用大脑进行,Embodied Agent Harness 作为底座支撑,就是让大脑智能真正做到‘可执行、可验证、可恢复、可进化’。”

落地最后一公里,我们已经积累了一系列核心案例。

比如电子料盘上下料、搬运、质检等。高效场景落地,除了需要核心模型外,还需要产品平台支持,因此我们打造了具身全链路产品体系:数采平台支持不同形态机器人;大脑训练平台主要训练VLA模型和世界模型,可以从零到一搭建新模型,也可以在场景化中进行微调;训练好的模型通过具身大脑适配平台对接不同本体;再加上本体上专有技能的研发积累;最后是具身大脑管理平台,可以快速把脑子装到本体上并做进一步个性化配置和管理。

这里有一个真实案例:我们打造了物流体系与无人机的协同。依托Tri-Core系统,机器人从一楼搬运原材料到二楼,与无人机协同。其中抓取由System 1的VLA模型完成,导航到电梯再与无人机融合则由原子技能组合成更复杂的任务。

还有快递扫码分拣案例:抓取透明快递袋,分拣后扫码放到传送带上。这个场景比较适合端到端模型,用VLA来做就足够了,核心是在System 1的体系中去研发。而扫码装箱场景稍有区别,扫码抓取完快递后需要持续进行下一步操作,单一模型很难解决,我们基于Tri-Core核心系统做原子技能封装,再组合成复杂任务,由不同模型有机协同完成。

总结一下,我们在场景化落地中,技术方案不是一成不变的,总体遵循Tri-Core系统架构,一般会在System 1中研发对应的场景技能,场景技能可能由VLA模型驱动,也可能由LLM驱动,也可能是传统分层技术驱动。在System 2中做复杂场景的规划,由原子能力的编排形成复杂任务。这样随着模型能力逐步增强,整体方案也会更加高效。

回到主题“产需共融”,我们有一套体系是和政府打造区域级具身大脑赋能中心的标杆。目前整个中心围绕通用大脑训练中心加场景赋能中心,它不仅仅是数据采集,更重要的是从数据采集、模型训练再到能力进化,形成标杆体系,赋能区域化经济。这是在北京市丰台区,由区政府支持承建的丰台具身大脑赋能中心,欢迎大家去指导工作。除了核心场景建设,我们和不同本体厂商、产业伙伴、高校科研团队展开生态合作,让前沿技术走进真实场景,共建具身生态。

最后介绍一下我们是谁。卓世科技成立于2018年,CEO屠静女士及核心创始团队均来自百度等互联网大厂,是国家级专精特新小巨人企业,也是国内第一批大模型双备案企业,目前已经积累大模型和具身智能相关专利100+。我们25年之前主要以AI普惠的理念在垂直行业大模型发力,25年新增了具身智能第二增长曲线,定位具身智能的通用大脑,目前已经和主流本体厂商达成战略合作,积累了丰富的场景落地经验,形成了一系列标杆案例。

“人机共生,产需共融”,我们邀请更多本体厂商、产业伙伴一起把具身的生态繁荣起来。

感谢大家!