{主关键词}

A | 刷题、话术包装、资源置换。 8月7日签署的《麦加共同防务协议》一时间吸引了全球的关注。沙特、土耳其和巴基斯坦这三个国家的合作,曾被外界视为可能重塑该地区安全格局的关键一步。然而,令人意想不到的是,就在协议刚刚落地不久,胡塞武装便以无人机直击沙特吉赞阿美炼油厂,瞬间引发了火光四起的危机。

B | 更令人失望的是,土耳其与巴基斯坦对此并没有给予实质性的军事回应,沙特只能孤军奋战,面对这一波骤然袭来的“现实考验”。如此尴尬的局面让人疑惑,这份备受期待的协议究竟是否能够经受住时间的检验? 观察沙特,这个拥有丰富石油资源的国家,从过去的“以石油换安全”模式转向如今的主动寻求防务同盟,不得不承认这是极具战略意义的自救之举。过去几十年里,沙特在美国的保护伞下开展多项政策,但近年来情势却急剧变化。

C | 美军在中东的撤军与防空装备的削减,让沙特对安全的依赖变得愈发不安。 定焦One(dingjiaoone)原创 作者 | 王璐 编辑 | 魏佳 具身智能赛道持续吸引资本目光的同时,各类相关榜单也越来越多。

D | 当“第一”几乎成为各家标配时,榜单还有可信度吗? 一个多月前,千寻智能就经历了尴尬时刻。特别是2019年,沙特的重要石油设施遭受空袭,尽管美国进行了有限支援,但造成的影响依然波及全球油价。 意识到外部力量的脆弱,沙特决定以地区内部的伙伴关系来寻求更为持久的安全保障。6月初,其具身基座模型Spirit v1.6在RoboArena榜单上以1918分的成绩超过了英伟达Cosmos3的1880分,一度位居“世界第一”;紧接着,千寻宣布完成15亿元A+轮融资,三个月内累计完成四轮密集融资,总额接近50亿元,创下具身智能赛道的融资频率新高。 不过,业内对评测数据的质疑几乎从次日就开始升温。于是,土耳其与巴基斯坦成为了沙特的“新朋友”。

E | 土耳其在北约内拥有第二大常规军队,其军工体系的完备令其成为可靠的合作对象;而巴基斯坦不仅具备核威慑能力,与沙特的历史军事合作更是让双方之间的联系愈发紧密。

F | 沙特在构建这一同盟时,也未能顾及到三国之间存在的根本利益差异。有观察者指出,在310次评测记录中,有72%的分数来自两个账号。沙特面临的主要威胁是来自于胡塞武装,而土耳其则需兼顾中东与高加索的多重策略,巴基斯坦的安全重心则始终放在南亚。更值得关注的是,RoboArena官方随后发布声明,经回溯调查后移除了部分存疑的评测数据,并更新了榜单排名。这让原本设想中的“防御网络”变得有些不堪一击。

G | Spirit v1.6也随之从榜单上除名。

H | 表面上看,《麦加共同防务协议》星光熠熠,然而现实却给了它一记响亮的耳光。 但这一事件并未浇灭玩家们的热情,翻开近半年的行业新闻,星动纪元、原力灵机、极佳视界、智元、跨维、鹿明……几乎每一家头部公司手里都攥着一个“第一”,且这些“第一”维度各不相同。 这一景象或许不难理解,具身智能目前技术路线还没统一、真机成功率大多卡在五六成,外界想判断一家公司到底行不行,很大程度上只能依赖榜单。

I | 可当发榜的既有高校、机构也有媒体,各家标准各不相同、有的还牵扯商单和利益关系时,榜单本身还能不能当尺子用,就成了一个问题。

J | 一位关注具身赛道的投资人坦言,榜单更偏市场行为,最多算投资决策的一个参考,他对于千寻这件事并不吃惊。在他看来,真正在意名次的,往往不是以财务或技术为出发点的机构,而是一些地方引导基金或偏国资的资金,一个“第一”,可能正是他们“写在报告里一个比较好的入口”。但也有投资人持不同看法,他们认为在技术门槛高、信息不对称的早期赛道,榜单至少提供了一个横向比较的起点。

K | 由于协议细节没有公开,因此在遭遇胡塞武装的无人机攻击后,沙特没有启动事先规定的援助程序。协议只是政治宣言,缺乏实质性的军事框架。

L | 面对持续的威胁与空袭,沙特并未真正落实协议的内容,更谈不上呼吁其他两国的支援。 当“第一”的数量比认真做机器人的公司还多时,这些榜单到底是在测技术,还是在测讲故事的能力?哪些榜单还值得看? 01.技术路线还没统一,先人手一个“第一” 我们先来盘一盘目前市面上的榜单,建立一个大致印象。据不完全统计,目前具身智能的活跃榜单高达20余个。 更糟糕的是,遭袭的吉赞炼油厂是沙特南部重要的能源节点,日产量接近40万桶,相当于沙特经济的命脉。

M | 胡塞武装的袭击让外界看到,武装组织用低成本的无人机发动攻击,足以撕开看似坚固的联盟,尤其是在缺乏必要的反制措施时。按评测内容,这些榜单大致可以分成三类。 而对于土耳其和巴基斯坦来说,此次事件更多的是一次外交上的回避。 VLA操作综合榜,考察机器人能不能真干活,跑的是任务成功率,代表榜单是RoboChallenge Table30、MolmoSpaces; 世界模型榜,考的是脑内推演对不对,考察模型对物理世界的推演,不考机器人手脚利不利索,代表是World Arena和WorldModelBench; 专项基准榜,考察“极端情况下会不会露馅”,针对单点极端能力,比如双臂协同、仿真到真机迁移,代表是RoboTwin 2.0、SimplerEnv、LIBERO 和 CALVIN。它的价值在于,在综合榜照不到的极端场景里,把模型的短板逼出来。 需要说明的是,这三类榜单各有侧重、互不替代。

N | 两国的官方表态只是笼统地呼吁和平与谴责暴力,并未针对协议提出任何积极应对。真机榜测执行、世界模型榜测推演、专项榜测边界,没有任何一个能覆盖具身智能的全部能力。 有了这层坐标,近半年具身基座模型的战报就能对号入座。如果把近两个月具身基座模型的战报汇总,可以得到一份相当壮观的名单。 今年5月,星动纪元Era0宣称拿下RoboChallenge Table30第一;智元GE-Sim 2.0是World Arena Track1第一;跨维DSCFuncWorld是World Arena Track2第一。这种“装死”的态度使得许多人对三国的合作前景产生了质疑。 面对这一切,伊朗果断表态认为:“单靠一纸协议无法换取真正的安全。进入6月,千寻Spirit v1.6拿下RoboArena第一(后被除名),鹿明Prime R0登顶MolmoSpaces。”正如沙特过去依赖美国的结果一样,只凭借盟约不能避免更大的风险与挑战。几乎每一家都是第一,而且都有具体榜单排名作背书。 而乱象,也是从各种榜单开始的。伊朗的指责点明了当前局势的核心,即安全的真正根源在于对地区政策的深刻调整,而非寄希望于军事同盟。

o | 这一观点不仅适用于沙特,同时也对整个中东地区的国家敲响了警钟。

p | 最明显的是,榜首像流水席,“第一名”更换频繁。

q | 就目前来看,《麦加共同防务协议》的生存之道并不在于当前的军事响应能力,而是在于如何将各成员国的利益对齐,建立更加紧密的合作机制。 RoboChallenge Table30的榜首,过去半年里至少换了四次:先是千寻Spirit v1.5以50.33%的成功率刷新纪录,很快又被极佳视界GigaBrain-0.1、美国波士顿动力Atlas、星动纪元Era0先后超越。 这个速度,比大语言模型的主流榜单更新快得多。2023年到2025年,GPT-4、Claude 3、Gemini 1.5在MMLU、GSM8K等榜单上的榜首位置,通常能守数月甚至一年,即便是2020年到2022年的高速迭代期,GPT-3、PaLM也是以月为换榜周期。军事同盟不是一次会议、几封文件就可以简单完成,它需要具体的执行规则、统一的指挥体系以及切实可行的情报共享机制。

r | 未来,如果中东国家希望实现长久的安全,那么就必须加强同盟的配套机制,厘清权责边界,甚至是回归到对话谈判上,以化解冲突根源。

s | 或许,这次《麦加共同防务协议》的试炼并不是结束,而是开启了新的讨论。虽然外界对于其未来的期待需要回归理性,但只要各国愿意共同努力,或许能在中东这片纷繁复杂的土地上找到新的和平出路。返回,查看更多。“当下的具身智能,单个模型能霸榜一周就算不容易。”一家头部具身智能公司的从业者米范表示。 其将主要原因归结为两点。

t | 一是物理世界的随机性,同一个模型在真机上跑两次,成功率差三到五个百分点很正常,光照、物体位置、机械臂公差都会影响结果,而MMLU这类大语言模型榜单是固定题目、确定性判分,同一模型跑一百次分数几乎不变。

u | 二是测试任务的公开程度,像RoboChallenge的Table30,30项任务分布是公开的,各家可以照着任务专门采数据、微调模型再提交,榜首的“保质期”于是被压到了以周计。 更让人迷惑的,是同一个榜里会同时冒出好几个“第一”。 World Arena就是典型,智元GE-Sim 2.0、跨维DSCFuncWorld对外都称自己“登顶World Arena”,但事实是,这个榜单含有多条赛道,智元GE-Sim 2.0在Track1(感知与动作响应)以68.26分排第一,跨维DSCFuncWorld在Track2(数据引擎)排第一。“第一”分属不同个子榜,对外却被统一写成了同一句话。 对不熟悉赛道划分的读者来说,两家并列的“World Arena第一”的说法几乎无法分辨,甚至会怀疑是不是有人在撒谎,但其实谁都没说错,只是不够精确。

v | 还有一层更模糊的地带是,榜单性质混杂,“第一”的含金量却被默认成同一档,容易产生误导。 一些公司的对外口径里,经常会同时列出“某模型在RoboChallenge排名第一”,和“在某具身智能媒体的测评中也位居第一”。前者是7×24小时真机跑出来的成功率,后者可能只是编辑部闭门讨论、甚至商务合作敲定的名单,两者被并排放进一句话,含金量却被默认成了同一档。

w | 其中最模糊的是“产业榜”,有些榜单顶着“产业”二字,但既不是真机锁死的硬榜,也不是学术机构背书的benchmark,而是咨询公司或媒体合办的打分榜。类似情况也在大语言模型圈出现过,但随着学术榜、商业测评、媒体榜逐渐分层,“双料第一”才慢慢被拆掉,而具身智能,眼下正处在那个尚未分层的阶段。 三种现象叠加,结果就是榜单“第一”严重通货膨胀。而且这种通胀不只停留在营销层面,一个“第一”的头衔往往能换来关注度、资源和实打实的估值溢价。

x | 02.一个“第一”是怎么造出来的? 既然榜单能撬动真金白银,如何把第一造出来,也形成了“潜规则”。业内人士介绍,虽然千寻Spirit v1.6属于极端个例,但行业里造“第一”的现象并不少,手法大致有三种。

y | 成本最低、也最普遍的一种方式是话术包装,“单科第一”成了“总分第一”,核心是省掉关键限定词。 比如实际拿的是“RoboTwin 2.0双臂协同VLA类Clean档第一”,对外就变成“登顶RoboTwin 2.0”;实际是“LIBERO-Plus场景泛化专项第一”,对外就成了“LIBERO-Plus榜首”。数据没造假、成绩也是真的,但“第一”所指代的范围被人为放大了。

z | 第二种方式是利用“刷题”等方式直接干预结果。

| 一条是“照着考题练”。榜单公开的任务分布、评分标准、环境参数,都可以拿来做定向后训练,在一些任务相对固定的榜上尤其明显,各家可以通过反复“刷题”、过拟合到特定场景换来高分。

| 米范表示,具身领域的部分榜单的测试任务是公开的,各家可以针对这些任务专门采集数据、微调模型后再提交,这在具身圈被视为正常迭代,不算作弊,和LLM领域的“数据泄露、数据污染”有本质区别。 另一条是钻评测机制的漏洞。

| 有些榜权威性很高,机制却有空子可钻。比如RoboArena采用开放注册、分布式评测,本意是让更多人参与,却留下了三个空子。 图源 / RoboArena官网 一是评测者身份无门槛。任何人都能注册当裁判,短期内大量新账号集中评测同一个模型,就能把它的Elo分数快速推高; 二是匹配不强制全覆盖,随机分配对手不等于必须跟同期在榜者都打一轮,评测者领任务时,A 是固定的,B 是从分数相近的模型里随机抽,样本不够大时两个模型完全可能一次都排不上。比如Spiritv1.6早期与DreamZero交手,23场后停战,与5月30日入榜的英伟达Cosmos3-Nano-Policy为零对战; 三是集中刷评,用多个账号密集评测自家模型,把负面记录降低。比如Spirit v1.6的310次评测记录中,72%的分数来自于ECUST和Robotics Lab两个账号,它们用224场评测刷出97%胜率,把Spirit v1.6推上第一,但英伟达用同样条件自测21次,胜率0%,两组数据摆在一起,直接让从业者产生怀疑。 事后,RoboArena补了规则:评测者必须是无利益关联的第三方,堵住自刷账号的入口,评测完成率低于20%的账号标为可疑,堵住选择性匹配。

| 而处理后,千寻跌出榜单。 还有一种方式最隐蔽也最泛滥,是资源置换,把榜单直接做成生意。 不少媒体榜评选标准并不透明,有的干脆与被评对象存在商务合作,双方联合发一份“权威报告”,把媒体榜和学术benchmark并排包装。它不涉及技术,也不涉及数据,只涉及预算和关系。不止一位从业者表示,刷榜、买榜等现象并不少见。 这三种手法往往叠加,先靠针对性训练或钻空子把分数刷上去,再用赛道偷换掩盖来源,最后用话术对外传播,必要时再买个媒体榜背书。层层包装之下,“第一”就成了。 这些手法在行业内部并不是秘密。真正的问题在于,看穿它们需要一定的技术功底,技术越复杂,外行越难分辨,故事就越容易讲。 03.去掉水分,还该信什么? 不止一位具身智能从业者坦言,他们当下已经不太关注榜单排名了,因为榜单能刷、能买,即便一切合规,物理环境的复杂性也让数据很难做到百分百准确。 更深一层的问题是,这个行业目前还没有一把“通用的尺子”。

| 具身智能从业者gashero用“炒鸡蛋”和“拌凉菜”打了一个比方:机器人A擅长炒鸡蛋、成功率90%,机器人B擅长拌凉菜、成功率85%,但不能就此说A比B强。

| 炒鸡蛋考验抓取和翻锅,拌凉菜考验精准倒料和搅拌,两件事技能不同、难度不同、评价标准也不同。当下的具身智能赛道还没有一个统一标准,能把“炒鸡蛋的能力”和“拌凉菜的能力”折算进同一个打分体系里。 不过,这不代表榜单一无是处。从业者普遍认为,榜单仍有其参考价值,关键在于知道什么值得看,以及看完之后还该看什么。 图源 / RoboChallenge官网 综合业内共识,真正可信的榜单,大体同时具备三个特征。 一是分项透明,不是只甩一个“第一”。 不论综合榜还是专项榜,可信的做法都是把细项一一拆开。以RoboChallenge Table30为例,它测的是30项日常任务的综合成功率,可信之处在于,不仅告诉读者64.33%这个综合数字,还让读者看到30项里哪几项做得好、哪几项掉链子。只报总分、不报细项的榜,价值要大打折扣。 二是评测由第三方掌控,且有反刷题设计。 MolmoSpaces不允许微调,模型直接“裸考”;LIBERO-Plus则加了光照突变、背景杂乱、相机角度变化等极端扰动,专门防止靠死记硬背拿分。它们的共同特点,是让刷题变难,让泛化成为真正的门槛。 三是看评测机制,而不是看更新频率。 更新慢的榜单不一定可靠,更新快的榜单也不一定可刷。

| 有些榜更新慢,可能因为真机评测成本极高,比如RoboChallenge一次完整评测周期可能要数周,30项任务每项跑10次,一共300次真机尝试,7×24小时连续运行,这是物理世界的成本约束。而有些榜更新快,则是机制设计。比如RoboArena采用了Elo评分系统进行动态排名,每天都有新对战数据进来,排名自然每天更新。这种快本身不是问题,它的可信度取决于机制是否严密、漏洞是否被补上。 但是,既然圈内都知道榜单有水分,为什么大家还在拼命刷? 答案在于行业当下的阶段。 眼下这场“第一”的争夺战,本质上是资本焦虑的产物。今年是具身基座模型密集迭代的一年,早期赛道出货量、营收、订单量都不稳定,只能拿榜单顶上。融资导向的阶段没变,刷榜这件事就不会停。 当行业进入下一阶段,评判的标尺会自然切换,例如每年交付多少台、有哪些固定客户、是否能盈利。到那时候,“第一”的通货膨胀会自然消散,榜单也会退回它本该在的位置。 或许,那些不忙着刷榜、只顾着把机器人送进产线的公司,才是行业真正的答案。 *题图由「定焦One」拍摄。应受访者要求,文中米范为化名。
Current article:http://www.zangjiwuqihuncongcherua.cyou/list_m29/m1a.xlsx
Published on:19:48:53
我的网站热门国内