择天记
姗姗来迟的越南南北高铁_我的网站

一 | 7 月的上海,世博展览馆 H3 馆的过道比往年拥挤许多。
不过大家关注的多是河内政坛迷局,却忽视了另一个影响深远的消息——越南政府计划在2030年之前修建连接首都河内与中国的高速铁路。其实有关越南“南北高铁”的消息很早就有了,为此还曾发生过一段阮富仲与阮晋勇斗法的精彩故事。2006年,时任越南总理阮晋勇在访问日本期间收到了一个“大礼包”,日本政府承诺提供开发援助,支援越南兴建高铁。越南的国土呈长条形,全国人口和城市群主要分布在北部的红河三角洲和南部的湄公河三角洲,分别以河内和胡志明市为中心,确实非常需要一条南北高速动脉。
入口处停着宇树的载人变形机甲 GD01,观众排队坐进驾驶舱拍照。兴奋之余,阮晋勇当即代表越南和日本签署了一份关于越南高铁和北南高速公路工程的谅解备忘录。往里走,300 多台机器人真机散在 200 多家具身智能企业的展台之间,具身智能无疑是这届 WAIC 最具象的展品。而视频生成公司的展台就设在机器人公司隔壁,播放演示片的屏幕连成片:机械臂倒水,无人机穿林,虚拟角色转身。然而回国之后,这份谅解备忘录却引起激烈争议。
二 |
不同公司的讲解员说着高度趋同的话:都在讲具身智能,都在讲世界模型。

三 |
按照越南法律的规定,预算超过19亿美元的所有项目须获得国会批准,经过一个月的审议,越南国会于2010年6月19日正式否决了政府提出的高铁计划。
图:WAIC 2026 现场,宇树科技展台(来源:新蓝网)
穿梭在展台之间的投资人,面对诸多公司同样问着高度趋同的一套问题,核心聚焦在模型到底什么水平。但得到的答案却分别指向不同的东西。有人打开手机展示 VBench 排名,有人调出 RoboTwin 2.0 的任务成功率曲线,有人谈仿真到真机的迁移数据。同一个词,在不同的展台上被不同的数字定义。
当具身智能与世界模型成为显学,榜单便不再只是技术社区的内部排名,而成了行业理解技术路线的入口,在某种程度上,更成了话语权本身。
一张拼图,三个榜单
2026 年以来,具身智能和世界模型几乎成了 AI 圈最热的两个词。
技术圈在讨论,视频模型到底能不能成为机器理解物理世界的路径。资本圈在讨论,下一代 AI 公司,能不能从“会说话的模型”走向“会理解、会预测、会行动的模型”。国会方面主要给出了两点反驳意见:其一是高铁建设成本预计达560亿美元,过于昂贵;其二是票价太高,普通人坐不起,且当时有70%的越南人住在农村,因此“提案在经济上不健全”。就这样,让日本产业界极度兴奋的“越南南北高铁案”遭到搁置,而主导这一切的正是现任越共一把手、时任国会主席阮富仲。应用日本新干线技术的台湾高铁700T型列车,安倍和阮晋勇计划把日本新干线应用到越南南北高铁中。媒体圈的问题则更清晰、直白,当“世界模型公司”越来越多,到底该怎么看谁更强?
然而时至今日,世界模型依旧没有一个统一的定义和衡量标准。2023年越南的人均GDP达到了4200美元,城市化率达到41%,基本相当于中国2008~2010年间的水平。
四 |
记忆力好的朋友会有印象,2008~2010年间也正是中国高铁刚刚开通的时候。2024年4月9日,越南交通部发布了一则声明,称正计划修建两条高铁,其中一条从河内延伸至与中国广西接壤的谅山省,另一条连接河内与云南接壤的老街省,途经港口城市海防和下龙湾所在的广宁省。越方表示这是红河三角洲发展战略的一部分,旨在加强交通基础设施、减少拥堵并促进经济增长。消息一经公布,各界纷纷猜测曾经轰动一时的越南南北高铁计划已再度出炉,北部的两条高铁将是这一宏伟目标的第一步。
落到具体的评测上,世界模型目前还不是一种单一分数就能概括的能力,它更像一张尚未完成的拼图:视频质量、指令理解、时序一致性、物理规律、机器人执行、动作预测,每一项能力背后都站着一张榜单和一群拥趸。
五 |
那么,具身智能和世界模型到底该看哪些榜单?把这张拼图拆开,有三块版图绕不开:一张回答"像不像",一张回答"懂不懂",一张回答"动不动得了"。
细心的朋友还发现,早在去年12月中方领导人访问越南期间,双方就已经签署了包括铁路在内的数十项合作协议。而在越南交通部公布正式声明的前一天,越南国会主席王廷惠在北京密集会见了中国铁路公司的高管,分别来自中国铁道建筑集团、中国交通建设集团以及中国中车。
六 |
越南国会主席王廷惠会见中国铁道建筑集团高管,2024年4月8日。看懂它们,比看懂任何一场发布会都更接近行业的真实进度。还有一块回答"准不准",它是整张拼图的底座,值得单独一章。越南方面之所以对于南北高铁感到着急,一个很重要的原因是泛亚高铁“中线”进展神速,已经开始对中南半岛的地缘政治和地缘经济产生影响。泛亚铁路(东南亚段)又称昆明-新加坡铁路,是链接中国、中南半岛、马来半岛和新加坡之间的铁路网。这一概念最早由马来西亚首相马哈蒂尔·穆罕默德在1995年12月的东盟第五届首脑会议上提议,之后陆续得到有关国家的赞同。2013年以来,随着中国高铁技术实现跨越式突破,中方成为泛亚铁路的主要推动者。按照规划,泛亚铁路以云南省会昆明为枢纽,分东、中、西三条线路:西线经大理、瑞丽进入缅甸境内,连接缅甸首都内比都和第一大城市仰光,目前昆明至大理段已经开通,大理至瑞丽段预计2025年通车,不过联通缅甸的计划因其陷入内乱而变得遥遥无期。中线的北段已经通车,即中老铁路,南段正紧锣密鼓建设中,后面详细介绍。
VBench:回答"像不像"
VBench 是目前视频生成领域最常用的评测体系之一,由南洋理工大学 S-Lab、上海人工智能实验室 OpenGVLab 等机构推出。
七 | 它从主体一致性、背景一致性、运动流畅度、美学质量等 16 个维度评价生成视频。
东线的主体即越南南北高铁,规划中把柬埔寨也一并纳入了进来,最终向西汇聚到中南半岛第一大城市——泰国首都曼谷。
它回答的问题很直接:模型生成的视频,像不像真实世界,是否符合用户输入。
八 |
在 VBench 1.0 认证榜中,头部模型集中在 84 分到 88 分之间,差距已经很小。
下面让我们把目光投向泛亚铁路中线。
九 | 于是 VBench 在 2025 年推出 2.0 版本,将评测范围扩展到人类保真、物理、可控性、常识等维度,开始关注那些决定真实感、却容易被忽略的问题。
2021年12月3日,中老铁路在经历五年建设后正式开通,运营初期由老中铁路公司委托中国铁路昆明局集团运营维护。该铁路是继印尼雅万高铁后,第二条以成套中国标准、中国技术和装备建设的海外项目,不止是轨道修建,还使用了来自中国的车辆、身份证实名购票系统以及进站安检系统。
十 |
根据其 HuggingFace 官方榜单的认证视图,主要名次如下:
图:VBench-2.0 榜单:Veo 3 以 66.72% 居首(来源:HuggingFace Vchitect/VBench_Leaderboard,2026 年 7 月截图)
但 VBench 仍主要评价视频结果。

十一 | 画面可以逼真,模型却未必理解画面背后的规律。
中老铁路同时运行客车和货车,其中动车组列车D887“中国复兴号”和D888“老挝澜沧江号”分别从昆明南站和万象站双向对开,车上广播中文、老挝语和英语。
WorldModelBench:回答"懂不懂"
如果视频生成模型被称为“世界模型”,它就需要接受更严格的检验。
2025 年,来自 UC Berkeley、UC San Diego、NVIDIA 和 MIT 的研究者推出 WorldModelBench,把模型放进物理和常识环境中测试。万荣站的CR200J列车。
该评测覆盖机器人、驾驶、工业、人类活动等 7 大领域,包含 350 条提示词和 6.7 万条人工标注,从指令遵循、物理规律、常识三个维度打分。中老铁路开通后,一定程度上带火了西双版纳、琅勃拉邦等城市的旅游产业,不过更加惹人注目的影响,是它方便了中国和泰国之间的货物运输。其中物理遵循占总分一半。原因很简单:世界模型最重要的能力之一,是预测物体在真实世界中会如何变化。
结果显示,即使表现最好的模型,也只有 61% 的视频正确完成指令;12% 的视频违反质量守恒,11% 出现物体互相穿透。
模型能生成一个看起来合理的世界,但距离真正理解世界,还有明显距离。因为老挝首都万象是世界上离边境最近的首都,准确一点说,万象就位于老挝与泰国的边境线上,和泰国廊开市只隔着一条湄公河。
十二 |
图:WorldModelBench 官网榜单(来源:worldmodelbench-team.github.io,2026 年 7 月截图)
RoboTwin 2.0:回答"动不动得了"
世界模型终究要服务于行动,再往拼图下游走一格,机器人能否干活便成了一个很重要的维度。
历史上万象和廊开原本是一座隔江而建的双子城,1893年,暹罗(泰国)被迫割让万象给法国,万象由此成为一座法属殖民地城市。
RoboTwin 2.0 由上海交大 ScaleLab 与港大 MMLab 主导、上海人工智能实验室参与。它包含 50 个双臂协同操作任务,抓取交接、工具使用、可形变物体操作,跑在 SAPIEN 仿真器上,支持 Aloha-AgileX、ARX-X5、Piper、Franka、UR5 共 5 种双臂本体,配套一个 731 个实例、147 个类别的物体库,通过 Easy 和 Hard 两种环境,测试机器人能否从仿真走向更复杂的真实世界。
早期结果显示,在 Hard 设定下,多数方法成功率仍低于 20%。机器人能够完成特定任务,但距离稳定、泛化地完成任务还有很长距离。
图:RoboTwin 2.0 官方榜单(来源:robotwin-platform.github.io,2026 年 7 月截图)
三张榜单,三种能力,各自有发布机构和评分体系。没有一张榜单能独自定义世界模型,放在一起,他们才勾勒出一条从生成、理解到行动的能力链。但这个链条还缺少一个最关键的环节。
Physics-IQ:回答"准不准"
人类做很多动作时,会下意识在脑中预演结果。推一下杯子,它会滑多远,会不会翻倒;倾斜水壶,水会从哪里流出来;把两块磁铁靠近,它们会吸住还是弹开。
机器人也需要这种能力。换言之,中老铁路实际上已经修到了泰国家门口。
十三 |
老挝是一个人口只有750万人的内陆国,经济相对落后,但泰国却是一个人口7200万、经济蓬勃发展的地区大国。中老铁路开通后,泰国方面积极利用铁路运输缩短时间的优势,把大量水果出口到中国。它必须根据眼前的状态,预测几秒后会发生什么,再决定下一步动作。泰国商务部公布的数字显示,2023年1-5月泰国榴莲出口到中国比去年同期增加58%,2022年泰国榴莲更是创下70万吨的出口新高,其中90%销往中国。泰商务部目前采取了一系列便利措施,鼓励其国内的蔬菜、水果利用铁路运输抢占中国市场。横跨湄公河的泰老第一友谊大桥。老挝经济领域长期依赖泰国,与泰国间的人员、货物通行十分便利;不过其安全领域则受越南保护,老挝人民党和老挝人民军曾经是越共的分支,直到今天都有大批老挝将领到越南接受训练。中老铁路的开通进一步加快了中泰铁路的建设进度,根据泰国铁道局的消息,如果一切顺利,中泰铁路有望赶在2029年全线开通。视频世界模型经常在这里犯错。中泰铁路是泰国首条标准轨高速铁路,使用中国技术,设计最高时速250公里,将在老挝首都万象实现与中老铁路的连接。这类预测如果不准,后面的规划和执行都无从谈起。正所谓好事多磨,铁路建设期间中泰双方就一系列问题进行了深度沟通和博弈。
测量这一底座能力的基准叫 Physics-IQ,由 Google DeepMind 与 INSAIT 联合推出,论文发表于 WACV 2026。
2026 年 6 月,原团队联合 Anates Labs 发布修正版 Physics-IQ Verified,修正了 57.6% 的样本标注问题,改用逐样本加权计分。比如:泰方希望中国将高铁建设技术、运营维护技术和其他相关任务在一定期限内完全转移给泰国国家铁路公司。再比如:泰方规定建筑承包商必须是在泰国境内注册的法人,以聘用泰方劳工为主,建筑材料也优先使用泰国国内材料等等。
它的设计与前述榜单都不同:研究者真实拍摄了 66 个物理实验,覆盖固体力学、流体、光学、热力学、磁学五大类,每个实验 3 个机位、实拍 2 次,共 396 段 8 秒视频。虽然存在种种困难,但中泰铁路的意义十分重大,这将是中国首次用高标准铁路无缝隙连接起一个7000多万人口的地区大国。模型只看前 3 秒,预测后 5 秒会发生什么,再与真实拍到的后续画面比对。泰国曼谷高铁总站(已完工)。
十四 | 曼谷是一座人口超过千万的大都市,建设中的中泰高速铁路将采用中国中车生产的复兴号CR300AF型电力动车组,最高时速300公里,在泰国境内以250公里时速运营。
文章最后,让我们以一个更加宏大的视角来审视一下泛亚铁路。自大航海时代以来,海洋霸权相对陆地霸权一直占据着地缘优势,而这种地缘优势的根本即在于以海运为主体的国际运输体系。尽管大家看地图会觉得中国与俄罗斯、印度、越南、缅甸、巴基斯坦等众多国家接壤,做起贸易来似乎应该很容易,其实不然。4 项指标合成一个 0 到 100 的 Physics-IQ 分数,并用同一场景两次实拍之间的差异做归一化:真实世界自己重拍一次都不会完全相同,模型的预测就被拿来和这种自然波动比较。
Physics-IQ 考察的是更底层的问题,即这个模型是否真的理解物理。这也正是图灵奖得主 Yann LeCun 多年来反复主张的观点,“AI 需要建立关于世界的内部模型,而不是只会生成内容”。他担任 Meta 首席科学家期间, Meta FAIR 便把 Physics-IQ 当作核心评测基准。俄罗斯的核心领土位于欧洲,中国想运货物到俄罗斯得通过海运绕地球好大一个圈。印度同理,虽然中印贸易额有个每年1000多亿美元,但99.9%都是走南海-马六甲-印度洋运输的,通过中印边境实现的贸易很少很少。
然而翻开 Physics-IQ 的官方榜单,排在第一的却并非 Meta 的模型,也不是英伟达投入重金的Cosmos,而是一个中国的视频生成模型。
2025 年 4 月 21 日,Sand.ai 的 Magi-1 以 56.0% 的得分上榜登顶。即大陆国家看起来领土接壤,但却并没有多少人员货物往来,是一个个孤立的个体。究其原因,主要在于陆路(航空)基建与运输能力的限制。当时的榜首、Google 的 VideoPoet 只有 29.5%,Magi-1 几乎把这个数字翻了一倍。
十五 |
然而可以预见的是,这种局面终将随着技术、生产力的进步逐渐发生改变。能源领域,中俄油气管道、中哈油气管道等已全面铺开并发挥作用。从那天算起,Magi-1 系在第一名的位置上坐了约 13 个月,中间只离开过三周。货物领域,虽然中欧班列仍不能跟海运相比,但它毕竟在成长中,完成了从0到1的突破,对一些高附加值产品(对运费不敏感)的运输带来积极影响。再比如中吉乌铁路、中国-东盟铁路等,随着建设技术的提升和建设成本下降,总有一天会实现。六十年前修成昆铁路费多大力气,今天修条铁路又费多大力气,如果按比例换算至六十年后,那将不得了的。
这张表有三种读法。
看裸模型:前三名里有两个建立在 Magi-1 之上,Magi-1 的 56.0% 是 v2v 设定下的裸模型最高分,远高于 Sora 2 裸模型的 42.3%,Cosmos3-Super 裸模型的 59.7% 出自不同设定,两者不直接可比。中国古代,京杭大运河曾是南北黄金水道,扬州、淮安等城市因航运而兴起,然而到了今天,大运河在全国货物流通领域的作用已经可以忽略不计。
看增强系统:2026 年 5 月,英伟达最新发布的旗舰世界模型 Cosmos3-Super 加持 WMReward 后冲到 63.4%,短暂登顶约三周;6 月 17 日,基于 Magi-1 的增强系统以 64.5% 重回第一。
图:Physics-IQ 官方榜单:Magi-1 系居首,Sora 2 裸模型 42.3%(来源:physics-iq.github.io,2026 年 7 月截图)
再看修正后的新榜:2026 年 6 月发布的 Verified 版本上,Magi-1 24B 增强版 58.2 分排第一、裸模型 48.4 分排第二,Cosmos3-Super i2v 39.5 分,Sora 2 只有 26.5 分。同样的道理,尽管未来若干年间海运仍将是主力,但它的作用正一点点被铁路、管道、航空等形式所取代。展望未来,《中国的地缘上签》就是从周边开始用基础设施联通和贸易运输的形式整合亚欧大陆上的城市与资源,这将是一项漫长、枯燥、充满挑战但意义深远的工作。
十六 |
图:Physics-IQ Verified 修正榜(来源:physics-iq-verified.anates.ai,2026 年 7 月截图)
把两张榜单放在一起看,会出现一个反常识的画面。

十七 | OpenAI 的 Sora 在 VBench 这类回答"像不像"的榜单上名次并不难看,到了 Physics-IQ 上,Sora 2 裸模型只有 42.3%,不足榜首 64.5% 的三分之二;Verified 新榜上只有 26.5 分,不及榜首 58.2 分的一半。
生成得逼真,和预测得准确,被证明是两回事。

十八 |
。

十九 |
把视频生成做成"预测下一个词"
Magi-1 赢在哪里?论文给出的答案是架构选择。
当下主流的视频生成模型,Sora、Kling 等,走的都是扩散路线:一次性生成整段视频,所有帧同时去噪,彼此之间没有严格的时间先后。
而Magi-1 的做法更像语言模型预测下一个词:按时间顺序逐块生成,每块 24 帧,块内部用扩散去噪保证画质,块与块之间自回归衔接。通过 block-causal attention,后来的帧不会影响过去的帧,过去一旦被写下,就不再被影响。
图:Magi-1 逐块自回归生成与块因果注意力示意(来源:SandAI-org/MAGI-1,arXiv:2505.13211)
这个架构天然更接近世界模型该做的事:根据世界的此刻,推演下一秒。它还带来几个工程上的特征:支持流式生成,视频可以边生成边播放;理论上可以无限长地续写下去。对世界模型而言,这意味着推演的时间跨度不受窗口限制,仿真可以一直进行,还可以逐块更换提示词,控制后续走向。
如果把关键词从“生成”换成“预测”,Magi-1 和 LeCun 主张的 JEPA 路线便有了一种理念上的深层呼应。LeCun 在 2022 年发表立场论文《A Path Towards Autonomous Machine Intelligence》,提出 JEPA 架构:不在像素空间预测世界,而在表征空间预测,主动忽略那些不可预测的细节。这条路线后来长成一个家族:I-JEPA、V-JEPA,再到 2025 年的 V-JEPA 2,用百万小时视频训练,其衍生版本可以做零样本的机器人规划。
图:Yann LeCun 在 2026 年 6 月巴黎 VivaTech 演讲(来源:La Ecuación Digital)
一个在像素世界里逐块自回归,一个在表征空间里做预测,虽技术方案完全不同,但都指向同一个判断,即能够预测物理世界变化是世界模型的必要条件。
尺子一旦出现,叙事便有了边界
在WAIC 的论坛上,"世界模型"被反复提起。

| 7 月 19 日的一场人形机器人与具身智能论坛,主题之一正是"标准体系不统一"。开幕当天有观察文章写道:通用世界模型正在成为人形机器人的新竞争壁垒。
竞争的坐标系确实在平移。过去几年,视频模型的发布会比的是"像不像":分辨率、时长、美学分。Physics-IQ 这类榜单的出现,把问题换成了"物理世界变化预测的准不准"。它的价值不在于新添了一张榜单,而在于把世界模型从一个抽象概念,拉回到具象的物理世界:杯子会怎么倒,水会怎么流,光会怎么折。

| 这些东西没法靠话术修饰。

| 坐标系的变化不会写在任何一场发布会的邀请函上,但它会决定下一年资本流向哪里、人才流向哪里。
榜单会迭代,名次会更替。但标准一旦确立,理解行业的方式必然会被改写,模糊的叙事也就有了相对清晰的边界。
尺子一旦有了,量出什么,就是什么。
Current article:http://gal2pw4.pisezuibanzoukou.cyou/news/20260826_685769.html
Published on:05:04:42