057、VLA的泛化能力评测:新物体新场景的零样本泛化基准昨晚调了一宿的模型,发现VLA在训练集里表现近乎完美,一换到没见过的场景就彻底翻车——机械臂把咖啡杯当成垃圾桶,把抹布当成毛巾往脸上擦。这种问题不是个例,群里好几个做机器人的朋友都遇到过。今天就把我们实验室踩过的坑和摸索出来的评测方法整理出来,希望能帮大家少走弯路。先说清楚一个概念:零样本泛化(Zero-shot Generalization)在VLA里指的是模型在训练时从未见过某个物体、某个场景或某类任务组合,但要求它在实际部署时能正确处理。注意,这里不是指完全没见过的任务类型,而是指任务类型已知、但具体实例是新的。比如训练时见过“拿起红色马克杯”,测试时要求“拿起蓝色马克杯”——这就是零样本。如果测试时要求“拿起蓝色马克杯并倒水”,而训练时从未见过“倒水”这个动作,那叫少样本或组合泛化,不在今天讨论范围内。我们实验室最初犯的错误是直接用成功率(Success Rate)作为唯一指标。后来发现这玩意儿太粗糙了——一个模型在20次测试中成功12次,另一个模型成功10次,但前者失败的8次里全是把物体碰倒,后者失败的10次里全是抓取后滑落,这两个模型的改进方向完全不同。所以后来我们设计了一套多维度评测体系,下面详细说。评测基准的设计原则设计泛化评测基准时,最核心的原则是“可控的难度递增”。你不能一上来就扔给模型一个完全陌生的场景,那样即使失败了你也不知道是哪个环节出了问题。我们的做法是把泛化难度拆成三个维度:物体维度、场景维度、任务组合维度。物体维度包括:新颜色(训练时红色,测试时蓝色)、新形状(训练时圆柱杯,测试时锥形杯)、新材