星空·xingkong体育将点图编码出来的特征-星空(xingkong综合)体育官方网站入口

发布日期:2026-07-31 07:45    点击次数:172

星空·xingkong体育将点图编码出来的特征-星空(xingkong综合)体育官方网站入口

星空·xingkong体育

这项由韩国科学本领院(KAIST)东说念主工智能学院连合Holiday Robotics公司共同完成的询查,于2026年7月以预印内容式发布,论文编号为arXiv:2607.11498。感敬爱的读者不错通过这个编号在arXiv平台上查阅完满论文。

**一、从一个让机器东说念主困惑的难题提及**

假定你蒙着眼睛,有东说念主用手机从不同角度拍了一张桌上杯子的像片发给你,然后问你:杯子在你眼前哪个标的、距离多远、你的手应该伸向何处去拿它?

这对你来说简直不行能完成。像片告诉你杯子长什么样,却莫得告诉你它在你身体坐标系里确凿切位置。而当代机器东说念主每天面对的,恰是肖似的窘境。

目下早先进的机器东说念主端正系统,学名叫作念"视觉-讲话-动作模子"(Vision-Language-Action Model,简称VLA)。你不错把它会通成机器东说念主的大脑,它同期读取录像头看到的画面和东说念主类发出的讲话教唆,然后决定机器东说念主的手臂下一步应该奈何动。商酌词,这类大脑存在一个根人道的矛盾:机器东说念主的手臂是在以自身为中心的三维坐标系里通顺的,但大脑看到的画面却来自录像头——而录像头时常被装配在傍边的架子上或机器东说念主手腕处,它看天下的角度和机器东说念主自身的角度王人备不同。

这就好比,你坐在驾驶席上,要靠傍边副驾驶座位上的录像头画面来判断标的盘应该往哪边打。当录像头固定不动时,你天然视角别扭,但至少每次看到的画面和标的盘动作之间的对应关系是固定的,记取了就行。但如若每次开车,录像头都被放在不同位置——巧合在后排,巧合在车顶,巧合在引擎盖上——那你就需要每次都从新摸索画面和标的盘之间的关系,极其贫乏。

当代机器东说念主熏陶数据靠近的,恰是这种"录像头位置各不研讨"的窘境。为了熏陶一个通用的机器东说念主,询查者们会网罗来自天下各地不同机构的操作演示数据,而这些数据是用不同位置、不同角度的录像头拍摄的。于是机器东说念主大脑靠近一个极其笨重的学习任务:不仅要学会怎么完成任务,还要同期学会"从这个录像头角度看到这个画面,对应的动作应该是什么;从阿谁录像头角度看到相似画面,对应的动作又是什么"。

KAIST的询查团队提议了一种简略而灵验的搞定决策,他们称之为"机器东说念主视角点图"(robot-centric pointmap)。中枢想路是:既然机器东说念主的手臂是在以自身为中心的坐标系里通顺的,那何不干脆把录像头看到的天下,也退换到这个坐标系里再喂给大脑?这样一来,无论录像头放在何处,机器东说念主大脑看到的都是"以我自身为中心,指标物体在我的前列0.4米、左方0.1米、上方0.3米"这样平直明了的信息,而不是"从某个角度的录像头画面里,阿谁东西在画面的左上角某个位置"这样需要多数退换的迂覆信息。

**二、点图究竟是什么,它和庸碌像片有什么不同**

要会通点图,不错从庸碌像片和深度图提及。

庸碌RGB像片,等于咱们手机拍出来的那种彩色图片,每个像素纪录的是情态信息:红色几许、绿色几许、蓝色几许。它告诉你每个位置"看起来像什么",但王人备不告诉你阿谁位置的东西"距离你有多远、在哪个标的"。

深度图是在此基础上的一步纠正。目下许多机器东说念主录像头都是RGB-D录像头(比如询查顶用到的英特尔RealSense系列),不错同期拍摄彩色图像和深度图像。深度图的每个像素不纪录情态,而是纪录该位置的物体距离录像头有多远。这让机器东说念主知说念了"遐迩",但问题是,这个距离是以录像头为中心量的,跟机器东说念主自身的坐标系如故不一样。

点云是更进一步的暗示神态。通过深度图加上录像头的内参(焦距、光心位置等参数,决定了像素和射线标的的对应关系)以及外参(录像头联系于机器东说念主基座的位置和角度),不错把每个像素对应的物体位置测度成机器东说念主坐标系下的三维坐标,得到一堆错落的三维点,称为点云。点云平直在机器东说念主自身坐标系里样貌了天下,是机器东说念主动作所需要的信息样式,但它有个致命污点:错落的点集莫得规矩结构,无法平直被为处理图像而野心的神经蚁合使用,何况时常需要对原始数据进行下采样(只保留部分点),会丢失细节。

点图则详尽了两者的上风,遮盖了各自的污点。点图在外形上和庸碌图片一模一样,是一样高度乘以宽度的规矩网格,每个"像素"的位置和原始彩色图片王人备对应。但每个像素里存储的不是情态,而是该位置对应的物体在机器东说念主坐标系下的三维坐标,即x、y、z三个数值。

具体的测度进程分两步:第一步,愚弄录像头内参和深度值,把每个像素"反投影"到录像头坐标系下的三维点;第二步,再用录像头外参(旋转矩阵和平移向量),把这些点从录像头坐标系变换到机器东说念主基座坐标系。这样,销毁个物体上的某个点,无论从哪个标的的录像头拍摄,在点图里存储的三维坐标都是一样的——因为它在机器东说念主坐标系里的位置等于固定的。

这个性质极其重要。从录像头A拍到的杯子某个角点,和从录像头B拍到的销毁角点,在各自的点图里存储的机器东说念主坐标王人备研讨。这就透顶排斥了录像头视角变化带来的不一致性。

**三、还差一步:以终端扩展器为中心的精妙野心**

询查团队在点图的基础上还作念了一个绝顶的精妙处理:把整张点图再减去机器东说念主终端扩展器(也等于机械手确现时位置)的坐标,得到所谓"以终端扩展器为中心的点图"。

为什么要这样作念?不错通过一个场景来会通。假定机器东说念主要完成的任务是"把杯子抓起来",这个动作本质上是"把手挪动到杯子方位位置"。在以机器东说念主基座为原点的坐标系里,如若杯子在厨房水槽傍边,它的坐标可能是(0.4, 0.5, 0.3);如若杯子在微波炉傍边,坐标可能是(0.6, 0.1, 0.8)。尽管两种情况下机器东说念主需要扩展的是简直一样的"手向指标逼近"动作,但以基座为中心看,指标物体的位置却王人备不同,大脑需要差异记念两种情况下的操作战略。

但如若改成以现时机械手位置为原点呢?当机械手仍是接近杯子准备抓持时,无论杯子是在水槽旁如故微波炉旁,杯子联系于手的坐标都接近(0, 0, 0)——因为手就在杯子隔邻。这样,两种看似不同的场景在以终端扩展器为中心的点图里看起来简直一样,大脑只需要学会一种"手在指标隔邻时怎么抓取"的通用战略。

询查团队用实验数据考证了这一野心的价值。以机器东说念主基座为原点的点图,在固定录像头评估时告捷率是34.7%,换成立时录像头评估时下落到32.7%,下落了2.0个百分点。而换成以终端扩展器为中心后,固定录像头时告捷率擢升到36.9%,立时录像头时告捷率是36.6%,简直王人备莫得下落,只差0.3个百分点。这说明终端扩展器中心化的点图对录像头视角变化具有更强的鲁棒性。

**四、怎么把点图"喂"给已有的机器东说念主大脑**

搞定了"点图是什么"的问题之后,询查团队还需要搞定"奈何用"的问题。现存的VLA模子都是用庸碌RGB图片熏陶的,平直把点图塞进去不一定灵验。

询查团队的搞定决策宽敞地愚弄了点图与图片结构研讨这一特质。他们为点图单独配备了一个图像编码器(神经蚁合模块,细腻把图片退换成机器东说念主大脑能处理的特征向量),这个编码器的架构和处理RGB图片的编码器王人备研讨,驱动权重也平直复制自RGB编码器。然后,将点图编码出来的特征,与同位置RGB图片编码出来的特征,按照像素对应关系平直作念加法相通。

这个"加法会通"而非"拼接会通"的聘请也很重要。如若把两套特征拼接在统统(即把点图特征排在RGB特征后头),那么点图特征和RGB特征就变成两个孤苦的序列,它们之间的空间对应关系就丢失了。而加法会通则让每个位置的RGB信息和该位置的三维空间信息平直相通成一个融合的暗示,保留了空间对应关系,也不增多任何绝顶的信息序列长度,对已有的VLA架构改革极小。

实考评释了这个野心的优胜性。用加法会通的点图模范告捷率是34.7%,用拼接会通的则下落到30.7%,收支4个百分点。

**五、为什么挣扎直用点云,或者平直给机器东说念主看录像头参数**

询查团队系统地相比了几种看似合理的替代决策,复兴了两个重要问题。

第一个问题是:与其事前测度好三维坐标,不如平直把深度图和录像头参数统统给机器东说念主大脑,让它我方学会退换,是否可行?

询查团队测试了几种决策,从最肤浅的纯RGB图片(不给任何深度或录像头信息)入手,渐渐增多信息量。纯RGB告捷率是27.9%。加上"普吕克射线"(一种把每个像素对应的三维射线标的和录像头位姿编码进来的六维向量)后,告捷率升至28.7%。再加上深度信息(此时大脑仍是领有测度点图所需的全部原材料),告捷率擢升到31.6%。而平直给机器东说念主瞻望算好的点图,告捷率则达到34.7%,比有研讨原始信息但需要大脑我方退换的决策杰出3.1个百分点。

这个对比说明,提供深度和录像头参数手脚陈迹是有匡助的,但平直把机器东说念主坐标系下的三维几何事前测度好再输入,比让大脑我方从原始参数里推算恶果更好。

第二个问题是:点图和点云都佩戴研讨的三维信息,为什么要用点图而挣扎直用点云?

询查团队测试了两种点云决策:一种用肤浅的MLP(多层感知机,一种基础神经蚁合)处理1024个点,告捷率惟一24.2%,以至低于纯RGB基准;另一种用专为三维点云野心的Point Transformer v3这个专科架构,告捷率擢升到32.8%,但仍然低于点图的34.7%。

差距的开首很明晰:点云不保留与RGB图片像素对应的规矩网格结构,因此它编码出来的特征无法和RGB特征进行按位置对应的加法会通,只可用拼接神态,亏损了空间对应关系。此外,处理点云需要特别的三维编码器,无法复用VLA已有的图像编码器的预熏陶权重,相等于重新学习,而点图编码器不错平直给与图像编码器的预熏陶常识。

**六、随着录像头位置越来越多变,点图的上风越来越大**

询查团队作念了一组全心野心的对简直验,平直量化了录像头视角变化进度对两种决策的不同影响。

实验在RoboCasa这个机器东说念主仿真平台上进行,竖立了三个级别的录像头立时化进度:王人备固定(每次演示录像头位置王人备一样)、低立时化(每次演示录像头位置和角度在5厘米、3度范围内立时浮动,对应RoboCasa默许竖立)、高立时化(浮动范围扩大到10厘米、6度)。

散伙酿成了显然的对比。关于纯RGB决策,随着立时化进度从无到高,告捷率从34.5%直线下滑到24.9%,跌幅高达9.6个百分点。而加入点图后,立时化从无到高,告捷率只从37.6%小幅下滑到35.8%,跌幅仅1.8个百分点。当立时化为零(固定录像头)时,两种决策的差距惟一3.1个百分点;当立时化为高时,差距扩大到10.9个百分点。这平直证明了询查团队的中枢假定:录像头视角变化越大,点图的相对上风就越大。

**七、在真实的大型机器东说念主模子上的测试散伙**

上头的实验都在一个相对基础的架构上进行,观点是阻隔变量、考证野心原则。在最终评估阶段,询查团队把点图决策移植到两个真梗直型的预熏陶VLA模子上测试。

第一个是π0.5,这是一个在多数机器东说念主操作数据上预熏陶过的大领域VLA模子。加入点图后,它在RoboCasa 24个任务上的平均告捷率从55.3%擢升到62.9%,在统统五个任务类别(开关门、开关抽屉、咖啡机操作、拿放物品、旋转物品)上都有擢升,举座擢升7.6个百分点。在最能体现精准空间判断才智的咖啡机任务中,某个子任务的告捷率从46%跃升到76%,擢升幅度相等显赫。

第二个是SmolVLA,一个更轻量级的VLA模子,加入点图后平均告捷率从37.2%擢升到41.4%,擢升4.2个百分点。

询查团队还将他们的模范与那时该领域的代表性对比模范进行了全面相比。这些对比模范分三类:专注于录像头感知的VLA(OC-VLA和KYC)、附加了专用三维模块的VLA(GeoVLA和PointVLA),以及王人备孤苦的点云战略(FP3)。统统使用π0.5底层架构的对比模范中,KYC(59.1%)和PointVLA(57.3%)是最强的,但两者都低于加了点图的π0.5(62.9%)。FP3手脚一个王人备不分享π0.5底层架构的孤苦三维点云决策,只达到42.8%,彰着逾期于统统基于π0.5架构的模范,说明大领域视觉讲话预熏陶的常识转移对机器东说念主任务仍然很有价值。

**八、在真实机器东说念主上的考证,包括录像头移到没见过的位置**

仿真实验的散伙再好,也需要在真实天下里考证。询查团队使用Franka Research 3机械臂进行了真实机器东说念主实验,配备了一个固定在手腕上的D405深度录像头,以及一个不错挪动位置的外部D435i深度录像头。

熏陶数据用三个不同的外部录像头摆放位置各网罗了15条演示,每个任务共45条,四个任务(拿放物体、叠积木、开抽屉、关抽屉)共180条演示数据。

评估时竖立了两种场景:一种是把录像头放在熏陶时见过的三个位置之一(称为"已见视角"),另一种是把录像头移到一个熏陶时从未见过的位置(称为"未见视角")。

在已见视角评估中,点图版π0.5平均告捷率78.3%,比纯RGB版π0.5的73.3%高5.0个百分点,也高于从零熏陶的三维点云模范DP3的63.3%。说明在当年情况下,点图就仍是是有匡助的。

更能说明问题的是未见视角的散伙。当外部录像头移到熏陶时没见过的位置,纯RGB版π0.5的告捷率从73.3%骤降到55.0%,下落了18.3个百分点,受录像头位置变化的影响很大。而点图版π0.5的告捷率从78.3%降到66.7%,只下落了11.6个百分点。换算成两者之间的差距:在已见视角时差距是5.0个百分点,到了未见视角时,差距扩大到11.7个百分点。这说明越是在熏陶时没见过的录像头视角下,点图的上风越大——这恰是点图要搞定的中枢问题。

DP3这个三维点云决策也展现了三维信息对抗视角变化的一定恶果:它从63.3%下落到48.3%,降幅是15.0个百分点,比纯RGB的18.3个百分点下落略少。但DP3举座告捷率仍然彰着低于点图版π0.5,说明图像体式的三维信息加上预熏陶VLA的组合,比单纯的点云决策更强。

**九、这项询查有哪些局限,改日还能奈何纠正**

询查团队在论文中坦诚地指出了几个尚未搞定的问题。

最初,点图需要精准的录像头内参和外参(也等于录像头自己的光学参数,以及录像头联系于机器东说念主的精准位置和角度)。在实验室或工场环境中,这些参数不错通过精准的手眼标定来赢得,但在更放松的日常使用场景中,标定可能不够精准或者难以实施,这端正了点图在那些环境中的应用范围。

其次,询查团队在点云对比实验中只使用了固定数目的点,莫得测试用更多点是否能缩小与点图的差距。

再者,询查对录像头变化的测试主要围聚在录像头位置和角度的变化上,莫得测试录像头数目变化或者视线范围变化的情况。

此外,询查莫得系统探讨点图注入神态与VLA里面动作各人模块之间的相互作用,也莫得深化分析点图与VLA预熏陶数据的最好协调神态。这些都是改日不错络续深化的标的。

说到底,这项来自KAIST和Holiday Robotics的询查作念了一件看似肤浅却刀刀见血的事:既然机器东说念主在我方的坐标系里行为,就应该在我方的坐标系里不雅察天下。点图把录像头画面和机器东说念主坐标系之间那说念恒久存在的隔膜,在数据输入要津就提前弥合了,而不是让机器东说念主大脑在学习进程中我方冉冉摸索奈何向上这说念隔膜。恶果是实实在在的:在录像头位置多变的熏陶环境下,任务告捷率显赫擢升;更进军的是,当录像头被移到熏陶时从未见过的位置,点图模范的性能下落幅度远小于不使用点图的决策。

这对机器东说念主领域意味着一个明晰的原则:当录像头标定信息不错赢得时,应该先把不雅察数据退换到机器东说念主行为方位的坐标系,再交给战略模子,而不是把这个退换的背负留给模子我方去学习。一个预想的想考标的是:如若改日出现不需要精准标定、能从图像中自动估算三维坐标的本领,这套框架是否不错和那些本领招引,进一步裁汰对标定的依赖?这或者恰是改日询查值得探索的旅途。有敬爱深化了解这项询查统统细节的读者,不错通过arXiv编号2607.11498查阅完满论文。

---

Q&A

Q1:机器东说念主视角点图和庸碌深度图有什么区别?

A:深度图纪录的是物体距离录像头的遐迩,坐标是以录像头自身为中心的,当录像头位置变化时,销毁个物体的坐标值也会随着变。点图则在深度图基础上进一步作念了坐标变换,把每个像素对应的三维位置退换到机器东说念主基座坐标系下暗示,销毁个物体无论从哪个录像头拍摄,点图里存储的坐标值都是一样的。这个死别让点图在录像头视角多变的情况下,能给机器东说念主提供更结识一致的空间信息。

Q2:点图模范需要绝顶添加特别的三维处理硬件吗?

A:不需要。点图本质上是一张和庸碌图片尺寸王人备研讨的"图像",每个像素存的是三维坐标而不是情态,它不错平直用和处理庸碌图片一样架构的神经蚁合来处理。询查团队的决策仅仅在现存的VLA模子傍边增多了一个图像编码器(驱动参数如故从原有图像编码器复制过来的),对原有模子架构改革极小,不需要专用的三维点云处理硬件或者特殊的编码模块。

Q3:终端扩展器中心化的点图在执行使用中需要及时知说念机器东说念主手的位置吗?

A:是的星空·xingkong体育,需要。终端扩展器中心化点图的测度神态是用机器东说念主坐标系下的三维点坐标减去现时机械手的位置坐标,是以在每一时代生成点图时,都需要知说念机械手现时的位置。不外这并不是绝顶的背负,因为机械手确现时位置(内容感知信息)蓝本等于机器东说念主端正系统会络续跟踪并提供给战略模子的基础信息,赢得它不需要绝顶的传感器或测度模范。