亚洲欧美自拍一区_91精品国产高清一区二区三区 _日韩欧美资源站_日韩成人在线视频观看

首頁(yè) > 滾動(dòng) >

北郵等高校聯(lián)合研究團(tuán)隊(duì)揭開AI空中導(dǎo)航的關(guān)鍵短板 每日速讀

2026-07-27 17:25:37 科技行者

這項(xiàng)由北京郵電大學(xué)牽頭,聯(lián)合湖南師范大學(xué)與清華大學(xué)的研究團(tuán)隊(duì)共同完成的工作,以預(yù)印本形式發(fā)布于2026年7月,編號(hào)為arXiv:2607.12477,感興趣的讀者可通過(guò)該編號(hào)查閱完整論文。

當(dāng)你用手機(jī)地圖導(dǎo)航時(shí),地圖不僅需要知道路上有什么,還需要知道"你在哪里、你在朝哪個(gè)方向走、你剛才轉(zhuǎn)了幾個(gè)彎"。這兩件事缺一不可。然而,當(dāng)我們把這套邏輯搬到無(wú)人機(jī)身上,目前市面上幾乎所有頂尖的AI大模型,都只做好了前半件事——認(rèn)識(shí)周圍的世界,卻幾乎完全忽略了后半件事——理解無(wú)人機(jī)自身在做什么。這個(gè)盲區(qū),正是本研究想要正面解決的問(wèn)題。


【資料圖】

研究團(tuán)隊(duì)將這一核心命題稱為"自我與空間"(Self in Space):一架真正智能的無(wú)人機(jī),不僅要看懂它飛過(guò)的城市,還要清楚地知道自己正在做什么、剛才做了什么、接下來(lái)該怎么做。為此,他們構(gòu)建了一套名為SIS-Bench的評(píng)測(cè)基準(zhǔn),并專門設(shè)計(jì)了一種結(jié)合光流信息的運(yùn)動(dòng)感知模型SIS-Motion,用嚴(yán)格的實(shí)驗(yàn)數(shù)據(jù)揭示了當(dāng)前AI的核心短板,同時(shí)也驗(yàn)證了改進(jìn)方向的可行性。

一、無(wú)人機(jī)的"導(dǎo)航難題":只認(rèn)識(shí)世界,卻不認(rèn)識(shí)自己

以一位經(jīng)驗(yàn)豐富的快遞騎手為例。他騎著電動(dòng)車穿梭在城市里,不僅需要認(rèn)出路口的便利店和醫(yī)院,還需要時(shí)刻清楚自己剛才是向左轉(zhuǎn)了彎、還是直行穿過(guò)了一條隧道,以及如果接下來(lái)再右轉(zhuǎn)會(huì)到哪里。前者是"認(rèn)識(shí)世界的能力",后者是"認(rèn)識(shí)自己的能力",兩者缺一不可才能安全送達(dá)。

現(xiàn)實(shí)中的無(wú)人機(jī)AI面臨的正是這個(gè)困境。過(guò)去幾年,多模態(tài)大語(yǔ)言模型(簡(jiǎn)單理解為:能同時(shí)看圖、看視頻和理解文字的超級(jí)AI)被廣泛引入無(wú)人機(jī)系統(tǒng),讓無(wú)人機(jī)擁有了識(shí)別地面建筑、判斷目標(biāo)位置、理解飛行指令的能力。然而,研究人員發(fā)現(xiàn),幾乎所有已有的研究和評(píng)測(cè)系統(tǒng),都只關(guān)注無(wú)人機(jī)對(duì)"外部世界"的理解,對(duì)于無(wú)人機(jī)自身的飛行狀態(tài)、運(yùn)動(dòng)歷史和行為預(yù)測(cè),卻少有系統(tǒng)性的考量。

這不是小問(wèn)題。在實(shí)際飛行中,無(wú)人機(jī)的每一次姿態(tài)變化都會(huì)改變它看到的畫面——向左偏轉(zhuǎn)時(shí),右邊的建筑會(huì)慢慢進(jìn)入視野;向下俯沖時(shí),地面會(huì)快速放大。如果AI不理解這些變化是"自己在動(dòng)"造成的,而不是"世界在動(dòng)",就會(huì)產(chǎn)生嚴(yán)重的認(rèn)知混亂,導(dǎo)致判斷失誤。正因如此,研究團(tuán)隊(duì)認(rèn)為,無(wú)人機(jī)智能的真正瓶頸,在于如何同時(shí)理解"外部世界"與"自身狀態(tài)",也就是"自我與空間"的統(tǒng)一建模。

二、SIS-Bench:給無(wú)人機(jī)AI設(shè)計(jì)的"駕照考試"

為了系統(tǒng)地衡量AI在這兩方面的能力,研究團(tuán)隊(duì)從零開始設(shè)計(jì)了SIS-Bench這套評(píng)測(cè)基準(zhǔn)。它就像是一套專門為無(wú)人機(jī)AI設(shè)計(jì)的"駕照考試題庫(kù)",考題不僅測(cè)試你認(rèn)不認(rèn)識(shí)路,還要測(cè)試你記不記得自己剛才怎么走的、能不能規(guī)劃下一步怎么走。

整個(gè)題庫(kù)從兩個(gè)維度展開。第一個(gè)維度是"空間認(rèn)知",考查AI對(duì)外部環(huán)境的理解能力,包括識(shí)別地面上的物體、判斷建筑物的顏色屬性、辨別兩個(gè)地標(biāo)的相對(duì)位置關(guān)系等。第二個(gè)維度是"自我感知",考查AI對(duì)無(wú)人機(jī)自身行為的理解能力,包括識(shí)別無(wú)人機(jī)當(dāng)前正在執(zhí)行的飛行動(dòng)作、記住一段飛行過(guò)程中的動(dòng)作順序、預(yù)測(cè)執(zhí)行某個(gè)動(dòng)作后會(huì)到達(dá)哪里等。

在這兩個(gè)維度內(nèi)部,研究團(tuán)隊(duì)還按照認(rèn)知難度設(shè)計(jì)了三個(gè)遞進(jìn)層次。第一層叫"感知",對(duì)應(yīng)的是最直接的即時(shí)觀察,就像你看一眼窗外就能判斷今天是晴天還是陰天,不需要任何回憶或推理。第二層叫"記憶",要求AI能夠在時(shí)間軸上保存和提取信息,就像你需要回想起"剛才經(jīng)過(guò)的那個(gè)路口旁邊有一家藍(lán)色招牌的藥店"。第三層叫"推理",是難度最高的層次,需要AI把對(duì)空間的理解和對(duì)自身行為的理解整合在一起,做出復(fù)雜的判斷,就像你能在腦海中構(gòu)建一張地圖,然后規(guī)劃從A點(diǎn)到B點(diǎn)的最優(yōu)路線。

在題目類型上,SIS-Bench共覆蓋13種具體任務(wù)??臻g認(rèn)知方面,感知層包含"物體存在性判斷"(這段視頻里有沒有藍(lán)色自行車?)、"物體屬性識(shí)別"(停在電線桿下的車是什么顏色?)和"相對(duì)方向判斷"(停車標(biāo)志的后方是什么物體?)三類題目;記憶層包含"地標(biāo)順序回憶"(這幾個(gè)地標(biāo)按什么順序出現(xiàn)?)、"地標(biāo)回溯"(玻璃幕墻大樓的前一個(gè)地標(biāo)是什么?)和"位置關(guān)系記憶"(第四段視頻里白色高層右側(cè)是什么?)三類題目;推理層則包含"空間一致性"(假設(shè)我懸停在紅頂亭子上方,面向圓形藍(lán)色噴泉,我的右手邊是什么?)和"時(shí)空一致性"(從游泳池出發(fā),正確的地標(biāo)經(jīng)過(guò)順序是什么?)兩類題目。

自我感知方面,感知層對(duì)應(yīng)"動(dòng)作識(shí)別"(無(wú)人機(jī)當(dāng)前在執(zhí)行什么飛行動(dòng)作?);記憶層對(duì)應(yīng)"動(dòng)作序列回憶"(這段拼接視頻中無(wú)人機(jī)依次執(zhí)行了哪些動(dòng)作?)和"動(dòng)作回溯"(第二段視頻里無(wú)人機(jī)在做什么?);推理層則包含"動(dòng)作預(yù)測(cè)"(從紅色網(wǎng)球場(chǎng)上方出發(fā),執(zhí)行這串動(dòng)作序列后會(huì)到哪里?)和"路徑規(guī)劃"(從紅色網(wǎng)球場(chǎng)出發(fā),要到達(dá)藍(lán)色地板的籃球場(chǎng),應(yīng)該執(zhí)行怎樣的動(dòng)作序列?)兩類最高難度的題目。

為了讓這些題目盡可能接近真實(shí)飛行場(chǎng)景,研究團(tuán)隊(duì)對(duì)視頻素材也做了精心設(shè)計(jì),定義了四種不同的視頻格式。單段視頻保留一個(gè)完整的短片段,用于感知層測(cè)試;拼接視頻將2到4個(gè)短片段連接在一起,用于記憶層測(cè)試;長(zhǎng)視頻保留完整的長(zhǎng)時(shí)飛行軌跡,用于推理層測(cè)試;打亂視頻則將一段長(zhǎng)視頻切成若干片段后隨機(jī)重排,強(qiáng)迫AI從混亂的時(shí)間順序中還原出真實(shí)的空間結(jié)構(gòu),這也是難度最高的推理場(chǎng)景。

SIS-Bench的數(shù)據(jù)來(lái)源于三個(gè)公開的無(wú)人機(jī)數(shù)據(jù)集:AirScape、UrbanVideo-Bench和VisDrone,覆蓋城市街道、住宅小區(qū)、工業(yè)園區(qū)、自然景觀等多種環(huán)境,總計(jì)1646段真實(shí)無(wú)人機(jī)視頻,累計(jì)時(shí)長(zhǎng)約14.9小時(shí)。所有題目均由兩位專家獨(dú)立審核,只有雙方都認(rèn)可的題目才能進(jìn)入最終題庫(kù)。最終,SIS-Bench共包含4856道多項(xiàng)選擇題,其中感知層占36.3%,記憶層占43.7%,推理層占20.0%。

三、AI現(xiàn)在的真實(shí)成績(jī):人類91.7%,最強(qiáng)AI模型71.6%

有了考卷,接下來(lái)就是摸底考試。研究團(tuán)隊(duì)將當(dāng)前業(yè)界最強(qiáng)的26個(gè)視頻多模態(tài)大模型一一送上考場(chǎng),其中包括6個(gè)閉源商業(yè)模型(Gemini 3 Flash、GPT-5.4、Kimi-2.5、Doubao-Seed-1.8、Doubao-Seed-1.6-Vision、Qwen3.5-Plus)和20個(gè)開源模型。同時(shí),他們還招募了6位具有碩士學(xué)歷的人類專家參加同樣的考試,作為成績(jī)上限的參照。

結(jié)果出人意料,卻又在情理之中。人類專家的平均正確率達(dá)到91.7%,而表現(xiàn)最好的AI模型Gemini 3 Flash僅取得71.6%的正確率,兩者之間相差超過(guò)20個(gè)百分點(diǎn)。這說(shuō)明SIS-Bench并不是一套過(guò)于容易的題目,當(dāng)前的AI距離人類水平還有相當(dāng)大的差距。

更值得關(guān)注的是成績(jī)背后的結(jié)構(gòu)性規(guī)律。研究人員發(fā)現(xiàn)了兩個(gè)非常一致、跨越所有模型都成立的現(xiàn)象。

第一個(gè)現(xiàn)象是"重空間、輕自我"的系統(tǒng)性偏差。幾乎所有被測(cè)試的模型,在空間認(rèn)知類題目上的得分都明顯高于在自我感知類題目上的得分。換句話說(shuō),這些AI更擅長(zhǎng)理解無(wú)人機(jī)看到的外部世界,卻不擅長(zhǎng)理解無(wú)人機(jī)自身在做什么。以Gemini 3 Flash為例,它的空間認(rèn)知平均分為83.7%,而自我感知平均分僅為58.6%,差距超過(guò)25個(gè)百分點(diǎn)。這種系統(tǒng)性偏差在所有26個(gè)模型中幾乎無(wú)一例外。

第二個(gè)現(xiàn)象是"感知好、記憶差、推理更差"的認(rèn)知層次衰減。隨著題目從感知層上升到記憶層,再上升到推理層,幾乎所有模型的成績(jī)都呈現(xiàn)出明顯的下降趨勢(shì)。這種衰減在閉源商業(yè)模型和開源模型中都同樣存在。直接看一眼就能回答的題目,AI表現(xiàn)尚可;但需要在時(shí)間軸上保存信息再提取的題目,成績(jī)就開始下滑;而需要整合空間知識(shí)與動(dòng)作歷史才能完成的復(fù)雜推理題,成績(jī)下降得最為明顯。

研究團(tuán)隊(duì)還專門做了一系列對(duì)照實(shí)驗(yàn),驗(yàn)證這些規(guī)律不是由題目設(shè)計(jì)本身造成的。他們測(cè)試了不同的視頻采樣策略,發(fā)現(xiàn)結(jié)果幾乎沒有變化;他們對(duì)打亂視頻重復(fù)三次隨機(jī)排列取平均,結(jié)論也依然穩(wěn)定;他們給模型加上"思維鏈提示"(讓AI在回答之前先把推理過(guò)程寫出來(lái))和"思維樹提示"(讓AI探索多條推理路徑),發(fā)現(xiàn)這些技巧對(duì)整體結(jié)論影響甚微,有的任務(wù)甚至?xí)驗(yàn)樘崾驹~變化而成績(jī)下降;而人類專家在面對(duì)相同的拼接視頻、長(zhǎng)視頻和打亂視頻時(shí),依然能保持接近90%的準(zhǔn)確率。這些控制實(shí)驗(yàn)共同說(shuō)明,觀察到的模型短板是真實(shí)存在的能力缺陷,而非題目設(shè)計(jì)的偏差。

在更細(xì)致的錯(cuò)誤分析中,研究團(tuán)隊(duì)對(duì)4個(gè)代表性模型的7987條錯(cuò)誤回答進(jìn)行了逐一標(biāo)注,將錯(cuò)誤分為8個(gè)類別。結(jié)果顯示,"動(dòng)作理解錯(cuò)誤"占所有錯(cuò)誤的33.0%,"空間推理錯(cuò)誤"占18.2%,是兩個(gè)最主要的失敗原因。這意味著AI的錯(cuò)誤并不主要來(lái)自"沒看清楚",而更多來(lái)自"不理解無(wú)人機(jī)自己在動(dòng)"以及"無(wú)法在腦海中構(gòu)建穩(wěn)定的空間關(guān)系圖"。

四、三個(gè)具體失敗案例:AI的盲區(qū)藏在哪里

為了讓讀者更直觀地感受到這些局限,研究團(tuán)隊(duì)展示了三類典型的錯(cuò)誤場(chǎng)景,每一類都揭示了不同層面的認(rèn)知盲區(qū)。

第一類錯(cuò)誤發(fā)生在夜間飛行的動(dòng)作識(shí)別任務(wù)中。畫面中,路燈稀少,背景昏暗,只有零星的車燈軌跡可見。正確答案是"無(wú)人機(jī)垂直下降同時(shí)向右偏轉(zhuǎn)",但包括Gemini 3 Flash、GPT-5.4、Doubao-Seed-1.8和Qwen3.5-Plus在內(nèi)的所有主流模型都錯(cuò)誤地選擇了"沿弧線向前飛行同時(shí)向右偏轉(zhuǎn)"。原因在于,這些模型過(guò)于依賴視覺中最顯眼的亮點(diǎn)(車燈軌跡),把亮點(diǎn)的移動(dòng)方向理解成了自身的前進(jìn)方向,而沒有從整體畫面變化的模式中感知到真實(shí)的下降動(dòng)作。這就像你坐在一輛向后移動(dòng)的火車上,看到窗外的樹木向前移動(dòng),就以為自己在向前走——錯(cuò)誤的原因不是視力問(wèn)題,而是對(duì)"自己在動(dòng)"這件事缺乏感知。

第二類錯(cuò)誤發(fā)生在拼接視頻的動(dòng)作序列記憶任務(wù)中。視頻由三段短片段拼接而成,正確的動(dòng)作序列是"緩慢下降同時(shí)俯仰角下壓 → 保持穩(wěn)定向前飛行 → 緩慢下降同時(shí)俯仰角下壓"。部分模型能正確識(shí)別前兩個(gè)動(dòng)作,卻在第三段上判斷失誤,誤以為最后一段是繼續(xù)向前飛行。另一些模型則更早就出錯(cuò),把第一段也認(rèn)成了向前飛行,導(dǎo)致整條序列完全錯(cuò)誤。這類錯(cuò)誤的本質(zhì)不是單段視頻看不懂,而是無(wú)法在多個(gè)片段之間建立穩(wěn)定的時(shí)間界限,一旦某段的判斷偏差,就會(huì)連帶影響整條序列的理解。這與人類在長(zhǎng)時(shí)間工作后容易混淆事件順序的情況有些相似,只不過(guò)AI的這種混亂即便在很短的視頻里也會(huì)出現(xiàn)。

第三類錯(cuò)誤發(fā)生在拼接視頻的動(dòng)作回溯任務(wù)中。題目要求模型識(shí)別"第三段視頻里無(wú)人機(jī)在做什么",正確答案是"順時(shí)針旋轉(zhuǎn)",但幾乎所有被測(cè)模型都錯(cuò)誤地選擇了"俯沖同時(shí)向前飛行"或"緩慢向前飛行"。視頻中,第三段的視角確實(shí)發(fā)生了明顯變化,但這種變化是機(jī)身在原地旋轉(zhuǎn)導(dǎo)致的,而不是向前推進(jìn)造成的。由于這兩種運(yùn)動(dòng)在視覺上都會(huì)產(chǎn)生"場(chǎng)景在移動(dòng)"的效果,區(qū)分它們需要精細(xì)地感知背景整體結(jié)構(gòu)的變化方式,而不是簡(jiǎn)單地注意到"畫面在變"?,F(xiàn)有模型傾向于把任何明顯的視角變化都解讀為"向前移動(dòng)"或"俯仰變化",對(duì)"原地旋轉(zhuǎn)"這種更微妙的自我運(yùn)動(dòng)模式缺乏有效的識(shí)別能力。

五、SIS-Motion:給無(wú)人機(jī)AI裝上"運(yùn)動(dòng)感知器"

發(fā)現(xiàn)問(wèn)題之后,研究團(tuán)隊(duì)沒有止步于診斷,而是進(jìn)一步探索了一條改進(jìn)路徑。他們的核心思路是:既然AI對(duì)自身運(yùn)動(dòng)不夠敏感,能不能專門給它加一套感知運(yùn)動(dòng)的"傳感器"?

這個(gè)"傳感器"的技術(shù)名稱叫光流(Optical Flow)。光流的原理很直觀:對(duì)于視頻中相鄰的兩幀畫面,你可以計(jì)算每一個(gè)像素從第一幀到第二幀移動(dòng)了多少距離、朝哪個(gè)方向移動(dòng)。當(dāng)無(wú)人機(jī)向前飛時(shí),畫面中所有元素都會(huì)向外擴(kuò)散;當(dāng)無(wú)人機(jī)向右偏轉(zhuǎn)時(shí),畫面整體會(huì)向左平移;當(dāng)無(wú)人機(jī)原地旋轉(zhuǎn)時(shí),畫面會(huì)產(chǎn)生一種特殊的旋轉(zhuǎn)流場(chǎng)。這些運(yùn)動(dòng)模式,用人眼觀察非常微妙,但用數(shù)學(xué)方法計(jì)算出來(lái)之后,會(huì)變成非常清晰的結(jié)構(gòu)化信息,可以直接告訴AI"機(jī)身在以什么方式運(yùn)動(dòng)"。

研究團(tuán)隊(duì)將這套光流信息封裝成一套與原有視覺特征并行的"運(yùn)動(dòng)編碼器",嵌入到標(biāo)準(zhǔn)的視頻多模態(tài)大模型中,構(gòu)成了SIS-Motion框架。具體來(lái)說(shuō),原有模型會(huì)提取視頻幀的視覺特征,描述場(chǎng)景里有什么、長(zhǎng)什么樣;新增的運(yùn)動(dòng)編碼器則同步提取光流信息,描述每一幀到下一幀之間畫面如何變化。兩路信息通過(guò)一個(gè)輕量級(jí)的連接模塊融合在一起,共同送入語(yǔ)言模型進(jìn)行最終的推理和回答。

為了訓(xùn)練這個(gè)升級(jí)版模型,研究團(tuán)隊(duì)從AirScape數(shù)據(jù)集的訓(xùn)練集中構(gòu)建了一個(gè)專門的訓(xùn)練語(yǔ)料庫(kù),命名為SIS-Motion-54K,包含54000條樣本。這些樣本覆蓋三種形式:多項(xiàng)選擇題格式,覆蓋9個(gè)感知和記憶類任務(wù),讓模型在訓(xùn)練階段就熟悉與評(píng)測(cè)相同的題目類型;開放問(wèn)答格式,去掉選項(xiàng),讓模型直接從視頻中生成回答,避免模型僅靠選項(xiàng)匹配取巧;描述格式,包含"運(yùn)動(dòng)意圖描述"和"場(chǎng)景內(nèi)容描述"兩類,讓模型學(xué)會(huì)同時(shí)用語(yǔ)言表達(dá)運(yùn)動(dòng)信息和環(huán)境信息。特別值得一提的是,這批訓(xùn)練數(shù)據(jù)嚴(yán)格只涵蓋感知和記憶任務(wù),沒有包含任何推理類任務(wù)的樣本。這樣的設(shè)計(jì)是刻意為之——如果事后在推理任務(wù)上也出現(xiàn)了成績(jī)提升,就能說(shuō)明這種提升來(lái)自模型對(duì)底層運(yùn)動(dòng)信息的更好理解,而不是靠記住了推理題的答案模式。

六、實(shí)驗(yàn)結(jié)果:運(yùn)動(dòng)感知帶來(lái)了什么,又沒帶來(lái)什么

實(shí)驗(yàn)結(jié)果清晰地展示了SIS-Motion的實(shí)際效果。

與同等配置下只使用視覺信息的基礎(chǔ)微調(diào)模型相比,加入運(yùn)動(dòng)感知之后,空間認(rèn)知的平均得分從72.0%提升到74.2%,自我感知的平均得分從60.3%提升到63.7%。這個(gè)結(jié)果很有意思:運(yùn)動(dòng)信息不僅幫助了自我感知(這是預(yù)期之內(nèi)的),同時(shí)也幫助了空間認(rèn)知(這稍微出乎意料)。原因在于,無(wú)人機(jī)的運(yùn)動(dòng)與它看到的環(huán)境本來(lái)就是不可分割的——當(dāng)你知道無(wú)人機(jī)在向右偏轉(zhuǎn),你就更容易理解為什么畫面左側(cè)的建筑在變大、右側(cè)的建筑在縮小,從而更準(zhǔn)確地判斷地標(biāo)之間的位置關(guān)系。這正是"自我與空間"統(tǒng)一建模的價(jià)值體現(xiàn)。

具體到任務(wù)層面,提升最為明顯的包括"物體屬性識(shí)別"、"地標(biāo)回溯"、"位置關(guān)系記憶"、"動(dòng)作識(shí)別"、"動(dòng)作序列回溯"和"動(dòng)作記憶"等感知和記憶類任務(wù)。而在推理層的4個(gè)任務(wù)上,成績(jī)的提升有限且不夠穩(wěn)定——"路徑規(guī)劃"任務(wù)有所改善,但"動(dòng)作預(yù)測(cè)"任務(wù)沒有變化。這與訓(xùn)練數(shù)據(jù)的設(shè)計(jì)完全吻合:模型在沒有接觸過(guò)推理訓(xùn)練數(shù)據(jù)的情況下,從改進(jìn)的底層感知能力中獲得了部分泛化,但高層次的復(fù)雜推理仍然是尚未攻克的難關(guān)。

研究團(tuán)隊(duì)還測(cè)試了四種不同的光流估計(jì)算法(RAFT、Sea-RAFT、MemFlow、MOFNet),發(fā)現(xiàn)所有四種算法搭配后的模型都優(yōu)于純視覺基礎(chǔ)線,說(shuō)明這套改進(jìn)方案對(duì)具體光流算法的選擇并不敏感,具有較強(qiáng)的通用性。其中,MOFNet算法的光流質(zhì)量最高,最終取得了最好的綜合成績(jī),總體正確率達(dá)到69.1%。

七、在真實(shí)導(dǎo)航任務(wù)中的遷移驗(yàn)證

為了確認(rèn)這套改進(jìn)不是僅在題庫(kù)里有效,研究團(tuán)隊(duì)還在一個(gè)完全獨(dú)立的下游任務(wù)上進(jìn)行了驗(yàn)證。他們基于OpenUAV數(shù)據(jù)集構(gòu)建了一個(gè)無(wú)人機(jī)路徑規(guī)劃測(cè)試集,包含來(lái)自22個(gè)模擬場(chǎng)景的3895道題目,覆蓋城市街道、沙漠、森林、港口和海島等多種地形。

在這個(gè)測(cè)試中,所有模型都采用零樣本方式評(píng)測(cè),即沒有任何針對(duì)這批題目的額外訓(xùn)練。結(jié)果顯示,SIS-Motion的正確率達(dá)到92.2%,遠(yuǎn)高于同等底座模型Qwen2.5-VL 3B在零樣本狀態(tài)下的71.2%,提升超過(guò)20個(gè)百分點(diǎn)。這說(shuō)明,在SIS-Motion-54K上學(xué)到的運(yùn)動(dòng)感知能力,確實(shí)能夠遷移到完全不同的下游飛行決策場(chǎng)景中,而不僅僅是在題庫(kù)分布內(nèi)有效。

歸根結(jié)底,這項(xiàng)研究做了兩件重要的事。第一件是照鏡子——用SIS-Bench這套精心設(shè)計(jì)的評(píng)測(cè)體系,清楚地照出了當(dāng)前頂尖AI模型的真實(shí)短板:它們對(duì)外部世界理解得不錯(cuò),但對(duì)自身行為的感知嚴(yán)重不足,而且隨著任務(wù)從即時(shí)感知升級(jí)到時(shí)間記憶、再升級(jí)到復(fù)雜推理,成績(jī)會(huì)持續(xù)走低。第二件是試著補(bǔ)救——用SIS-Motion驗(yàn)證了一種思路:把光流這種能夠直接描述運(yùn)動(dòng)的信息注入模型,可以在不大幅改動(dòng)模型結(jié)構(gòu)的前提下,系統(tǒng)性地改善感知和記憶層面的表現(xiàn),并且這種改善能夠遷移到實(shí)際的飛行導(dǎo)航?jīng)Q策中。

當(dāng)然,研究團(tuán)隊(duì)也坦誠(chéng)地指出了這項(xiàng)工作的局限。SIS-Motion在推理層任務(wù)上的改進(jìn)有限,路徑規(guī)劃這類高層次決策任務(wù)需要更復(fù)雜的目標(biāo)導(dǎo)向推理能力,僅靠局部運(yùn)動(dòng)信息并不夠。此外,SIS-Bench本身的評(píng)測(cè)形式是多項(xiàng)選擇題,更接近于對(duì)模型理解能力的間接測(cè)量,而不是對(duì)無(wú)人機(jī)真實(shí)飛行決策的直接考查。如何將這套對(duì)"自我與空間"的理解轉(zhuǎn)化為可靠的閉環(huán)飛行控制,依然是一個(gè)需要進(jìn)一步探索的開放問(wèn)題。

對(duì)于研究人員來(lái)說(shuō),這項(xiàng)工作提出了一個(gè)值得深思的方向:我們是否在構(gòu)建無(wú)人機(jī)AI時(shí),太過(guò)于關(guān)注"認(rèn)識(shí)世界",而忽視了"認(rèn)識(shí)自己"這同樣重要的能力?而對(duì)于普通大眾來(lái)說(shuō),這項(xiàng)研究意味著,未來(lái)真正能夠安全、可靠地在城市上空自主飛行的無(wú)人機(jī),除了需要一雙"看懂世界的眼睛",還需要一套"感知自身行為的內(nèi)感覺"。兩者缺一不可,這或許才是無(wú)人機(jī)真正走向智能化的關(guān)鍵一步。有興趣深入了解這項(xiàng)研究的讀者,可以通過(guò)arXiv編號(hào)2607.12477查閱完整論文原文。

Q&A

Q1:SIS-Bench是什么,它和普通的無(wú)人機(jī)測(cè)試有什么區(qū)別?

A:SIS-Bench是一套專門用來(lái)測(cè)評(píng)無(wú)人機(jī)AI能力的題庫(kù),包含4856道多項(xiàng)選擇題,覆蓋13種任務(wù)類型。與以往只測(cè)試無(wú)人機(jī)能否識(shí)別地面環(huán)境的評(píng)測(cè)不同,SIS-Bench同時(shí)測(cè)試兩件事:一是無(wú)人機(jī)對(duì)外部世界的理解(比如識(shí)別建筑顏色、判斷地標(biāo)順序),二是無(wú)人機(jī)對(duì)自身行為的理解(比如識(shí)別當(dāng)前飛行動(dòng)作、記憶飛行軌跡)。這種"內(nèi)外兼顧"的設(shè)計(jì),是SIS-Bench區(qū)別于以往評(píng)測(cè)的核心特點(diǎn)。

Q2:當(dāng)前最強(qiáng)的AI模型在SIS-Bench上表現(xiàn)怎么樣?

A:表現(xiàn)最好的商業(yè)模型Gemini 3 Flash總體正確率為71.6%,而人類專家的正確率為91.7%,差距超過(guò)20個(gè)百分點(diǎn)。更值得注意的是,所有模型在"自我感知"類題目上的得分都系統(tǒng)性地低于"空間認(rèn)知"類題目,說(shuō)明現(xiàn)有AI普遍存在"認(rèn)識(shí)世界強(qiáng)、認(rèn)識(shí)自己弱"的結(jié)構(gòu)性短板。

Q3:SIS-Motion是怎么改善無(wú)人機(jī)AI對(duì)自身運(yùn)動(dòng)的理解的?

A:SIS-Motion通過(guò)在原有視覺模型之外增加一套光流分析模塊來(lái)實(shí)現(xiàn)改善。光流能計(jì)算出視頻相鄰幀之間每個(gè)像素的移動(dòng)方向和距離,把無(wú)人機(jī)的飛行動(dòng)作轉(zhuǎn)化為結(jié)構(gòu)化的運(yùn)動(dòng)信息,讓AI不再只依賴畫面外觀來(lái)猜測(cè)自身在做什么。加入這套模塊后,自我感知平均得分從60.3%提升到63.7%,空間認(rèn)知也同步提升,且效果可以遷移到真實(shí)無(wú)人機(jī)導(dǎo)航?jīng)Q策任務(wù)中。

關(guān)鍵詞 算法 軌跡 動(dòng)作 飛行 光流 北郵 無(wú)人機(jī)

相關(guān)推薦

主站蜘蛛池模板: 精品国产一区av| 亚洲一区在线直播| 日韩亚洲国产中文字幕| 欧美日韩大片一区二区三区| 亚洲精品电影在线一区| 日韩在线精品视频| 国产精品99久久久久久久| 欧美在线一区二区三区四| 91精品视频在线播放| 国产不卡av在线| 亚洲综合av一区| 一区二区三区在线视频看 | 国产精品乱码一区二区三区| 久久国产精品精品国产色婷婷 | 精品国产一区二区三区久久久狼 | 国产激情久久久| 欧美人成在线视频| 日本一区二区三区在线播放| 国产精品国产亚洲伊人久久 | 欧美久久综合性欧美| 久久精品99无色码中文字幕| 99国产在线视频| 国产精品视频网站在线观看| 国产亚洲欧美在线视频| 国产在线拍揄自揄视频不卡99| 日本高清久久一区二区三区| 日韩中文字幕不卡视频| 亚洲日本无吗高清不卡| 亚洲一区二区免费| 亚洲欧美综合一区| 午夜精品蜜臀一区二区三区免费| 91精品视频专区| 国产99在线免费| 亚洲综合精品伊人久久| 国产精品综合网站| www黄色av| 99在线观看视频网站| 国产精品久久久久不卡| 国产一区免费视频| 国产欧美日韩免费看aⅴ视频| 国产一区二中文字幕在线看|