亚洲欧美自拍一区_91精品国产高清一区二区三区 _日韩欧美资源站_日韩成人在线视频观看

首頁 > 觀察 >

AI能接管實驗室了?中國科大最新研究給出真實物理世界的壓力測試

2026-07-31 21:29:17 新智元

新智元報道

我們?nèi)绾闻袛嗳斯ぶ悄苁欠褚呀?jīng)足夠聰明,能夠從事科學(xué)研究,實現(xiàn)端到端的自主科學(xué)發(fā)現(xiàn)?


(資料圖片)

中國科學(xué)技術(shù)大學(xué)發(fā)布的最新研究讓AI「大腦」接管機器科學(xué)家實驗室「身體」,由此將這一問題從知識問答和方案生成,推進到真實物理世界中的實驗執(zhí)行與反饋學(xué)習(xí)。

論文鏈接:https://arxiv.org/abs/2607.23045

研究團隊搭建了一個機器催化實驗室,其中包括45個覆蓋合成、表征和催化性能測試的模塊化自動工作站。

為了讓AI理解和調(diào)用實驗室能力,研究團隊將這些能力封裝為機器可讀技能(skills)。AI智能體可以通過這些技能直接調(diào)用實驗設(shè)備,同時接受真實設(shè)備能力、操作規(guī)范和實驗條件的約束。

圖1.用于催化研究的AI讀得懂的機器科學(xué)家實驗室架構(gòu)。

圖2.從科學(xué)意圖到機器實驗室執(zhí)行路徑。

壓力測試

基于該平臺,研究團隊對由6種智能體框架和9種大語言模型構(gòu)成的48種實際配置進行了系統(tǒng)評測。

測試覆蓋32項由領(lǐng)域?qū)<叶x的研究任務(wù),共計4,608次評測試次。評估不僅考察智能體能否生成實驗計劃,還追蹤這些計劃能否通過核驗并下發(fā)至機器人系統(tǒng),以及生成的工作流是否能夠在無需人工干預(yù)的情況下直接執(zhí)行。

殘酷的真實世界評測結(jié)果

當(dāng)前領(lǐng)先的大語言模型智能體距離「接管」仍有明顯差距。在4,608次測試中,僅151個工作流無需人工修復(fù)即可執(zhí)行,占全部測試的3.3%。表現(xiàn)最好的Claude Code與Claude Opus 4.7組合,可執(zhí)行率為28.1%;Codex與GPT 5.5組合的可執(zhí)行率為19.8%。

會調(diào)整參數(shù),不等于會重新規(guī)劃

研究還進一步考察了智能體能否從真實實驗結(jié)果中學(xué)習(xí)。團隊將Codex/GPT 5.5的組合置于一個開放式的五輪閉環(huán)中,連續(xù)開展實驗規(guī)劃、機器人執(zhí)行、證據(jù)獲取和重新規(guī)劃。

智能體能夠根據(jù)返回的實驗結(jié)果調(diào)整材料配方和操作條件,但這些調(diào)整主要停留在局部參數(shù)優(yōu)化層面。

在五輪實驗過程中,智能體始終保留原有的工作流骨架,沒有重新設(shè)計分析方法,也未能糾正一些持續(xù)存在的關(guān)鍵遺漏,例如缺少電極黏結(jié)劑和針對特定分析物的顯色試劑。

結(jié)果表明,能夠讀取實驗反饋并調(diào)整參數(shù),并不等同于能夠識別研究策略本身的問題,更不等同于進行科學(xué)層面的重新規(guī)劃。

圖3.AI智能體在可執(zhí)行規(guī)劃、驗證和實驗室任務(wù)下發(fā)各環(huán)節(jié)的表現(xiàn)。

長程規(guī)劃仍然是瓶頸

雖然部分智能體生成了經(jīng)專家評估可執(zhí)行、且最多包含44個操作步驟的工作流,但在全部測試中,只有3個工作流超過30個操作步驟。這表明,隨著任務(wù)鏈條延長,智能體維持實驗邏輯完整性和物理可執(zhí)行性的能力仍面臨顯著挑戰(zhàn)。

重新定義AI的科學(xué)能力

研究由此區(qū)分了當(dāng)前「AI科學(xué)家」討論中經(jīng)常被混為一談的三種能力:一是流暢地生成實驗計劃,二是生成能夠在物理實驗室中實際執(zhí)行的工作流,三是根據(jù)實驗結(jié)果調(diào)整整體研究策略。

研究結(jié)果顯示,語言層面的規(guī)劃能力并不能自動轉(zhuǎn)化為可靠的實驗執(zhí)行能力,局部參數(shù)調(diào)整也不能被直接視為科學(xué)層面的重新規(guī)劃。

從「AI測試場」走向「AI訓(xùn)練場」

作為AI for Science的智能科研基礎(chǔ)設(shè)施,機器實驗室既可以成為檢驗AI科學(xué)能力的「測試場」,也可以成為推動AI持續(xù)進化的「訓(xùn)練場」。AI智能體通過機器可讀技能與機器實驗室直接對話,將科學(xué)意圖轉(zhuǎn)化為可執(zhí)行任務(wù),并接收來自機器執(zhí)行、儀器狀態(tài)和實驗結(jié)果的真實反饋。

由此形成的「規(guī)劃—執(zhí)行—反饋—重新規(guī)劃」閉環(huán),不僅能夠暴露AI在知識、操作和研究策略層面的缺陷,還可以將成功的工作流、失敗案例、實驗結(jié)果和專家評估沉淀為模型訓(xùn)練與智能體對齊的數(shù)據(jù),持續(xù)迭代AI模型及其智能體系統(tǒng)。

機器科學(xué)家由此為回答「我們?nèi)绾闻袛嗳斯ぶ悄苁欠褚呀?jīng)足夠聰明,能夠從事科學(xué)研究?」提供可量化、可重復(fù)、可驗證的物理世界證據(jù),并推動AI從生成實驗方案,逐步走向涵蓋科學(xué)問題提出、實驗設(shè)計、機器人執(zhí)行、數(shù)據(jù)分析和證據(jù)驅(qū)動重新規(guī)劃的端到端自主科學(xué)發(fā)現(xiàn)。

圖4.開放科學(xué)問題下AI-機器科學(xué)家的五輪迭代。

參考資料:

https://arxiv.org/abs/2607.23045

編輯:LRST

關(guān)鍵詞 科學(xué) 實驗 機器人 工作流 智能體 中國

相關(guān)推薦

主站蜘蛛池模板: 国产偷久久久精品专区| 午夜免费电影一区在线观看| 国产精品69久久久| 日韩中文字幕视频在线观看| 国产免费成人av| 欧美日韩精品中文字幕一区二区| 日本久久久a级免费| 午夜精品99久久免费| 日韩免费精品视频| 国产欧美日韩综合精品| 丁香六月激情网| 亚洲人成网站在线播放2019| 日韩中文字幕av在线| 欧美一级片中文字幕| av日韩一区二区三区| 久久久久亚洲av无码专区喷水| 国产精品成人av在线| 97成人在线视频| 国产精品久久亚洲| 欧美日韩国产不卡在线看| 九九久久国产精品| 日韩三级在线播放| 国产精品高清网站| 国产精品久久久久久婷婷天堂 | 色综合天天狠天天透天天伊人| 久久99精品久久久久久水蜜桃| 欧美激情亚洲自拍| 久久久久国色av免费观看性色| 国产日韩在线一区二区三区| 久久视频精品在线| 欧美日本亚洲视频| 久久国产精品一区二区三区| 日韩有码在线观看| 国产激情综合五月久久| 国产精品444| 亚洲专区中文字幕| 国产精品美女免费视频| 韩国视频理论视频久久| 午夜精品久久久久久久无码| 亚洲一二区在线| 国产乱子夫妻xx黑人xyx真爽 |