
大模型已經能夠回答復雜的科學問題,也能識別和描述圖像內容。但在真實科研場景中,看見圖像并不等于理解實驗。面對一張真實實驗圖像或分析結果,模型能否抓住其中的關鍵信息,判斷當前實驗狀態,并給出合理的解釋和下一步建議? 為回答這一問題,晶泰科技聯合上海人工智能實驗室、中國科學院上海硅酸鹽研究所、上海交通大學、嘉興大學等機構,聯合創建了 LabOPBench——一個面向真實化學與材料實驗場景的多模態評測集。它包含 756 道由實驗人員設計并獨立審核的題目,重點考察模型能否將真實實驗中的視覺證據轉化為可靠的實驗判斷。 我們對 7 個主流多模態模型進行了系統測試。結果顯示,沒有一個模型的總體得分超過 50%,最高分僅為 45.8%。這意味著,當前模型雖然已經具備一定的科學知識和圖像理解能力,但距離穩定、可靠地理解真實實驗,仍有明顯差距。

真實實驗場景中,
模型究竟需要回答什么?
在真實科研中,許多關鍵問題并不存在可以直接檢索或套用的標準答案。研究人員需要結合實驗現象、儀器輸出和樣品狀態,識別與決策相關的證據,并進一步判斷:當前實驗是否處于正常狀態,異常可能由什么原因引起,以及接下來應該采取什么操作。

LabOPBench 共覆蓋五類實驗任務;
圖 a 展示五個大類及其題目占比,
圖 b–e 呈現實驗準備、實驗后處理、
實驗監測和實驗表征四個大類下的細分類別分布
LabOPBench 正是圍繞這類 “從實驗觀察到科學決策” 的問題構建。評測共包含 756 道題目,其中 664 道來自有機合成實驗,92 道來自材料科學實驗。題目均基于真實實驗圖像和科學分析結果,覆蓋兩個領域中的典型實驗判斷場景。這些題目關注的并不是模型 “記住了多少科學知識”,而是它能否真正讀懂實驗現象:從圖像和分析結果中提取關鍵證據,并根據具體問題判斷實驗狀態、分析可能原因,或給出合理的后續操作。

不是識圖題,而是實驗分析題
LabOPBench 并不只考察模型對實驗器材或表面現象的識別能力。每道題均對應一個具體且可獨立判斷的實驗情境,模型需要結合圖像證據與必要的背景信息,對當前實驗狀態進行判斷,分析潛在原因或風險,并提出合理的后續操作建議。
LabOPBench 的核心評測目標,在于考察模型能否完成從實驗現象觀察、狀態與原因分析,到后續操作決策的完整推理過程。模型不僅需要判斷實驗中發生了什么,還需要說明其可能原因,并據此給出相互一致的處理方案。
所有題目均采用開放式文本作答,而非預設選項。每道題均配有由專家制定的 0—3 分評分標準。評分不僅考察最終結論是否正確,還關注回答是否識別了關鍵實驗依據,以及狀態判斷、原因分析與操作建議之間是否保持一致。

總榜單:最強模型仍未超過50分
我們在完整的 756 道題目上評測了 7 個主流多模態模型。Claude Opus 4.7 以45.8% 的總體得分位列第一,GPT-5.5 以 43.6% 排名第二,Gemini 3.1 Pro 以 41.9% 排名第三。所有模型的總體得分分布在 36.7% 至 45.8% 之間,沒有一個模型超過 50%。

進一步來看,模型在不同實驗場景中的表現差異明顯。其中,反應后處理的整體表現最低,七個模型的平均得分為 36.3%,且該類別在全部七個模型中均取得最低得分。
在有機化學實驗中,反應后處理是連接反應過程與最終樣品獲得的核心環節,涵蓋分離、純化和過程狀態判斷等一系列關鍵操作。實驗能否最終獲得合格樣品,往往取決于這一階段能否根據實際現象及時作出正確判斷。模型在這一核心環節上的表現相對較弱,表明其在真實實驗中的操作判斷能力仍有較大提升空間。

最強模型仍未達到博士生平均水平
為了更直觀地了解模型目前處于什么水平,我們讓 7 個模型、5 名本科生和 5 名博士生完成同一組 100 道有機化學實驗題。所有人類參與者均基于與模型相同的圖像和背景信息獨立作答,回答也采用相同的標準進行評分。

結果顯示,本科生和博士生的平均得分分別為 31.0% 和 45.9%。表現較好的 Claude Opus 4.7 和 GPT-5.5 分別獲得 43.7% 和 43.5%,超過本科生平均水平,但仍低于博士生平均分。
這一結果表明,頂尖多模態模型已經超過本科生參與者的平均水平,展現出一定的實驗判斷能力。但即使是表現最好的模型,也未達到博士生參與者的平均分。當前模型在真實實驗情境中的表現仍有進一步提升空間。

看見不等于看懂:
模型為何仍會誤判真實實驗?
模型在評測中的得分,究竟來自對實驗圖像的真實理解,還是主要依賴問題文字和已有知識進行推斷?為了驗證這一點,在同一組 100 道題目上,我們進一步進行了圖像錯配實驗,以檢驗模型的回答究竟依賴真實圖像,還是主要來自問題文字和已有知識。實驗將原始圖片替換為同一細分類別中、但與當前問題不匹配的圖片,其余設置保持不變。

結果顯示,7 個模型的得分均明顯下降,跨模型平均分由 39.0% 降至 20.1%,平均下降 18.9 個百分點。其中,GPT-5.5、Gemini 3.1 Pro 和 Claude Opus 4.7 的降幅均超過 20 個百分點。
這說明,實驗圖像并不是可有可無的附加信息,模型的回答確實依賴圖像與問題之間的對應關系。但與此同時,對圖像敏感并不意味著模型已經正確理解了圖像中的實驗信息。模型可能利用了部分視覺線索,卻仍未識別真正決定答案的關鍵證據。
為進一步識別高性能模型的主要失分來源,我們對總體表現最好的 Claude Opus 4.7、GPT-5.5 和 Gemini 3.1 Pro 進行了專家錯誤分析。兩名專家逐一審查三個模型的非滿分回答,并將能夠明確歸因的問題歸納為六類錯誤。

結果顯示,證據提取失敗(40.0%)和原因—行動不匹配(35.8%)合計占 75.8%,其余四類錯誤占比均低于 8%。這表明,高性能模型的主要瓶頸不在于孤立的化學知識錯誤,而在于證據驅動推理鏈條仍不穩定:模型難以準確識別決策相關的關鍵實驗信息,并將原因判斷轉化為一致、可執行的操作建議。

從看見實驗,到作出可靠判斷
LabOPBench 的結果表明,當前多模態模型已經能夠利用真實實驗圖像和分析結果,并在部分任務中作出合理判斷。但從總體表現、人類對比、圖像錯配和錯誤分析來看,模型仍難以穩定識別與當前實驗決策最相關的證據,并據此形成一致的原因解釋和行動建議。
模型能力的進一步提升不能只依賴擴大規模或補充科學知識,更需要強化基于真實證據進行狀態判斷、原因分析和行動選擇的能力。相應的訓練數據也應覆蓋失敗案例、干預結果和驗證過程,而不僅是成功的實驗流程。
從看見實驗,到理解證據,再到作出可靠判斷,仍是大模型走向可信實驗助手需要跨越的重要一步。
• 項目資源
LabOPBench 的項目介紹、部分數據與評測資源已公開,后續內容將持續更新。
• 評測倉庫
https://github.com/johnnylee00/LabOPBench
• 數據集鏈接
https://huggingface.co/datasets/JOHNNYlee1/LabOPBench
聯系人:晶泰科技
郵箱:bd@xtalpi.com
電話:021-68780786
地址:深圳市福田區福保街道福保社區紅柳道2號國際生物醫藥產業園二期1層
晶泰科技服務號
晶泰智造公眾號
©2026 深圳晶泰科技有限公司 版權所有 備案號:粵ICP備17120953號 技術支持:化工儀器網 Sitemap.xml 總訪問量:128097 管理登陸