學術評判中,“AI考官”能被委以重任嗎
222
訂閱已訂閱已收藏
收藏點擊播報本文,約
“AI考官”能評判學術背后的思想重量嗎?一項大規模研究,將當前最先進的生成式AI推上了學術評判的席位。
英國劍橋大學領銜的研究團隊讓Claude、ChatGPT等前沿模型,為來自英國三所大學考試和考核中的761篇本科論文逐一打分。結果顯示,AI給出的評分與專家評審授予的學位等級僅僅有約半數相符。更為嚴峻的是,這些系統在識別優秀的學術成果和薄弱的作業時屢屢失准,暴露出其對語言形式過度敏感、對學術實質把握不足的缺陷。
這份新近發布的報告警示,盡管AI可以在一些閱卷流程中充當輔助工具,但若將其推向前台獨立裁斷,不僅可能抹殺學生的個性才華,更將動搖高等教育賴以維系的信任根基。
評分模式“掐頭去尾”
這項名為OpRaise的研究由劍橋大學心理學家德博拉·塔爾米博士主持,聯合曼徹斯特城市大學、諾丁漢大學共同完成。研究團隊選取了2022年至2025年間提交的761篇真實本科論文,涵蓋50個模塊、87項不同作業,考核形式包括課程作業、開卷居家考試與監考考試。
接受測試的三種前沿大語言模型分別為Anthropic的Claude Opus4.6、OpenAI的GPT-5.4以及谷歌的Gemini 3 Flash。研究團隊系統性地從評分標准具體性、校准干預和評分策略三個維度調整指令,甚至為模型提供了完整的評分標准與預期分數分布,並要求其在給分前逐項解釋評判依據。即便如此,AI的評分准確率仍徘徊在35%至65%之間。
在三所不同的大學裡,AI都表現出明顯的“中心傾向偏差”。它們傾向於給所有作業打上安全的中等分數,在50至60分的區間,與人類評分最為接近。一篇被人類專家評為75分(一等學位水平)的優秀論文,AI平均會壓低幾分﹔而一篇被評定為50分的薄弱作品,AI反而會慷慨地拔高幾分,呈現“掐頭去尾”的評分模式。
更注重形式而非“內涵”
人類閱卷,要基於學術推理和學科洞察再作出判斷,但AI的評分本質上依賴統計預測。此次所有被測模型,無一例外地對語言特征表現出過度敏感:文章篇幅更長、詞匯范圍更廣、句子結構更復雜,往往就能獲得更高分數。至於論証是否嚴謹、証據是否充分、批判性思維是否到位,則並非其關注核心。換言之,AI更容易被“漂亮的外表”迷惑,很難穿透文字去掂量學術思想的重量。
這種形式重於內容的傾向,帶來了同質化風險。研究團隊在不同時間用同一篇論文反復測試,AI每次給出的分數幾乎紋絲不動。表面上看,這似乎是“一致性高”的優點,實則暴露了這些AI在共享同一種機械邏輯:它們並非在“理解”論文,而是在匹配語言模式。
而當所有模型都呈現相同的評分模式時,學生的個性表達、獨特的論証路徑、非常規但富有創見的思考,反而可能被忽略。這種偏見的后果,就導致上文所說的,AI在最重要的評估決策之處,准確率最低。
在評語反饋環節,同樣存在局限。AI生成的評語篇幅通常是人類的3至8倍,團隊於是將AI評語壓縮到與人類評語同等長度后,再交由教職工和學生辨別作者身份,結果眾人竟難以區分。然而一旦揭曉哪段話出自AI之手,參與者對AI評語的認可度便明顯下降。這說明,教師與教師之間、教師與學生之間,那種基於專業默契和學科共同體的理解,仍是AI無法取代的。
人類考官無法被替代
面對日益繁重的閱卷壓力,不少高校將AI視為緩解教職工負擔的潛在方案。塔爾米博士坦言,大學正承受著削減工作量、提高效率、滿足學生期望的多重壓力,一些機構已開始考慮讓AI承擔評估職責。機器或許確實能分擔部分勞動密集型的閱卷工作,讓教師騰出更多時間直接指導學生。但這份題為《AI大學評估中的應用:評估自動評分的機遇與風險》的報告強調,最終成績必須始終由人類裁定,AI至多只能充當“第二雙眼睛”,用於錯誤檢測、一致性檢查,或是標記出AI評分與人工評分差異顯著的作業,提請人類重點復核。
學術評估的意義,遠不止於技術層面的打分。塔爾米博士指出,評估是構建教育意義的過程,它讓學生感到被重視,維護學術標准,維系師生之間的信任。
曼徹斯特城市大學的報告合著者雅埃爾·本恩博士補充道,許多學生明確表示,若得知作業由AI打分,會產生強烈的被欺騙感﹔教職員工也認為,過度依賴機器可能侵蝕到專業判斷,並“抽走”了高等教育作為核心的人性化。師生之間圍繞評分與反饋形成的默契與期待,本質上是一種“社會契約”,它的存續有賴於人對人的認可與回應。
這份報告並沒有否定AI在教育領域的價值,而是為其劃定了清晰的邊界:AI絕不能取代“考官席”上的那雙受過專業訓練的眼睛。在學術質量的裁斷場,人類的推理、經驗與責任感,至今仍是無法被算法替代的最后防線。(記者 張夢然)
分享讓更多人看到
- 評論
- 關注


































第一時間為您推送權威資訊
報道全球 傳播中國
關注人民網,傳播正能量