科研越來越依賴大模型的參與。但大模型要“讀懂”科學,靠的不是通用互聯網數據——
科研需要AI,AI需要什麼
222
訂閱已訂閱已收藏
收藏點擊播報本文,約
由中國科學院文獻情報中心發起的語料創新生態聯盟(以下簡稱“聯盟”)近日在北京啟動,語料標准規范、敖倉·語料社區服務平台及英文期刊Data Express in AI Corpus等成果同步發布。當日,敖倉·科技語料庫分別與語料應用關鍵機構、國家人工智能應用中試基地簽署合作協議。
為什麼要干這件事?
答案不在語料本身,而在科研。
當前,人工智能正在改變科研范式。從實驗歸納、理論推演、計算模擬到數據驅動,再到AI與科學研究的深度融合(AI for Science,以下簡稱“AI4S”),科研越來越依賴大模型參與科學推理和知識發現。但大模型要“讀懂”科學,靠的不是通用互聯網數據,而是高質量科技語料。
而問題,也由此產生。
AI4S越深,為何越難繞過“語料關”
科研需要AI,AI需要什麼?
聯盟發起人、中國工程院院士孫凝暉開門見山:“智能的本質是數據的百煉成鋼。大模型就是對互聯網全量數據進行深度加工后的產物。但科技領域的語料不一樣,它有科學語義、有物理約束、有誤差信息,不是簡單匯聚就能用的。”
“與通用語料相比,科技語料來源更加多樣、專業語義更加復雜,對科學准確性、知識密度、模態關聯和可追溯性提出了更高要求。”中國科學院科技基礎能力局局長盧方軍進一步解釋。
現實瓶頸同樣突顯:高價值科技資源仍較分散,難以直接轉化為高質量科技語料。
“資源匯聚與授權機制有待完善,標准規范、專業加工、質量評價和安全流通能力仍需加強。”盧方軍解釋,科技語料連接原始科研資源與人工智能模型,是支撐模型訓練、科學推理和知識發現的重要基礎。
可見,建設高質量科技語料,已經成為發展科學智能、提升人工智能專業能力的重要基礎性工作。
單一機構為什麼難干成?盧方軍直言:因為語料供給方、技術研發方和應用需求方之間,缺少緊密的協同機制。這些問題靠一家單位解決不了。
往深一層看,競爭格局也在變。
中國科學院文獻情報中心黨委書記李猛力判斷,全球人工智能競爭正由單一技術和模型能力比拼,向模型、算力、數據與應用生態協同發展的綜合競爭深化。
由此可見,加快構建自主可控、開放協同、安全可信的語料創新生態,是夯實人工智能發展基礎、支撐高水平科技自立自強的重要舉措。
2026年7月17日,世界人工智能大會上,由中國科學院牽頭建設的敖倉·科技語料庫正式發布。聯盟的啟動,正是從“建庫”走向“建生態”的延伸——如果語料關不破,模型訓練便缺“精糧”,科研任務便缺“接口”,產業落地便缺“可信鏈路”。
迫切性,正在於此。
分散的科技語料,如何形成合力
建生態,不是簡單地把機構名單拉在一起。資源如何匯聚?標准如何統一?利益如何分配?
關鍵在“任務牽引”和“機制破題”。
中國科學院文獻情報中心主任曲建升表示,聯盟將以任務為牽引,探索“共建、共享、共贏”協同模式。具體來說,就是成員以資源、能力、專業、場景四類投入參與共建。各自的資源、技術和應用需求,匯聚為聯盟公共能力。再通過開放共享和能力反哺,共享語料工具、平台服務、共建成果與發展機會。
據了解,首批50家共建單位覆蓋國家實驗室、科研院所、國家級科學數據與文獻資源機構、地方政府、人工智能企業、數據基礎設施企業、出版與知識服務機構、語料運營企業及投資機構。
生態要協同,標准必須先行。
目前已發布的五類42項科技語料標准,採用“指導層—體系層—操作層”三級架構,覆蓋數據採集、加工處理、質量評價等全生命周期。
據悉,根據計劃,標准將率先依托聯盟先行先用,再逐步上升為行業標准。
標准立起來了,語料如何流動?這就需要一個承載規則的場所。
一方面,平台負責承載。敖倉·語料社區服務平台將打通正式語料與社區語料雙軌供給共享渠道,在統一規范、統一接口下對外服務。
另一方面,期刊負責鏈接。聯盟啟動當天,Data Express in AI Corpus宣布創刊,該刊旨在聚焦人工智能語料理論創新、技術突破、應用成效,探索期刊、學術會議和語料資源平台協同發展的學術交流與資源服務生態。
標准、平台、期刊三者協同,正是回答“誰供給、誰治理、誰使用、誰受益”。
語料庫建起來,如何真正用起來
從“建起來”到“用起來”,至少還有幾道坎。
第一道坎,是開放與安全的平衡。科技語料涉及科研數據、知識產權和國家安全,既要開放共享,又要可信可控。
多位專家坦言,標准規范、專業加工、質量評價和安全流通能力仍需加強。標准中的安全防護、開放協議、服務記賬、應用成效評價能否落地,決定生態能否行穩致遠。
第二道坎,是標准與利益的協調。42項標准先行先用,再上升為行業標准,路徑清晰。但不同機構、不同平台、不同領域能否願意用、用得好?
李猛力對此有清醒判斷:協同,意味著利益必須重新分配。授權機制、激勵機制和收益分配機制是否可持續,是繞不開的考題。
第三道坎,是公共能力的反哺。成員以資源、能力、專業、場景投入共建,最終要形成公共能力並反哺成員。
孫凝暉表示,聯盟要推動科技語料資源和加工能力的基礎設施化,建設國家高質量科技語料資源的戰略保障基地、國家智能就緒語料集成服務的協同樞紐。
如果隻停留在資源匯聚,不能推動模型迭代、科研任務和產業場景驗証,生態價值就難以充分釋放。
回答這些問題,仍要回到任務和場景。
曲建升表示,下一步聯盟將重點聚焦五大任務:聯合共建高質量科技語料,推進智能就緒科技語料集成服務,深化國家科技語料基礎設施協同建設,強化標准、質量與可信治理,開展AI4S模型與應用場景聯合驗証。
的確,聯盟成立只是開始。真正的考驗,是把“生態”從願景變成機制,從機制變成能力,從能力變成科研一線看得見、用得上的支撐。(記者 崔興毅)
分享讓更多人看到
- 評論
- 關注


































第一時間為您推送權威資訊
報道全球 傳播中國
關注人民網,傳播正能量