• <noscript id="yywya"><kbd id="yywya"></kbd></noscript>
  • 發布時間:2025-12-11 18:02 原文鏈接: 通用智能體落地,如何破解“實習生困境”

      日前,由中國互聯網協會主辦的2025“人工智能+”產業生態大會在北京中關村舉辦。會上,銜遠科技首席技術官張開顏在分享中談到,當前企業在落地通用智能體過程中面臨著“實習生困境”:“10分鐘就能做出一個驚艷的演示案例(Demo),但落地卻數以月計,且困難重重。”

      如何跨越通用智能體的實習生困境?以下為張開顏對此的相關分享。

    image.png

      張開顏。銜遠科技供圖

      通用智能體的“實習生困境”

      從ChatGPT發布,到今年各類大模型層出不窮,搭建一個智能體Demo變得前所未有的簡單。10分鐘,我們就能做出一個驚艷的演示(Demo),但落地卻數以月計,且困難重重。

      我們發現,解決行業長尾問題的邊際成本,正在呈指數級上升。目前的通用智能體,就像是一個名校畢業的“高智商實習生”——

      基礎模型的預訓練賦予了其博學的知識,數學和代碼的強化學習帶來了極強的邏輯推理,但在垂直領域的實際應用中,依然“眼高手低”。

      根本原因在于:基礎模型被“困”在了數學、代碼和通用的文本環境中。它們從海量預訓練語料中學會了專家的“臺詞”,卻不懂業務背后的“邏輯與因果”。它們缺乏在真實業務環境中的經驗學習,這也是目前通用基礎模型面臨的最大天花板。

      “通專融合”的技術路徑

      一段時間以來,通過多個階段的規模法則(Scaling Law),大模型的通用泛化能力確實在顯著提升,但專業性依然不足。反觀歷史上達到專家級別的專業AI,無一不是在特定的專業場景中進行了海量的自我博弈與強化學習。當然,過去這種成本是極高的。

      對此,上海人工智能實驗室主任、銜遠科技創始人周伯文,早在三年前就預判了這一瓶頸,并提出了“通專融合”的技術路徑。

      這一路徑包含三個層次。首先是基礎模型層,需要全新的模型架構設計,實現“知識”與“推理”的解耦。

      然而對于應用層創業公司來說,我們更關注接下來的第二、第三層。

      第二層是“融合協同層”,我們需要實現通用模型與專業知識、專業工具的深度協同推理。第三層是“探索進化層”,這是最關鍵的一層——大模型必須在環境中進行交互,通過探索和反饋不斷提升專業能力。通過在大量專業環境中的經驗學習,最終反哺通用能力的提升。

      AI的下半場:“經驗學習”

      事實上,今年以來“通專融合”已不再只是我們的預測,而是正在成為國際行業的共識。

      2024年諾貝爾化學獎得主、DeepMind創始人戴密斯·哈薩比斯在今年5月就明確表示,DeepMind目前的重心全在“通用+專業”的結合上。而“強化學習之父”理查德·薩頓在今年4月說得更直接:AI 發展的“上半場”是從人類標注數據中學習知識,而下半場則是“經驗學習”。

      對于智能體應用而言,現在的關鍵點,已經從模型架構和訓練算法,轉移到了現實世界的任務定義與評估體系重構。只有這樣,才能支持專家智能體的能力進化。

      對于上述問題,我們給出的解法便是“銜遠大觀”。它不是一個簡單的智能體編排工具,而是一個進化引擎。

      它的邏輯可以用這樣一個公式來表達:

      專家能力=(基礎模型×仿真環境)強化學習

      在這里,通用模型只提供“底座智力”,我們真正的壁壘,在于中間這一項——“環境”。沒有環境,強化學習就沒有獎勵信號 (Reward),模型就無法進化。 換句話說,我們不只是在寫提示詞(Prompt),而是在構建一個能讓智能體“摔跟頭”的虛擬世界。

      更進一步,我們發現了一個有趣的現象:當不同智能體的訓練環境疊加時,跨領域任務的強化學習不僅不會降低效率,反而能通過遷移學習,極大地促進專業能力的提升。而這,正是通專融合的根本價值所在。

      讓智能體“摔跟頭”的虛擬世界如何構建

      如何構建一個能讓智能體“摔跟頭”的虛擬世界?我們通過自研“銜遠大觀”,探索出三大技術內核。

      第一,是智能體的“模擬訓練場”。不僅要提供一個靜態的“考場”,還要賦予其動態的“宇宙”。其中的考量是,如果完全依賴真實歷史數據,我們永遠無法覆蓋那些罕見但致命的“黑天鵝”場景。

      因此,我們利用程序化規則,合成出海量的、現實中極少發生的邊緣案例。為了解決外部工具調用不穩定的問題,我們引入了生成式世界模型(World Model)來模擬環境反饋。

      更重要的是,這個環境具備“課程學習”(Curriculum Learning)能力。就像游戲設計一樣,它會根據AI當前的水平,自適應地調整難度。AI只有通關了“簡單模式”,才能進入“困難模式”。

      第二,是“接近專家水準的反饋機制”,也就是自適應獎勵。

      傳統的強化學習往往只提供最終結果,這對于長鏈條的復雜任務來說,信號過于稀疏。就像學高數,老師只告訴你期末掛科了,卻不說錯哪一步,你永遠學不會。

      在“大觀”里,我們引入了“過程獎勵”。對于數學、物理等精確的專業領域,我們采用類似DeepSeek R1的思路,將指標映射為可驗證的規則獎勵。而對于復雜的物理世界,我們用動力學公式進行程序化驗證。

      甚至,我們賦予了AI“好奇心”。我們團隊今年和清華大學首次提出了測試時強化學習算法(TTRL),引入基于自我一致性的“內在獎勵”機制。這項工作剛剛被AI頂會NeurIPS收錄。

      第三,是讓學習更經濟的“高效強化學習引擎”。

      訓練專家級AI非常消耗資源,不能只靠蠻力計算。我們利用強化學習稀疏獎勵的特性,通過“低秩適應”(LoRA)只更新極少量參數,在保證性能同時能夠實現高效訓練。而在面對復雜的多階段任務時,我們采用多智能體強化學習(MARL),平衡不同模型的專業能力和推理成本。

      即使面對無法改動參數的閉源模型,我們也能通過上下文強化學習(In-Context RL),優化它的記憶經驗庫,讓它在對話流中變得越來越聰明。

      總結一下,高保真的環境、專家級的密集反饋、高效的進化引擎,這就是“銜遠大觀”這臺“數字風洞”的內部運作機制。

      從智能體進化平臺到企業智能涌現平臺

      基于銜遠大觀的進化能力,我們進一步系統構建了三層平臺:底層的數據管理、中間的進化引擎、上層的專家智能體管理。

      在應用層,我們將智能體分為兩類:一類是指揮規劃智能體(CIP),是在作戰指揮室進行決策的“諸葛亮”;一類是協同執行智能體(Syngents),是在戰場上執行任務的“趙子龍”。

      以前企業買AI是買軟件,現在是買“數字員工”。我們的平臺,實際上就是這些數字員工的“入職培訓中心”和“終身學習中心”。

      基于這套平臺,我們已經構建了多個行業的專家級智能體。比如,在生物信息行業,我們與國家蛋白質科學中心合作構建的智能體,能提出新的科學假設,并自動進行蛋白質組學數據分析。實測顯示,其分析速度比人工快10倍,且約有25~30%的自動生成假設,達到了研究生水平的原創性與合理性。

      在建筑行業,我們與某頭部央企合作構建了“計劃編制智能體”。它既能從“經驗驅動”到“模型驅動”,實現智能計劃編制;又能從“事后補救”到“事前預見”,實現智能風險預警。相比人工,計劃編制時間節省70%,工期延誤全面受控,并為某中型企業降本3300萬元。我們還為供應鏈領域行業頭部企業構建了“國際物流多式聯運路徑規劃智能體”,它結合大模型對多源路況的實時感知,以及運籌學求解器的最佳路徑計算,將應急物流規劃的時間從幾小時縮短到了幾分鐘。

      數據終將耗盡,但環境可以無限生成數據。我們堅信,高質量的智能體環境,將是2026年最稀缺的資產。我們也希望與各行各業的專家攜手合作,將各領域深厚的行業“know-how”,轉化為智能體的訓練場,一起構建真正專家級別的智能體。


  • <noscript id="yywya"><kbd id="yywya"></kbd></noscript>
  • 东京热 下载