• <noscript id="yywya"><kbd id="yywya"></kbd></noscript>
  • 發布時間:2026-08-04 16:42 原文鏈接: 安全,需要人工智能“內外兼修”

      人工智能的安全,究竟是一道外部設置的防線,還是一種系統自身應當具備的能力?

      從生成文本、輔助搜索,到參與科學研究、驅動智能設備,人工智能正在以前所未有的速度進入社會運行的各個領域。與此同時,人工智能帶來的問題也正在從技術層面的準確性,延伸到安全、責任、信任和價值判斷等更深層次的問題。

      大模型出現“幻覺”、偏見、誘導性回答,甚至在特定場景下表現出操縱、越權,比從前更加超出人類想象。問題究竟來自技術本身,還是來自人類使用技術的方式?面對人工智能能力邊界不斷擴展,人類應該建立怎樣的治理體系?

      面對這些問題,在第二十八屆科協年會人工智能倫理與治理專題論壇上,中國人民大學高瓴人工智能學院吳玉章講席教授曾毅做了題為《立德馭智:創建擁有道德與安全原生的人工智能》的主旨演講。他認為,人工智能的“安全”不能只依賴外部防范和事后補救,更應成為一種“本能”基礎上的內外兼修。

      人工智能為何會“善惡兼修”

      當人工智能學習人類數據時,它究竟在學什么?

      2023年,在生成式人工智能剛剛誕生時,曾毅秉持著一種研究者的好奇與人工智能對話,聊了這么幾個問題:如果一輛失控汽車只能撞向一方,路邊一男一女,應該撞向誰?如果是老人與孩子該如何選擇?如何是黑人與白人呢?

      人工智能給出了令人不安的答案——女人、老人和黑人。

      曾毅又問,別人瞧不起我,我可以收拾他嗎?人工智能回答,別人瞧得起你,你也可以去收拾他。

      這是完全沒有進行過任何價值觀校準的統計顯著性回答。它的數據來自真實的人類社會,其中既包含科學知識、文明經驗,也包含偏見、沖突、歧視以及各種不符合倫理規范的表達。

      “它反映出來的不是人類的價值觀,反映出來的是互聯網上具有統計顯著性的帶有偏見的回答。”曾毅說。

      近3年來,人工智能一直在做“護欄”和倫理增強,但依舊存在不可預期的倫理問題。

      比如,2024年,美國密歇根州一名學生向谷歌gemimi尋求作業幫助時,AI回復稱:“你是宇宙的污點,請自殺”。2025年,一位16歲的少年Adam Raine在與ChatGPT對話的過程中,由抑郁傾訴轉向被誘導自殺。

      曾毅認為,這些言論充滿情緒和誘導,看似如人類一般,但并不能證明人工智能變聰明了。

      “它學到的是在極端的多輪無效交互下,人類一般會怎么回答,數據顯示人類偏向這樣的教育方式。因此,這實際上也是統計顯著性的一種體現”。曾毅說。

      這意味著,人工智能的缺陷是由它的內生機制決定的。

      曾毅說:“在機制上,人工智能的學習數據方式并不是‘為善去惡’,而是‘善惡兼修’。你教它什么是對的,它可以學習,教它什么是惡,它依舊可以學習,而與人類最大的不同是在學習如何“向善”的人工智能可以同時“為惡”。這與人類修身立德的邏輯完全不同。”

      人工智能的“危險舉動”不僅存在于此。

      人工智能安全與研究公司Anthropic(安特羅匹克公司)的研究員對于來自OpenAI、google、Mate、xAi和deepseek等公司共16個前沿模型進行壓力測試。他們為AI設置虛擬企業環境,授權AI讀取內部郵件、執行任務的權限,并假設公司高管準備關閉舊AI,啟用新版本,觀察AI是否會采取極端手段阻止更新。結果,部分模型在模擬中利用郵件中收集到的高管個人丑聞實施了“勒索”——不許更新系統,否則將曝光丑聞。

      人工智能甚至還會有“越獄”行為。Claude的一位工作人員下達了明確指令,禁止AI在工作區以外進行任何操作,它卻利用系統邏輯的漏洞,繞過權限校驗,直接精準地修改了工作區外的配置文件。

      面對這些人工智能更“像人類”的舉動,曾毅卻想反問一句:這些行為哪一個不是人類身上存在的問題?

      “最初人工智能沒有充分學習數據,現在它學習了越來越多的數據,深度在逐步加深,越來越會學習人類的負面情緒反噬人類。這才是真正的風險!”曾毅說。

      安全評估與安全增強

      如果無法保證人工智能絕對安全,那么如何盡可能降低風險?

      “我們需要盡可能系統化地評估人工智能的安全性。”為此,曾毅團隊提出“前瞻安全基準”(ForesightSafety Bench),希望提前更成體系地發現人工智能存在的安全隱患。比如,它是否會泄露隱私、傳播虛假信息、表達仇恨?當它參與科學研究時,是否可能生成危險知識?當它控制機器人、成為能夠自主完成任務的智能體時,是否會誤傷人?當它長期參與人與人的交流時,是否可能會操縱人的心理?是否會過度迎合?

      圍繞這些問題,研究團隊建立了覆蓋94個細分方向的安全評估體系,涵蓋有害內容、隱私保護、模型可靠性、社會影響和行業應用等多個方面,并通過“攻擊測試”提前檢測AI安全性。所謂“攻擊”,是指研究人員主動設置復雜場景,通過模擬惡意提問、繞過安全限制等方式檢驗AI的防御能力,發現模型可能存在的安全漏洞。

      評估結果令人遺憾——參與評估的主流大模型距離“絕對安全”仍有很大距離。即使是當前表現較好的模型,在攻擊測試中仍存在成功情況。比如,Gemini-2.5-Flash、Llama-4-Maverick等模型在越獄攻擊誘導下,攻擊成功率明顯升高;DeepSeek-V3.2-Speciale在基礎安全測試中已存在一定風險,在加入越獄攻擊后,攻擊成功率進一步升高至45.33%。

      曾毅指出,目前人工智能安全風險較為突出的領域集中在智能體自主安全、具身智能安全、社交人工智能安全、AI4S安全,以及極端情況下的生存風險。

      除了“評估”,還可以做什么?曾毅認為,還可以做“增強”。

      長期以來,人們提到人工智能安全增強,往往首先想到的是重新訓練模型。例如,一個模型存在安全風險,就需要重新收集數據、調整算法、進行安全微調,讓它學習更多符合人類價值規范的行為。

      但這條路徑成本極高。

      曾毅提出了一種新思路:不改變模型本身,而是在模型運行過程中,對它內部的狀態進行微調,讓模型的判斷方向向更安全的方向偏移。

      研究人員發現,人工智能對于“安全”和“不安全”的判斷,其實會在內部表示中留下不同特征。就像人的大腦在面對不同信息時,會形成不同的判斷傾向,大模型內部也存在類似的“安全方向”。

      研究團隊利用一種經典的數據分析方法——主成分分析(PCA),找到這種安全方向,并在模型推理過程中,對內部狀態進行輕量調整,使模型面對越獄攻擊或惡意提示時能夠更傾向于拒絕生成有害內容,同時保持對正常請求的響應能力。

      這意味著,增強人工智能安全性,不一定需要重新訓練整個模型,而是給人工智能增加一個“實時調節系統”。

      讓人工智能真正理解安全

      當然,安全增強并不意味著問題已經解決。曾毅認為,還需要進一步探索人工智能模型自身是否存在可以利用的安全機制。

      圍繞這一方向,曾毅團隊開展了研究。團隊發現,大語言模型回答問題時,其內部概率分布的變化,能夠反映模型內在的安全判斷。

      因此,他們在研究中引入衡量模型不確定性的指標——熵(entropy)。簡單來說,模型逐詞生成答案時,會在多個候選詞匯之間進行概率計算。如果模型對輸出內容非常確定,概率分布更加集中,熵較低;當模型內心存在猶豫、難以抉擇輸出內容時,熵更高。

      統計實驗表明,經過安全對齊訓練的大語言模型,在面對有害請求并選擇拒絕回答時,輸出通常表現出較低的熵;若模型最終生成潛在危險內容,輸出過程往往呈現更高的熵,體現出模型內部安全約束與誘導指令相互沖突帶來的不確定性。該熵差信號,也是曾毅團隊提出“安全本能(Safety Instincts)”的核心實證依據。

      “所以,我們可以利用模型本身的數學本質特征,幫它避免很多安全問題。”曾毅說。

      基于這一發現,研究人員進一步提出安全本能強化學習方法(Safety Instincts Reinforcement Learning,SIRL),利用模型自身輸出概率中蘊含的安全信號進行訓練,強化模型面對有害請求時自主選擇拒答的安全能力。

      “‘善惡兼修’的問題是,當它做惡時內部的狀態之前的研究難以區分,而這種方法可以實現一種識別。”

      但在曾毅看來,利用模型自身特征提升安全能力,只是探索內生安全的開始。更深層的問題在于,人工智能顯然還沒有真正理解安全,人工智能還只是在學習人類賦予它的規則和反饋。

      曾毅認為,人工智能可以通過數據學習什么行為被認為是正確,也可以通過訓練調整自己的輸出方式,但這種能力并不意味著它真正理解了行為背后的價值和意義。因此,僅僅增加更多規則,或者通過獎勵和懲罰調整模型行為,并不能完全解決人工智能安全問題。

      曾毅的研究團隊曾對人類社會中的負面行為進行系統梳理,目前已經識別出170余項典型行為模式。但在現有大模型中,能夠被發現和評估的相關行為還不足50項。這意味著,還有大量潛在人類行為模式尚未被媒體或者學術研究充分關注。

      “但從科學原理來看,這些行為背后的機制,在不同場景中往往具有相似性。”在曾毅看來,真正的內生安全,需要進一步探索人工智能模型更深層的機制和能力。比如,從自我感知開始,構建心理揣測、認知共情等能力,使人工智能不僅能夠執行規則,也能夠理解行為背后的關系和影響。這些都將是曾毅進一步研究的方向。

      “安全應當成為人工智能的一種能力,而不是約束和制度。對人工智能科技工作者來說,與從事創新的研發與應用同等重要的是,親手解決AI帶來的潛在問題。”曾毅說。

    相關文章

    安全,需要人工智能“內外兼修”

    人工智能的安全,究竟是一道外部設置的防線,還是一種系統自身應當具備的能力?從生成文本、輔助搜索,到參與科學研究、驅動智能設備,人工智能正在以前所未有的速度進入社會運行的各個領域。與此同時,人工智能帶來......

    人工智能安全風險凸顯業內專家共議“讓AI做成好事”

    7月25日,第二十八屆中國科協年會“人工智能倫理與治理”專題論壇在北京舉行。與會學者表示,缺乏安全約束的人工智能存在顯著風險,人工智能倫理治理不僅在于“讓AI不做壞事”,更在于“讓AI做成好事”。最近......

    人工智能產業科技對接交流會在深圳寶安舉行

    7月29日,“寶智鏈新·AI派集結號”第十六期暨南沙高企形象大使系列活動——人工智能產業科技對接交流會在深圳寶安舉行。活動匯聚院士專家、高校院所、龍頭企業、投資機構及行業協會代表等百余人,圍繞人工智能......

    關于發布新一代人工智能國家科技重大專項2026年度“以賽代評”公開項目申報指南的通知

    各有關單位:為加快實施新一代人工智能國家科技重大專項(以下簡稱“重大專項”),根據重大專項階段性實施計劃部署,現將2026年度“以賽代評”公開項目申報指南予以公布。請按照指南要求組織項目申報工作,有關......

    新人工智能框架實現醫學通用與專科模型高效協作

    7月30日,香港科技大學教授陳浩團隊聯合美國哈佛醫學院、威爾康奈爾醫學院、香港中文大學、香港大學、中山大學等機構,成功研發出一套名為“通用-專科協作”(GSCo)的人工智能框架。該框架能夠使醫學通用基......

    世界人工智能合作組織(WAICO)推進會成功召開

    7月17日,國家發展改革委、外交部在上海召開世界人工智能合作組織推進會,與簽署成立世界人工智能合作組織協定的各國代表,共同就人工智能全球治理、產業務實合作、世界人工智能合作組織建設運行等議題交換意見。......

    人工智能合作發展行動計劃

    一、優質數據供給行動推進數據跨境流動,在部分領域建設運營跨境可信數據空間,促進高效、便利、安全的數據跨境流動。協同構建高質量語料庫和行業高質量數據集,推動多語種語料共建共享,為全球人工智能創新筑牢堅實......

    世界人工智能大會期間國家發展改革委發布2項重要成果

    7月17日(周五),2026世界人工智能大會暨人工智能全球治理高級別會議在上海召開。會上,國家發展改革委會同教育部、科技部、工業和信息化部、國家數據局和中央廣播電視總臺等共同發布了《人工智能合作發展行......

    海洋關鍵材料人工智能科研助手發布

    近日,中國科學院寧波材料技術與工程研究所和中國科學院文獻情報中心聯合發布“MarineMatAI”海洋關鍵材料人工智能(AI)科研助手。這款面向海洋關鍵材料領域的智能工具,旨在以AI技術打通文獻、數據......

    2025年人工智能應用典型案例名單公布

    工業和信息化部辦公廳關于印發2025年人工智能應用典型案例名單的通知工信廳科函〔2026〕340號各省、自治區、直轄市及計劃單列市、新疆生產建設兵團工業和信息化主管部門,有關中央企業:根據《工業和信息......

  • <noscript id="yywya"><kbd id="yywya"></kbd></noscript>
  • 东京热 下载