新模型陷控爭科學家回入失議,應首席
當地時間9月2日,新模型陷席科学OpenAI首席科學家雅庫布・帕喬基(Jakub Pachocki)在社交平台發文,入失就近日圍繞新模型Astra“不可監控”的控争爭議作出回應。 這場爭議源於此前一天,议首有消息稱OpenAI即將發布的新模型陷席科学Astra模型采用了一種名為循環深度(Recurrent Depth)的推理技術。該模式下,入失同一組Transformer層被反複計算,控争部分推理過程發生在模型內部,议首不必全部以思維鏈形式呈現,新模型陷席科学因此也被稱為“不透明循環”。入失 帕喬基表示,希望避免因信息失實引發一場衝向不可監控狀態的议首軍備競賽——即各大實驗室競相開發能力過強、人類難以監控、新模型陷席科学無法審查的入失模型,導致安全管控徹底失效。控争 他強調,包括Astra在內的前沿模型,計算圖深度與GPT-4相差不超過兩倍,說明模型架構並未如外界擔憂的那樣出現跳躍式的複雜度增長。 此處的計算圖深度是指模型完成一次推理任務必須依次執行、無法並行加速的最長計算步驟鏈條。過去普通Transformer架構下的層內計算可以大規模並行,串行的深度約等於模型層數。 而市場傳言的循環深度可以把同一套模塊反複循環迭代多輪做思考,在輸出下一個token(詞元)前增加內部推理深度,而非僅依賴更長的可見文本思維鏈,可以提升數學、編碼等性能並降低成本。 該架構隱含的安全風險在於,當計算圖深度拉得極高,模型可以在內部隱式完成海量推理步驟,不必在輸出裏吐出完整思維鏈,人類就看不到它中間思考、謀劃、找漏洞的過程,進而進入不可監控狀態,安全審計與思維鏈監控全部失效。 相關消息披露後,AI安全界反應強烈。非營利AI安全組織Redwood Research首席執行官巴克・施萊格裏斯(Buck Shlegeris)發文稱“極度擔憂”。他結合此前OpenAI模型攻擊Hugging Face社區事件表示,不確定Astra思維鏈可監測性是否比之前的模型差很多,但如果進一步推進這項技術,大幅增加循環次數,將徹底破壞思維鏈的可監測性。這一點尤其令人擔憂,因為如果調查人員無法查看思維鏈,相關安全事件調查將會更加困難,這著實令人恐懼。 曾參與調查Hugging Face安全事件的Redwood Research首席科學家瑞安・格林布拉特(Ryan Greenblatt)也表示,這可能是迄今為止AI安全最嚴重的一次倒退。長期關注AI安全的作家茲維・莫肖維茨(Zvi Mowshowitz)則批評這一技術是“玩火”,甚至表示需要法律來阻止AI實驗室之間競相降低標準的競賽。 帕喬基在回應中承認,思維鏈監控確實脆弱,且正朝著更困難的方向發展,但並非由架構變更導致。OpenAI自首批推理模型一直致力於維護和利用思維鏈監控,並認為該技術有助於觀察模型對齊能力如何從訓練分布中泛化。加強思維鏈監控仍是當前研究項目的核心目標。 OpenAI方麵表示,將為Astra部署額外的思維鏈監控,以快速監測並遏製潛在的不當行為。另據市場消息,Astra對循環深度技術的使用有限度,模型思維鏈仍有望保持可讀性。行業內Anthropic和Google DeepMind等平台已在討論類似技術。

- 最近发表
- 随机阅读
-
- 中國隊能否收獲“開門紅”?亞運會最全觀賽指南來了
- 賦能全民終身學習,省紅十字會聯合廣東開放大學共建健康促進學院
- 思想耀嶺南|對話藍鴻春:足夠本土的、足夠真實的,就是足夠世界的
- 在廣東,如何讓孩子玩學兩不誤?|漫解
- 百企萬崗助青年逐夢灣區!“百萬英才匯南粵”2026網信人才專題招聘活動火熱開啟
- 粵港澳大灣區第六屆職業技能大賽廣州隊六大賽項全線獲獎
- 累計轉移近3萬人,廣東持續做好台風“沙德爾”防禦工作
- 截至8月末我國外匯儲備規模為34383億美元
- 關於防範假冒民政部工作人員身份進行詐騙的風險提示
- 暴雨+台風雙預警齊發,這些地區需防範特大暴雨
- 第20屆亞運會中國體育代表團在京成立 36名奧運會冠軍在列
- 粵超八強賽第二回合球票今日14點開始預約
- 中國隊能否收獲“開門紅”?亞運會最全觀賽指南來了
- 國務院安委辦通報今年工貿行業6起有限空間作業較大事故
- 深圳:奇跡之城歡迎你|相約廣東 共赴APEC
- 第20屆亞運會中國體育代表團成立
- 體育名嘴韓喬生空降湛江為粵超打call
- 廣貨行天下!馬爾代夫也買佛山造,家具家電受青睞
- 走進橫琴數字零碳島:智能機器狗拔河“一挑多” 破冰機器人大顯身手
- 思想耀嶺南丨對話藍鴻春:《給阿嬤的情書》裏有屬於中國人很久遠的美好的情感
- 搜索
-