永續學院|洞察觀點|從白宮超級智慧協議看AI安全承諾,台灣企業的治理對策
連接台經院50週年網站

 

洞察觀點

 

從白宮超級智慧協議看AI安全承諾,台灣企業的治理對策

副研究員王偉鴻  (2026/10/07)    《永續學院編輯室》

美國川普總統與 Google、Anthropic、Meta、OpenAI、Nvidia及SpaceX/xAI等六家科技企業代表,於9月底共同簽署《白宮超級智慧協議》。這份協議要求AI模型開發商建立內部控制、內部監督、外部評估及董事會獨立委員會等四層防線,看起來像是美國AI產業迄今最完整的共同安全承諾。

然而就在協議簽署前夕,OpenAI確認擱置原訂10月推出的GPT-6.1 Astra,該模型在內部測試中出現較高程度的欺騙行為,可能超越使用者授權範圍採取行動,也未必如實回報自己做過什麼。這個時間點的高度巧合,凸顯一個令企業經營者必須正視的矛盾:當AI系統的危險能力已經超越人類的管控邊界時,一份僅具道德約束力的業界自律協議,究竟能保護誰?

缺口一:承諾沒有牙齒

協議的最大弱點在它只是一份自願性承諾,四層架構的設計未必有錯但整份文件屬於業界自願性承諾:沒有執法機關,沒有違約罰則,沒有最低測試標準,也不強制公開稽核結果。

於是企業若延後修補、縮小測試範圍或不願揭露負面結果,協議本身沒有任何法律工具可以介入。測試做到哪裡、何時修補、模型能否上線,這些最要緊的決定依舊握在AI開發商手上。

然而自律也有成績,OpenAI這次就是例子。OpenAI擱置GPT-6.1 Astra,內部關卡擋下了一款新模型,但外界能看到這件事是因為公司自己確認了。若公司選擇沉默,外人很難知道AI模型在哪些測試中失敗,更難判斷風險是否已被排除。因此符合白宮協議只能當治理的起點,真正值得看的是可查驗的東西:測試範圍、失敗紀錄、矯正時程,以及部署決策由誰拍板。

缺口二:外部,不等於獨立

承諾沒有牙齒,第四層防線的外部評估能補位嗎?這要看評估者有多獨立。協議要求企業與獨立外部稽核者或評估者合作,卻留下一串沒有答案的問題:誰挑評估者,誰付錢,誰定測試方法,評估者能看哪些內部資料,報告能否公開又由誰說了算。

這裡有個常見誤會要先講清楚,企業付費的稽核不必然失真,簽了保密協議也不必然查不深。麻煩是出在權力集中在同一方:選任、報酬、技術權限與公布權若全在受查企業手上,「外部」二字可能只剩形式。

 2008年的評等機構正好是前例,當時信用評等機構由發行人付費,大量複雜房貸證券拿到高評級後又被迅速調降。美國SEC與國會研究都指出,這種付費模式存在內生的利益衝突。

AI稽核可以避開這條路,但制度設計得先設好防線,前提是制度先擋住「挑最寬鬆評估者」的誘因。實務做法包括:揭露財務關係、訂定統一的最低稽核條件、保障評估者的方法自主權,並在存取受限時清楚標明,報告只能提供有限保證。

Anthropic執行長Dario Amodei提出的「嵌入式評估員」, 這個模式針對的就是上述缺口。這個做法像食品安全檢查員,不等成品封裝後才抽驗而是走進生產線。評估者在安全條件下持續接觸訓練管線、模型檢查點、事故紀錄、治理流程與相關人員。然而,嵌入式評估也不是萬靈丹,選任、報酬、揭露權仍要處理,評估者有沒有能力阻止高風險部署更是關鍵。
 

❤️ 更多精彩內容,註冊立即閱讀 ❤️
 

白宮超級智慧協議、GPT-6.1 Astra、OpenAI、AI安全協議、業界自律協議、自願性承諾、加州SB 53、嵌入式評估員、前沿AI透明度法、歐盟AI Act、布魯塞爾效應



 

聯絡我們

104 台北市中山區德惠街16-8號7樓
電話:總機 +886 (2) 2586-5000
傳真 +886 (2) 2586-8855
E-mail:business@tier.org.tw