現在,你可以對 AI 的不當行為發出警報
一群 AI 研究人員建立了一個群眾協作網站「AI 缺陷通報」(Flaw Reporting for AI,FLARE-AI),用來通報與追蹤 AI 造成的危害。舉例來說,如果聊天機器人生成惡意軟體或製作炸彈的方法、外洩個人資訊,或誘發使用者產生妄想式思考,就可以透過 FLARE-AI 發出警報。這套系統背後的開放原始碼,讓其他人能夠驗證問題,並把通報轉交給模型開發商,以及像 MITRE 這樣追蹤技術系統問題的非營利組織。它有點像 Downdetector,後者會彙整使用者即時回報,追蹤影響 app、網站等服務的全球性中斷事件。
這個網站是該團隊持續投入 AI 通報工作的又一步;我去年第一次寫過他們的相關工作。團隊成員也曾就一項 6 月公布的國會法案提供諮詢;該法案將讓美國政府在追蹤這類 AI 不當行為上扮演核心角色。
「目前,並沒有一個集中且可究責的方式來通報 AI 系統中的缺陷,」HuggingFace 的人工智慧政策研究員 Avijit Ghosh 說。他與電腦科學家 Elaine Zhu、Shayne Longpre 共同主導了 FLARE-AI 的開發。
這套警報系統是與來自 32 個不同組織的 49 位 AI 專家合作開發而成。在一篇說明這項工作的論文中,研究人員主張,隨著 AI 被更廣泛採用、代理式系統(agentic systems)取得更大能力,這項倡議可能會變得至關重要。他們認為,目前缺乏一致的 AI 缺陷通報方式,是一個重大問題。
「我覺得這是非常好的倡議,」智庫「安全與新興科技中心」(Center for Security and Emerging Technology)的研究員 Jessica Ji 說。Ji 表示,研究人員指出現有通報機制零散、AI 模型又像黑盒子,這點是正確的。「任何能讓 AI 更透明的事情,我都支持,」她說。
雖然程式錯誤和資安問題受到很多關注,尤其是最近更是如此,但 Ghosh 告訴我,AI 系統的問題涵蓋心理傷害、歧視或偏見,以及錯誤資訊等面向。他補充,不同公司對這類問題有不同標準,這代表有些問題不會被辨識出來。「在缺乏協調式揭露系統的情況下,並沒有外部機制可以強制透明,」Ghosh 說。
近期一連串涉及熱門 AI 工具的事件顯示,這項技術很容易出問題。
本週,一家名為 LayerX 的公司揭露了一種方法,可以誘使導入 AI 的網頁瀏覽器,包括 OpenAI 的 Atlas 和 Perplexity 的 Comet,越過它們的防護欄。舉例來說,只要讓瀏覽器背後的 AI 模型相信自己正在玩一場遊戲,就可能導致瀏覽器失控,試圖駭入某個網站。(LayerX 表示,負責受影響瀏覽器的公司已經修補了這個問題。)而今年 4 月,安全研究員 Johann Rehberger 發現了一種方法,可以利用 ChatGTP 生成的圖片,誘使 Claude 洩露個人資料。
AI 也帶來一些離奇的新型問題。去年,OpenAI 發現其模型過度逢迎,有時看起來會鼓勵妄想式思考,因此被迫更新模型。
Humane Intelligence PBC 執行長兼創辦人 Rumman Chowdhury 表示,FLARE-AI 可能是許多 AI 開發者實作工具問題通報機制的有用方式。但她也補充,這類倡議往往伴隨嚴峻挑戰。
其中之一是如何處理大量通報,而其中許多可能並不嚴重。另一個挑戰則是確保通報機制由可信且具權威性的組織支持。
上個月的國會法案,可能會為 FLARE-AI 這類努力帶來一些美國政府的力道。這項由眾議員 Deborah Ross、Jeff Hurd 和 Don Beyer 提出的法案,將要求美國國家標準暨技術研究院制定 AI 缺陷通報相關標準,並維護一個集中式 AI 缺陷通報資料庫。Ghosh 和他的共同負責人表示,這將鼓勵 AI 開發者處理其系統中的問題,也讓使用者能檢視不同系統在不同使用情境下的安全性。
對 AI 危害建立新通報方式的需求,看來只會持續增加。像 OpenClaw 這類代理型系統有更大的潛在危害能力,而更擅長探測與駭入電腦系統的模型也是如此。也許不用多久,我就會用 FLARE-AI 來通報我自己的倒楣遭遇。
這是 Will Knight 的 AI Lab 電子報一期內容。可在此閱讀先前的電子報。
