編輯:梓文
給機器來一杯「忘情水」,這算不算機器遺忘?
機器學習經常被提及,那你有聽過機器遺忘嗎?
機器學習的目的大家都了解,它能夠幫助我們的工作提升效率。但是機器遺忘是何目的?難道是「棄學」?

現在,不僅關於機器話題的討論變得火熱,甚至出現專門為機器遺忘組織的挑戰。
近日,Google AI 宣佈聯合廣泛的學界與業界研究團隊,組織首個機器遺忘挑戰賽(Machine Unlearning Challenge)。
至於舉辦這一機器遺忘挑戰賽的目的,Google表示希望有助於推進機器遺忘的 SOTA 水平,並鼓勵開發高效、有效和合乎道德的遺忘演算法。

比賽內容都有什麼?
具體地講,該挑戰賽考慮這樣一個真實場景:其中一個年齡預測器在人臉圖像資料上進行了訓練,接著在訓練後,訓練圖像的某個子集必須被遺忘,以保護相關個人的隱私或其他權利。

摘自 Face synaesthetics 資料集的圖像以及年齡註釋。
比賽將在 Kaggle 平臺上舉辦,提交的作品將根據遺忘質量和模型實用性進行自動評分。
其中對於評估遺忘,本次挑戰賽將使用受成員推理攻擊(Membership inference attacks, MIAs)啟發的工具,如 LiRa。MIAs 最初是在隱私和安全文獻中開發,其目的是推斷哪些示例是訓練集的一部分。
直白地講,如果遺忘成功,遺忘過的模型中將不包含被遺忘示例的痕跡,這會導致 MIA 失敗,即攻擊者無法獲知被遺忘集實際上是原始訓練集的一部分。
此外,評估中還將使用統計測試來量化「遺忘模型的分佈」與從頭開始重新訓練的模型的分佈的差異程度。
相關比賽的資訊可以查閱以下兩個連結:
-
https://unlearning-challenge.github.io/
-
https://groups.google.com/g/unlearning-challenge
或許有讀者要問了,為什麼在機器學習的浪潮中,還會有這樣一股機器遺忘的「逆流」奔湧呢?
什麼是機器遺忘
機器遺忘是機器學習的一個新興領域,最終目的是消除一個訓練模型特定訓練樣本子集的影響,即消除「遺忘集」(forget set)的影響。
此外,較為理想的遺忘演算法在消除某些樣本影響的同時,還應該保留其他有益的特性,比如在其餘訓練集上的準確性以及對保留樣本的泛化性。
下圖為遺忘學習的剖析。遺忘演算法將一個預訓練模型以及要遺忘的訓練集中的一個或多個樣本作為輸入。然後基於該模型、遺忘集和保留集,遺忘演算法會生成一個更新模型。理想遺忘演算法生成的模型與沒有遺忘集參與訓練的模型沒有區別。

其實,有一個很「暴力」的方法能夠得到這種理想的模型,就是在排除遺忘集樣本後,重新訓練模型。這個「暴力」手段雖立竿見影,但並不可行,因為重新訓練深度模型的成本實在太過高昂。
因此,遺忘學習演算法應該是以訓練好的模型作為基點,並對其進行調整,來消除所要求資料帶來的影響。
機器遺忘學習不僅僅應用於保護使用者隱私,還能夠通過訓練,刪除訓練模型中不準確或者過時的資訊,甚至是異常或者有害的資料。當然,這比消除幾個指定遺忘集難度大得多,這也意味著它更有用處,比如它可以通過糾正偏見或對屬於不同群體的歧視來提高模型的公平性。

「清掃、清掃,全都扔掉」
為何要發展機器遺忘
大家都受益於網路資訊的易得性,但是往往忽略了在整個網路上刪除某一資訊的艱難。這堪比將一捧沙子撒入海里,再從不斷湧動的海水中將沙粒一個個撿起,更重要的是,這些沙粒有不斷複製的可能。
由此可見,資訊及時被刪除了也能通過各種手段有所保留。
在網路中留下的足跡,雖可能不被查詢,但印記永存。2012 歐盟委員會就曾公佈草案提出資料主體應享有「被遺忘權」。這對大資料背景下網際網路產業發展具有深遠而廣泛的影響。
更別說近期正火熱的大型語言模型,更是以海量的資料集作為基礎進行發展的。大模型對於訓練集的細節內容會進行學習和記憶,其中不乏使用者的隱私資訊,這導致可能涉及的隱私風險更加嚴峻。
因此機器學習模型中的安全和隱私問題是研究者必定面臨的挑戰。

網友表示,這場挑戰賽將推動隱私保護。
在這樣艱難、複雜的條件下,機器遺忘應運而生,有關於它的討論和學習也日益成為機器學習領域的焦點之一。
參考連結:
https://ai.googleblog.com/2023/06/announcing-first-machine-unlearning.html
https://unlearning-challenge.github.io/
