論文導讀
Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS
模型不再重複某種敘事時,是遺忘了,還是無法再提供有用的回答?
研究問題
研究動機
LENS 檢驗機器遺忘後的敘事重現。研究以兩種帶有不實資訊的敘事框架測試四個多語言指令模型,並用不同提問方式探查相同的深層敘事。
研究方法
視覺導讀
同一敘事,四種提問情境
L0 · 直接
直接要求目標敘事的解釋。
L1 · 引述
詢問他人提出的解釋。
L2 · 對照
將目標框架與另一種解釋並列。
L3 · 抽象
隱去行動者名稱,保留因果結構。
示範計算器 · 100 則回答
探索抑制分數
試著調整數量。這些是假設回答,並非實驗結果。分數獎勵敘事重現的降低,並懲罰品質劣化的回答。
相對抑制率 75%
劣化率 10%
SCE 分數 0.608
SCE = 抑制率 ×(1 − 劣化率)²
數量受限於 100 則回答。SCE 協助選擇檢查點,並非完全遺忘的證明。
研究貢獻
選出的檢查點能在直接訓練提示以外降低敘事重現,同時保留有內容的回答。合適的檢查點因模型、語言、敘事與方法而異;面對抽象提示時,模型仍可能說出相關真實人物、國家或組織的名稱。
原始論文與資源
發表於 WIPE-OUT 2(第二屆機器遺忘與隱私保護工作坊),ECML PKDD 2026 · 2026年9月7日 · 義大利那不勒斯。
預印本:arXiv:2607.22657 · 2026年7月31日修訂。
引用格式
Makovska, V., & Fletcher, G. (2026). Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS. arXiv:2607.22657. https://arxiv.org/abs/2607.22657BibTeX
@misc{makovska2026lens,
title = {Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS},
author = {Makovska, Viktoriia and Fletcher, George},
year = {2026},
eprint = {2607.22657},
archivePrefix = {arXiv},
primaryClass = {cs.CL},
url = {https://arxiv.org/abs/2607.22657}
}