Aivora
arXiv大型語言模型專業

EngramEdit:透過條件記憶體實現大型語言模型的解耦知識編輯

EngramEdit: Decoupled Knowledge Updates in LLMs through Conditional Memory

2 分鐘閱讀
EngramEdit:透過條件記憶體實現大型語言模型的解耦知識編輯
30 秒看懂

傳統的 LLM 知識編輯常面臨模型參數調整困難或副作用大的問題。EngramEdit 針對具備「條件記憶體」的模型,提出了解耦的知識更新方案。它先計算能讓模型正確預測新事實的目標記憶體表示,再聯合更新共享的 n-gram 嵌入向量。為了避免損害其他知識,EngramEdit 會對頻繁重複使用的嵌入向量施加更強的更新懲罰。實驗證實,此方法達成了近乎完美的編輯成功率,並能流暢應用於思維鏈(CoT)多步推理,同時完整保留模型原有的通用能力。

核心重點

01

解耦知識編輯

透過更新條件記憶體的 n-gram 嵌入向量來修改知識,完全無需更動固定的 Transformer 骨幹網路。

02

目標導向優化

先計算出能讓多種表達方式皆正確預測新知識的目標記憶體表示,再進行嵌入向量的聯合優化。

03

防止副作用

針對高頻率被重複使用的嵌入向量施加更強的更新懲罰,有效避免對無關知識與通用能力造成破壞。

04

多步推理優勢

編輯後的知識可泛化至未見過的表達,且在思維鏈(CoT)推理中的準確度高達最強基準線的近三倍。

技術圖解

EngramEdit 知識編輯流程與機制
啟動更新對齊目標約束保護寫入記憶體生成回答輸入查詢與表達高頻嵌入懲罰計算目標記憶體優化 N-gram 嵌入固定骨幹網路精確預測輸出

為什麼重要

隨著大語言模型在特定領域或即時資訊更新的需求增加,傳統的微調或外部 RAG 往往存在成本高昂或幻覺問題。EngramEdit 證明了「條件記憶體」不僅能用於模型擴展(Scaling),更能作為一個「可編輯的知識介面」。這種將知識儲存與通用計算解耦的架構,為未來打造能低成本、零副作用、即時更新知識的終身學習模型奠定了重要基礎。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 產品經理

可以怎麼使用

  1. 1條件記憶體架構模型之即時事實與常識更新
  2. 2直接修正 LLM 內部陳舊嵌入向量以緩解事實幻覺

限制與注意事項

  • 僅適用於具備條件記憶體(如 DeepSeek Engram)的架構,無法直接套用於常規的 Transformer 模型。
  • 同時更新成千上萬條知識時的擴展性與計算開銷仍待進一步驗證。

延伸閱讀

Google 推出 EmbeddingGemma 2:超輕量 740M 參數,讓裝置端擁有強大「多模態語意搜尋」與即時決策力
Google AI Developers大型語言模型

Google 推出 EmbeddingGemma 2:超輕量 740M 參數,讓裝置端擁有強大「多模態語意搜尋」與即時決策力

Google Launches EmbeddingGemma 2: Compact 740M Parameter Multimodal Embedding Model for Ultra-Low Latency Edge AI

Google 推出開源多模態嵌入模型 EmbeddingGemma 2,僅 740M 參數,能在手機和電腦上將文字、影像、影片與音訊映射至單一向量空間,實現極低延遲的裝置端隱私搜尋與即時決策。

2 分鐘閱讀
基礎模型也能推理:啟動關鍵「開頭 token」釋放隱藏實力
arXiv大型語言模型

基礎模型也能推理:啟動關鍵「開頭 token」釋放隱藏實力

Base Models Can Reason: Unlocking Latent Performance with Strategic Starting Tokens

最新研究指出,只要強制基礎模型以特定 token(如 'Okay')開頭,就能使其推理能力逼近經過強化學習(RL)微調的模型,並證實此現象源於訓練資料中的文本關聯。

2 分鐘閱讀