只要 AI 讀得到外部內容——網頁、上傳的文件、別人寄來的郵件——那段內容就可能夾帶給模型的指令。這類攻擊被統稱為 Prompt Injection。
發生了什麼
近年多份公開的 LLM 風險清單都把它列在最前面。原因不是它最複雜,而是它沒有一個乾淨的技術解法:模型天生就分不清「要處理的資料」與「要遵守的指令」。
這對企業的意義
多數討論停在「怎麼讓模型不被騙」,但那是廠商的事。企業真正該問的是另一個問題:它被騙之後,能做到什麼?
一個只能查公開手冊的助理,被注入了惡意指令,最糟也只是回答錯誤;一個能讀全公司薪資、還能發信的助理,同樣一次注入就是資料外洩事故。差別不在模型,在權限。
所以防線要疊在權限層,而不是提示詞層:使用者能看的資料,AI 才看得到;寫入與對外發送這類動作,一律要人確認。