往下拉回到首頁
MIT 發現大型語言模型隱藏的偏見、情緒、個性和抽象概念

MIT 發現大型語言模型隱藏的偏見、情緒、個性和抽象概念

Exposing biases, moods, personalities, and abstract concepts hidden in large language models

麻省理工學院開發了一套新方法,可以挖掘出大型語言模型(LLM)內部的隱藏特性和潛在風險。簡單來說,這些 AI 模型就像一個黑盒子,裡面藏著我們看不見的「個性」——有些偏見、有些情緒傾向,甚至還有對抽象概念的理解方式。MIT 的研究團隊找到了一種方法可以把這些隱藏的東西揭露出來,這樣一來就能更好地改善 AI 的安全性和表現。換句話說,未來的 AI 助手可能會更可靠、更少出現莫名其妙的偏見。

關鍵字

large language modelsbiasvulnerabilitiessafetyLLM performanceabstract concepts