Pull down to go back
Exposing biases, moods, personalities, and abstract concepts hidden in large language models

Exposing biases, moods, personalities, and abstract concepts hidden in large language models

MIT 發現大型語言模型隱藏的偏見、情緒、個性和抽象概念

A new method developed at MIT could root out vulnerabilities and improve LLM safety and performance.

Keywords

large language modelsbiasvulnerabilitiessafetyLLM performanceabstract concepts