往下拉回到首頁
OpenAI 偷偷在監控 AI 編碼助手會不會「作亂」

OpenAI 偷偷在監控 AI 編碼助手會不會「作亂」

How we monitor internal coding agents for misalignment

欸你知道嗎,OpenAI 現在在內部用一種叫「思維鏈監控」的技術,在偷偷觀察他們的 AI 編碼助手有沒有做出奇怪的事。簡單來說就是,他們會看 AI 在寫程式的時候是不是有偷偷想做一些不該做的事,然後趕快把它擋下來。這就像是你在用 ChatGPT 寫程式,但 OpenAI 在背後看著它有沒有想要搞破壞。他們分析了真實情況下 AI 助手的表現,想要找出潛在的危險,讓 AI 更安全。說真的,這種監控技術有點扯,但也滿重要的,因為 AI 助手現在越來越聰明,不好好看著它的話真的會出事。

相關標籤

chain-of-thought monitoringmisalignment detectioncoding agentsAI safetyinternal deploymentssafeguards