「最新報告說 AI 已超出掌控」:本站把那份報告找出來了# 他說上週有位微軟研究員發表了一份一百多頁的報告,用兒童心理學的錯誤信念測驗測出 GPT-4 的心智年齡超過九歲、甚至達到十四歲。他沒講報告名稱,也沒講研究員是誰。
本站查了,那份報告真的存在 ——微軟研究院 2023 年 3 月 22 日發布的《Sparks of Artificial General Intelligence》,全文 155 頁。時間、機構、篇幅、主題四項全部吻合。他沒給名字,但描述精確到讀者可以自己查到,這比許多給了名字卻描述錯誤的內容可靠。
⚠️ 但那個「心智年齡十四歲」的數字,不是出自這份報告。
微軟這份的心智理論章節用的是自製情境測試,結論是定性的「具備進階心智理論」——它沒有給任何年齡數字。 而「約當九歲兒童」的說法,出自史丹佛學者 Kosinski 2023 年 2 月的另一篇 論文。
兩篇是不同機構、不同作者、不同方法、相隔一個月的研究。他把它們併成了一篇。 這不是造假——每一塊材料都是真的,是拼接。而這種錯誤最難察覺。
⚠️ 更值得記的是第三件事:他特別強調的那個「換掉人名物品仍答對」的控制實驗,恰好是這個領域後來爭議最大的環節。 同年即有研究指出,只要做一些對人類完全無妨的細微改動,模型正確率就會大幅下降。他認為最有說服力的地方,正是最站不住的地方。
另外查了那個 GRE 成績:「考贏 99% 的人」只對語文一科成立。數量推理約第 80 百分位,而寫作只有約第 54 百分位——一個語言模型考得最差的是寫作,只贏過一半的人。
最後說句公道話:標題喊「越來越危險」,但他實際的立場溫和得多 ——他說「最大的危害是人類自己」,核心擔憂始終是「我們不知道」而不是「AI 會毀滅人類」。內容比標題謹慎,那是加分。
往下讀之前先問自己 你上次轉發的那則「研究顯示」,研究是誰做的?如果你答不出來,你轉發的其實是那個標題,不是那份研究。
直接在頁面內嵌影片
(預設關閉:點連結跳回原片體驗較好,也把流量還給原作者)
01
本站查出來了:那份報告真的存在,而且他描述得準確到可以被認出來
strong
機轉:為什麼會這樣
他提到上週有一位微軟的研究員發表了一份一百多頁的報告,內容探討 GPT-4 在網路問答與對話中展現出來的心智能力。他沒有講出報告的正式名稱,也沒有指出研究員的姓名,只給了時間、機構、篇幅與主題這四項資訊。
實證查核
本站依他給的四項特徵查證,可以明確對應到微軟研究院於 2023 年 3 月 22 日發布的《Sparks of Artificial General Intelligence: Early experiments with GPT-4》(arXiv 編號 2303.12712),全文 155 頁。 時間(他 4 月 1 日發片、報告 3 月下旬)、機構、篇幅、主題四項全部吻合。 這一點值得肯定:他沒有給名字,但描述的精確度足以讓讀者自行查到來源——這比許多會講出名字卻描述錯誤的內容可靠。
查證來源
該報告為微軟研究院 2023 年 3 月發布、全文 155 頁 報告以 arXiv 預印本形式發布,未經同儕審查 微軟為 OpenAI 之投資方,非獨立第三方 轉述研究應提供作者、時間、發表處與方法 要補一句
⚠️ 但本站也要指出一個習慣問題:轉述研究時不給名稱,讀者就無法自行核對。 而這一次剛好可以查到,不代表下一次也可以。 對讀者的實務建議:聽到「最新研究顯示」而沒有名稱時,先記下四件事——誰做的、什麼時候、發表在哪、樣本或方法是什麼。 四項都給不出來的內容,不該被當成證據使用,無論結論聽起來多合理。 ⚠️ 另外要注意這份報告本身的性質:它由 GPT-4 的商業合作方(微軟投資 OpenAI)所發表,並非獨立第三方研究,發表時也未經同儕審查。 這不表示內容錯誤,但讀者評估其結論的份量時應把這一層納入考量——而片中沒有提到這件事。
可帶走的做法
聽到「最新研究顯示」先問四件事:誰做的、何時、發在哪、方法是什麼。答不出來就不能當證據。
02
⭐ 關鍵發現:他把兩篇不同的研究併成了一篇
contested
機轉:為什麼會這樣
他說那份報告用兒童心理學裡的錯誤信念測驗來測 GPT-4,判斷其心智年齡是否超過九歲,結果測出來不只超過九歲,甚至達到十四歲。他把這個數字當成整支影片論述的起點,用來支撐「AI 能力已超出掌控」的主題。
實證查核
兩件事分開看,他都沒有捏造:那份微軟報告確實有討論心智理論的章節,而「相當於幾歲兒童」的說法在當時也確實存在於另一份研究裡。
查證來源
微軟報告的心智理論章節採自製情境測試,結論為定性描述 「約當九歲兒童」出自 2023 年 2 月另一份獨立研究 兩份研究之機構、作者、方法與發表時間均不同 定性結論與定量年齡對照分屬不同研究 要補一句
⚠️ 但把它們合起來就產生了一個原本不存在的說法。本站查證結果如下。 微軟那份報告的心智理論章節,用的是研究團隊自製的情境測試,結論是定性的「具備進階心智理論」——它沒有給出任何「心智年齡幾歲」的數字。 「相當於九歲兒童」這個說法,出自另一篇論文:史丹佛學者 Kosinski 於 2023 年 2 月發表的《Evaluating Large Language Models in Theory of Mind Tasks》(arXiv 2302.02083),該研究以錯誤信念任務測試,報告較早的模型達到約九成正確率、約當九歲兒童的水準。 ⚠️ 兩篇是不同機構、不同作者、不同方法、相隔一個月的研究。 所以正確的說法是:微軟報告說 GPT-4 有進階心智理論(定性),另一篇研究給出過年齡對照(定量)——而「微軟那份報告測出 GPT-4 心智年齡十四歲」這個組合,兩篇都沒有講過。 ⚠️ 這種錯誤最難察覺,因為每一塊材料都是真的 ——它不是造假,是拼接。
可帶走的做法
聽到「某報告測出某個數字」,把報告和數字分開查一次。拼接過的說法,每一塊都是真的。
03
他最看重的那個環節,正是學界爭議最大的環節
contested
機轉:為什麼會這樣
他特別強調研究裡一個關鍵的控制實驗:為了排除模型在訓練資料裡看過同樣題目的可能,研究人員把測驗中的人名、物品與場景全部替換掉再測一次,結果模型依然答對。他把這一點當成整個結論最有說服力的部分。
實證查核
他抓對了「該檢查什麼」——訓練資料污染確實是這類測驗最大的效度威脅,而替換變數重測正是標準的控制手法。 能注意到這一層,比只複述結論好得多。
查證來源
訓練資料污染為語言模型評測的主要效度威脅 對題目的細微改動可使模型正確率顯著下降 人類受試者不受該類改動影響 替換表面變數無法排除題型模式的習得 要補一句
⚠️ 但本站必須指出:他認為最有說服力的這個環節,恰好是這個領域後來爭議最激烈的地方。 同年學界即有研究指出,只要對題目做一些對人類完全無妨的細微改動——例如把不透明的容器換成透明的、或加入一個不影響推理的補充句——模型的正確率就會大幅下降。 人類受試者不會被這些改動影響,因為人是靠理解情境作答;模型會被影響,暗示它靠的可能是題型的統計規律。 ⚠️ 所以「換了人名物品仍答對」證明的其實比看起來的少 ——它排除了逐字背誦,但沒有排除「學會了這類題目的作答模式」。 這是讀者最該帶走的一課:控制實驗只能排除它設計要排除的那一種可能,不能排除全部。 看到「我們已經控制了變數」,要問的是「控制了哪一個」。
可帶走的做法
看到「我們控制了變數」,問一句控制了哪一個。控制實驗只排除它設計要排除的那一種。
04
⭐⭐⭐ 他真正的論點其實是「不透明」,而這一點站得住腳
strong
機轉:為什麼會這樣
他解釋為什麼沒有人知道模型為何具備這種能力:訓練的方式是研究人員先建好模型架構,然後不斷餵資料讓它自己學,模型會自行建立一套外界看不懂的內部表徵與判斷邏輯。因此訓練過程本身就是個黑盒,連開發者也答不出「為什麼」。他在全片反覆回到這一點。
實證查核
這是全片最紮實的一段,而且它才是他真正的論點——不是「AI 很強所以危險」,是「我們不知道它為什麼強所以危險」。 後者比前者嚴謹得多。 描述也正確:模型的能力來自數十億個參數在訓練中自行調整出的分布,那些數值不對應任何人類可讀的規則,所以「為什麼會這樣回答」確實沒有直接的答案。
查證來源
模型能力來自訓練中自行調整的參數分布,不對應人類可讀規則 可解釋性研究已發展出特徵激活與中間層分析等方法 現有方法尚不足以完整說明大型模型行為 行為測試可在不理解內部機制的情況下描述失效條件 要補一句
要補上他沒說、但這幾年已經改變的部分:⚠️ 「完全無法解釋」講得太滿了。 可解釋性是一個活躍的研究領域,已經發展出一些實際可用的方法 ——例如追蹤特定神經元或特徵在什麼輸入下會被激活、或是分析模型內部哪些中間層對最終答案有決定性影響。它們還遠不足以完整說明一個大型模型的行為,但「有些方法」跟「完全沒有辦法」是不同的狀態。 ⚠️ 對讀者更實際的一點:「不知道原理」與「不知道行為」是兩回事。 你可以不理解它內部怎麼運作,卻仍然能透過大量測試去描述它在什麼情況下會出錯——而後者才是實際使用時真正需要的資訊。 所以面對不透明的工具,正確的反應不是停用,是建立測試與邊界。
可帶走的做法
對不透明的工具別問「它怎麼想」,問「它什麼時候會錯」。後者測得出來,前者測不出來。
05
這個 99% 只對一科成立——而最弱的那科很有意思
moderate
機轉:為什麼會這樣
他提到模型發表時曾去考美國研究所的入學測驗,成績打贏了百分之九十九的應試者,等於能考上頂尖學校的水準。他用這個數據佐證模型能力已經超出一般人的想像。
實證查核
這個數字確實出現在官方技術報告裡,他沒有編造。
查證來源
該模型 GRE 語文推理約為第 99 百分位 數量推理約為第 80 百分位、寫作約為第 54 百分位 語文與數量推理為有唯一答案的選擇題形式 寫作評分涵蓋論證組織與說服力,無標準答案 要補一句
⚠️ 但那是三科裡的一科。本站查證原始技術報告的完整成績:語文推理約在第 99 百分位、數量推理約在第 80 百分位、而寫作只有約第 54 百分位。 也就是說,一個語言模型考得最差的科目是寫作——它只贏過大約一半的應試者。 ⚠️ 只講最高的那一科,會讓讀者對整體能力產生錯誤印象,而這個選擇性引用在當時的媒體報導裡非常普遍。 更值得思考的是為什麼會這樣:語文推理與數量推理是選擇題,有唯一正確答案,而那正是這類模型最擅長的形式;寫作要評的是論證的組織、深度與說服力,沒有標準答案。 這個落差本身就在告訴你這類工具的能力邊界在哪裡——它擅長在既定選項中找出對的那個,較不擅長從無到有建構一個有力的論證。 ⚠️ 讀者的實務啟示:看到任何「AI 考贏幾成的人」的說法,先問是哪一科、以及那一科是什麼題型。
可帶走的做法
看到「AI 考贏 X% 的人」先問是哪一科、什麼題型。選擇題的成績不能代表整體能力。
06
他對那封公開信的解讀:訴求不是停止,是透明
moderate
機轉:為什麼會這樣
他認為那封公開信真正的訴求,並不是要求企業永久停止開發,而是呼籲這些公司先建立一套可供外界檢視的評判標準,公開訓練的過程與結果,讓大眾能夠判斷一個模型對人類是否有害。他把這個解讀當成全片的核心主張之一。
實證查核
這個解讀方向與信件實際內容大致相符,而且比當時媒體普遍的「馬斯克要求停止 AI」框架準確得多。 那封信要求的是暫停訓練比當時最強模型更強的系統六個月,並在期間建立共同的安全協定與治理機制,而非永久停止或全面禁止。 他抓到了「暫停是手段、治理才是目的」這個重點。
查證來源
該公開信要求暫停訓練更強模型六個月並建立安全協定 六個月暫停未實際發生,模型能力持續推進 多個司法管轄區其後建立人工智慧治理框架 前沿實驗室其後發布模型安全評估報告 要補一句
⚠️ 但本站要標明這是他的詮釋而非引述——片中並未引用信件原文,讀者無法從影片本身判斷這個解讀有多貼近。 而三年後回看,這個議題的實際走向可以補充:那六個月的暫停並沒有發生,模型能力持續快速推進;但「建立評估標準與治理機制」這條路確實在推進中 ——多個國家與地區陸續建立了 AI 治理框架,前沿實驗室也開始發布模型的安全評估與能力測試報告。 所以那封信的直接訴求失敗了,間接目標卻部分達成——這個對照本身比信件的內容更有教育意義:公開呼籲的價值往往不在於它要求的那件事有沒有做到,而在於它把某個議題推上了議程。
可帶走的做法
看公開信別只看它要求什麼,看它把什麼推上了議程。前者常失敗,後者常成功。
07
標題寫著「越來越危險」,但他實際的立場溫和得多
value
機轉:為什麼會這樣
在鋪陳了許多關於 AI 可能危害人類的討論之後,他明確轉折,說有時候他會認為最大的危害其實是人類自己。他把風險的根源從「AI 本身」轉向「人類如何使用它」,並在收尾時說科技對人類很有幫助,關鍵在於如何避免它危害人類的生存。
實證查核
這是全片最值得記的一段,因為它跟標題不一樣——而且是往更謹慎的方向不一樣。 標題喊「AI 已超出掌控、越來越危險」,內文的實際立場卻是有條件的擔憂:他反覆強調的是「我們不知道」(不透明),而不是「AI 必然毀滅人類」(宿命論)。 本站認為這個立場比標題更站得住腳,也更有用。
查證來源
片中立場為條件式擔憂而非決定論式危險論 核心論點聚焦於訓練過程的不透明性 標題陳述較內文主張更為絕對 要補一句
⚠️ 但這個落差本身就值得讀者留意,而且方向要看清楚:這裡的問題不是內容誇大,是標題誇大而內容沒有。 一個內容比標題謹慎的作者,比一個標題與內容一樣激動的作者可信;但讀者若只看標題就轉發,傳出去的是那個他自己都沒主張的版本。 ⚠️ 這也解釋了一個現象:同一支影片,看完的人跟只看標題的人,會記得完全不同的兩件事。 本站的提醒——評估任何人的觀點時,用他在內文裡的保留來理解他,而不是用標題。 而反過來,當你要引述別人時,也要引述他真正說了什麼。
可帶走的做法
引述別人的觀點時,用他內文裡的保留去理解他,不要用標題。標題常常不是他寫的重點。
08
用科幻電影當類比:好懂,但這個框架本身會誤導
limited
機轉:為什麼會這樣
他在片尾建議對這個議題沒有概念的觀眾去看幾部電影,並列舉了數部關於人工智慧的知名科幻作品,說它們都是「AI 先幫助人類、後來反過來想毀滅人類」的敘事,可以作為理解這個議題的類比入口。
實證查核
作為讓完全沒概念的人產生興趣的入口,這個做法有它的作用——具體的故事比抽象的風險好記。
查證來源
科幻敘事多以人工智慧產生自我意識並與人類對立為前提 模型產生看似合理但錯誤內容為已知失效模式 訓練資料中的偏見可於輸出中被複製 目標設定不當可在無自主意識的情況下造成有害結果 要補一句
⚠️ 但本站認為這個類比框架的代價大於好處,因為它把人們的注意力導向了錯誤的風險類型。 那類電影的共同劇情是「AI 產生了自我意識,決定與人類為敵」——而這正是實務上最不需要優先擔心、也最沒有證據支持的一種情境。 ⚠️ 真正已經在發生、而且有具體案例的問題完全不是這一類:模型會產生看似合理但完全錯誤的內容、會複製訓練資料裡既有的偏見、會被用於大規模製造不實訊息、以及在被賦予實際權限時因為目標設定不當而做出有害的決定。 這些都不需要「意識」或「敵意」就會發生,而且已經發生了。 ⚠️ 用「機器覺醒造反」當框架的問題在於:它讓人以為危險在很遠的未來、以某種戲劇化的形式到來 ——於是忽略了眼前這些平淡、沒有反派、但確實正在造成傷害的失效模式。 這個誤導的成本,剛好抵消掉它作為入口的好處。
可帶走的做法
別用「機器造反」想 AI 風險。真正的問題平淡得多:它會很有自信地講錯,而你查不出來。
09
他當時已經在本機跑生成式模型——這件事後來變成主流
strong
機轉:為什麼會這樣
他示範自家公司安裝在本機電腦上的開源生成圖像軟體,用它替公司的空間生成意象圖,說明可以透過關鍵字與參數引導模型產出接近自己想要的結果。他把這個當作 AI 已經進入實用階段的具體例證。
實證查核
這一段在 2023 年初其實是走在前面的:當時多數人對生成式 AI 的認知還停留在網頁服務,而他已經在本機跑開源模型。 而三年後回看,本機執行確實成為一條主要路線——模型的量化與壓縮技術大幅降低了硬體門檻,一般個人電腦已經可以執行相當有能力的模型。
查證來源
量化與壓縮技術降低本機執行大型模型的硬體門檻 本機執行使資料不離開使用者裝置 本機可執行的模型規模受記憶體容量限制 同期最強雲端模型的能力仍高於可本機執行者 要補一句
要補上他當時沒講、但這條路線真正的價值所在:⚠️ 本機執行的意義不只是「不用連網」,而是三件事:資料不離開你的機器、沒有用量計費、以及服務不會因為廠商調整政策或停止營運而消失。 對處理敏感資料的人來說,第一項是決定性的 ——任何送到雲端的內容,就已經離開了你能控制的範圍。 ⚠️ 代價則是硬體門檻與能力落差:本機能跑的模型受限於記憶體容量,同一時期最強的雲端模型仍明顯領先。 所以實務上的判斷很單純:處理敏感內容用本機,需要最強能力用雲端 ——而不是二選一。
可帶走的做法
敏感資料用本機模型,要最強能力才用雲端。送上雲端的東西就離開你能控制的範圍了。
本單元出自《最新報告:AI能力已超出人類掌控,越來越危險!》(2023-04-01,約 15:10)。
⚠️ 發布日查核 :本片發布於 4 月 1 日,本站已請備料階段優先確認是否為愚人節內容。結論:不是。 全片為連貫的嚴肅論述,無任何自我揭露的破哏,所述事件於 2023 年 3–4 月均為真實進行中的新聞。
導購查核 :全片無導購 ——無商城連結、無私訊配單、無折扣碼、無贊助、無會員招募。片中提及自家公司處僅為軟體使用示範。
本站的查證(本單元的核心工作) :
報告身分已確認 :依片中四項描述(上週/微軟研究員/一百多頁/GPT-4 心智能力)比對,對應微軟研究院 2023-03-22 發布之《Sparks of Artificial General Intelligence: Early experiments with GPT-4》(arXiv 2303.12712),155 頁。四項特徵全數吻合。 ⚠️ 但「心智年齡大於 9 歲/達 14 歲」的數字不出自該報告 。該報告的心智理論章節採自製情境測試、結論為定性描述,未給年齡對照。「約當九歲兒童」出自 Kosinski 於 2023-02 發表之《Evaluating Large Language Models in Theory of Mind Tasks》(arXiv 2302.02083)。 兩者為不同機構、作者、方法、時間之獨立研究。本站據此判定為「拼接」而非造假,並於 kp-02 說明為何這類錯誤最難察覺。 ⚠️ 該領域的爭議狀態 :他最為強調的「替換變數後仍答對」控制實驗,其效度於同年即遭質疑——細微且不影響人類作答的改動可使模型正確率顯著下降。故 kp-02、kp-03 之證據等級標為 contested。 GRE 成績已核對原始技術報告 :語文推理約第 99 百分位、數量推理約第 80 百分位、寫作約第 54 百分位 。片中僅引用最高的一科。報告性質補充 :該報告由 OpenAI 之投資方發表、以預印本形式公開、未經同儕審查——片中未提及此三點 ,本站於 kp-01 補上。⚠️ 本站不予採用的段落(三處,均涉及具名真實人物且未附任何依據) :
對某科技企業家連署動機的推測(指其意在阻擋競爭對手)。 關於該人士私人關係的傳聞轉述。 將一位藝人的車禍直接歸因於自動駕駛系統 ——片中以肯定語氣陳述因果,未引用任何官方調查結論。本站不收錄亦不轉述涉及具名個人之事故歸因,除非有調查報告可引。 可驗收預測查核 :本片未提出任何附時間範圍、可供驗證的預測。 他明說「至於之後會怎麼樣,之後再說啦」。本站認為這是誠實的拒絕預測,而非含糊其辭,故不作負面評價;但也據此說明本單元的驗收對象是他的「引用」而非他的「預測」。
時效性 :片中所有模型、產品與研發專案屬 2023 年 4 月狀態。
引句僅作定位用途 ,每一條皆可點擊跳回原片該秒自行核對。