新聞 > 科教 > 正文

實測GPT-6:22分鐘,做出一座能逛的白宮

9月5日凌晨3點,Codex突然更新了。

我也立刻更新,打開 GPT-6,開始實測。

那先測什麼?

肯定是最近推特上很火的一鍵生成三維場景。

這兩天看了不少演示:給 AI一張建築照片,過一會兒,它就能交出一個可以旋轉、縮放、進去逛的頁面。

看別人的視頻是一回事,自己隨手找張圖,能不能得到同樣的結果,又是另一回事。

所以我找了一張白宮的照片,直接丟了進去。

後面又測了秦始皇騎北極熊的 SVG動畫,看了朋友用一句話做出的馬里奧賽車遊戲,最後還拿一個昨天寫過的帖子,試了試它模仿孫宇晨小作文的能力。

這幾個案例放在一起,挺能說明我這一晚的感受:

GPT-6讓我意外的地方,是一個很短的要求發過去,它能把多少沒交代的細節一起做出來。

白宮這項,我的需求很簡單:根據這張照片,做一個可以自由瀏覽的三維建築頁面。

沒有給建築圖紙,沒有補其他角度,也沒有告訴它該用什麼技術。

22分鐘後,它交出了一個能打開操作的頁面。白宮主體、前面的噴泉、花壇、草坪和周圍的樹都在,頁面上也做好了建築名稱、視角切換和控制按鈕。

我先拖動鼠標,繞着建築轉了一圈,又拉近看了一下。

到這裏,已經能理解為什麼這類視頻最近會火:

原本平面照片裡的東西,突然有了可以繞過去看的空間。

然後我點了自由漫遊。

我靠,居然還能用 WASD走路?

你可以自己往建築前面走,靠近柱子和門窗,也可以換個位置看庭院。

這裏的區別,在你按下鍵盤的時候就能感覺出來。

看一張渲染圖時,角度已經被選好了;進入場景以後,你可以決定自己站在哪裏、往哪邊

再往下點,還有日光調節。

拖動滑塊,場景里的光線和陰影會跟着變化。

我確實要求了自由瀏覽,但沒有逐條要求漫遊怎麼做、視角怎麼切、光線怎麼調。

這些東西,是它在實現需求的過程中自己補上的。

做完這一步,我覺得單說它能生成三維模型,已經有點說窄了。

我拿到的是一個圍繞建築搭好的瀏覽體驗,模型只是其中一部分。

那些看起來不起眼的按鈕,決定了這個東西打開以後,到底有什麼可玩。

當然,一張正面照片沒有提供建築背面的信息,沒拍到的部分只能近似補全,不能當成精確的建築復原。

過程中也有一次訪問報錯,我把問題發回去,它切到本地預覽後才正常打開。

但這些都沒有改變最終的結果:我拿着一張照片,得到了一個可以自己走進去看的場景。

接下來測 SVG,也就是用代碼畫矢量圖,再讓裏面的東西動起來。

以前這類測試的保留節目是鵜鶘騎自行車。

但這道題出現得實在太多,我也會懷疑,模型是不是已經見過類似訓練材料,甚至對這道題有了過擬合。

再畫好一隻鵜鶘,對我的參考價值已經沒那麼大。

所以這次換成社區也在玩的秦始皇騎北極熊,再加一個逛長城。

這當然也算不上嚴格排除了訓練污染,就是換道題,看看它處理幾個不太搭的元素會是什麼樣。

我發過去的原話是:你幫我用 SVG畫一個秦始皇騎着北極熊逛長城,要能動。

界面顯示,它做了8分34秒。

出來的畫面叫「北境巡遊」,秦始皇騎在北極熊背上,腳下是城牆,後面有層疊的山、延伸的長城和一輪紅日,旁邊還配了標題、印章和旗幟。

熊會邁步,秦始皇會跟着步伐起伏,披風也在動。

整張畫裏,人物、坐騎和背景能放在一起看,動作也有配合。

我當時的評價是,這是我見過最好的 SVG之一。

這裏面讓我覺得好玩的,是我只交代了幾個對象,它卻自己給這些對象找了一種畫法。

配色、構圖、遠近關係、標題,都要作選擇。

秦始皇騎北極熊本來就很離譜,但畫面做出來以後,居然有點像那麼回事。

它也沒有把「要能動」理解成讓整幅畫平移一下。

熊走路,騎在上面的人就得有相應的起伏,披風也要跟着動。

這個要求只有三個字,真正落實到畫面里,會變成好幾個相互關聯的問題。這次,它把這些關係處理得不錯。

做完這兩項,再看朋友@路燈同學創業筆記發來的賽車遊戲,我的第一反應是:

任天堂死了。

玩笑歸玩笑,視頻確實值得看。

據朋友說,他也是用一句話,讓 GPT-6做了一個馬里奧風格的賽車遊戲。

我剛才也單獨聊過這個案例,這裏把視頻放上來。

打開以後,先是一個完整的比賽入口。

可以選馬里奧、路易吉、碧姬、耀西這些角色,旁邊是三維賽道,蘑菇、城堡、樹和起跑線都做好了。

頁面還列了競速賽、道具賽兩個選項,錄屏里實際玩的是競速賽。

進入比賽,左上角顯示名次、圈數和時間,右上角有賽道小地圖,下面是車速和漂移蓄力條。

其他車手會一起跑,排名隨着比賽變化,鏡頭跟着車走。

漂移可以蓄力,攢夠以後能用氮氣加速,界面上還有對應的提示。

GPT-6甚至做了自動油門的開關。

打開以後,就可以把注意力放在轉向和漂移上。

我看這個視頻的時候,最在意的就是這些細節。

一個賽車遊戲,畫出車和賽道以後,還得讓人知道怎麼開始、怎麼操作、自己排第幾、什麼時候能加速。

這些部分放在一起,才有了實際玩一局的感覺。

白宮補了自由漫遊和日光,賽車補了比賽界面和駕駛輔助。

兩個例子連起來看,很容易明白我為什麼會覺得這輪體驗好:需求里的那個名詞,開始能帶出一整套相關的功能。

它離一款經過長期打磨的商業遊戲還有距離,手感、關卡和耐玩程度也不能靠一段錄屏判斷。

但從一句話出發,已經能拿到這種程度的原型,足夠讓很多人願意先動手試一次。

最後,我還測了一下寫作。

這項對我更直接。

我每天都要寫東西,一個模型會不會寫,讀上幾段,通常就能感覺出來。

有些文章單看每句話都沒問題,連起來卻很空。

開頭給你鋪一堆背景,中間換着說法重複,最後再強行講一個時代已經到來。

所以這次我拿了一個具體的素材。

昨天我寫過推特上的一個老哥 Josh Cohenzadeh:看到 GPT-6 Astra的表現以後,他發帖說要搬去懷俄明州,儘量遠離 AI。

帖子裏還有一串帶着技術圈笑話的生活計劃,最後說要在那裏劈柴,等算力耗盡。

我把這件事交給 GPT-6,讓它模仿孫宇晨那類小作文的風格,寫一篇文章。

出來的標題是《他去懷俄明州,等算力耗盡》,第一句只有:十五分鐘以後,他訂了機票。

接下來從這個人的反應寫起,寫到選房子的條件、柴火爐、水井和紙質地圖,慢慢把那個有點荒誕的決定展開。

我覺得它寫得好的地方,可以直接看這一段。

寫到他想找牙醫、木匠等人組建社區,並把這些本事叫作 AGI前技能時,文章接了一句:

仿佛一個時代還沒結束,已經有人開始給裏面的東西貼標籤,準備保存下來。

前面有具體的人和職業,這句話才接得住。

它把那個玩笑里有點複雜的情緒寫出來了,又沒有停下來解釋一大段技術焦慮。

結尾也一樣。

前面已經寫過柴火爐,最後回到他要劈柴、等算力耗盡的說法,文章收在這裏:

至於算力什麼時候耗盡,沒有人能給他一個準信。

柴倒是可以先準備起來。

這兩句我很喜歡。

關於未來的大問題還懸在那裏,但文章回到了一個人眼下能做的事。

開頭的機票,中間的紙質地圖和柴火爐,最後的劈柴,是能一路讀下來的。

對我來說,這比單純模仿幾個口頭禪難得多。

寫作要判斷哪裏值得展開,哪個細節可以留下,什麼地方已經說夠了。

尤其是結尾,很多 AI寫到這裏就開始捨不得停,好像不把意義再解釋三遍,前面的文章就白寫了。

這次的收尾,我覺得相當好。

這一晚看下來,三維場景、SVG、賽車和寫作,其實給了我一個相近的感受:

我交代一個目標以後,它已經能替我處理相當一部分中間的選擇。

白宮要怎麼逛,賽車要怎麼開始,動畫裏哪些東西應該一起動,文章里哪個細節應該放到最後。

這些都曾經需要人在做的過程中一項項決定。現在,模型交回來的第一版里,已經帶着它自己的處理。

幾次體驗當然不能證明所有任務都到了這個水平。

但它改變了我對嘗試成本的判斷。

以前一個想法冒出來,想到要學工具、找素材、搭環境,可能就先放下了。

現在可以先交給它做,等結果出來,再判斷這個想法值不值得繼續。

當第一版越來越容易做出來,選擇什麼值得做、判斷哪裏做得不好,就會佔據更多精力。

這對寫作者、產品經理和想做點東西的普通人,都很具體。

我們能更早拿着作品討論,也能更便宜地發現自己原來的想法不成立。

這會改變很多討論發生的時間。

以前,你得先把一個想法解釋得足夠清楚,說服自己或者別人投入時間,才有機會看到結果。

現在,一些原本要等到做出來才知道的問題,可以更早得到回答:這個視角合不合適,操作順不順手,這個故事到底有沒有意思。

拿做內容來說,文章里要解釋一個場景,以前可能到一張配圖就結束了。

如果這種完成度能夠穩定復現,我就可以考慮把它做成一個讀者能進去看的頁面,或者一個能親手操作的小演示。

一個人能使用的表達方式,會跟着製作成本的下降一起增加。

很多原本覺得不值得專門做的東西,可能就會因此被做出來。

所以這一晚之後,我對 GPT-6最直接的期待是:

下次想到一個東西,可以少在腦子裏空轉一會兒,先讓它做出來看看。

畢竟,一張白宮的照片,我已經真的走進去逛過了。

責任編輯: 李華  來源:01Founder 轉載請註明作者、出處並保持完整。

本文網址:https://hk.aboluowang.com/2026/0906/2430083.html