9月5日凌晨3點,Codex突然更新了。
我也立刻更新,打開 GPT-6,開始實測。
那先測什麼?
肯定是最近推特上很火的一鍵生成三維場景。
這兩天看了不少演示:給 AI一張建築照片,過一會兒,它就能交出一個可以旋轉、縮放、進去逛的頁面。
看別人的視頻是一回事,自己隨手找張圖,能不能得到同樣的結果,又是另一回事。
所以我找了一張白宮的照片,直接丟了進去。
後面又測了秦始皇騎北極熊的 SVG動畫,看了朋友用一句話做出的馬里奧賽車遊戲,最後還拿一個昨天寫過的帖子,試了試它模仿孫宇晨小作文的能力。
這幾個案例放在一起,挺能說明我這一晚的感受:
GPT-6讓我意外的地方,是一個很短的要求發過去,它能把多少沒交代的細節一起做出來。

白宮這項,我的需求很簡單:根據這張照片,做一個可以自由瀏覽的三維建築頁面。
沒有給建築圖紙,沒有補其他角度,也沒有告訴它該用什麼技術。
22分鐘後,它交出了一個能打開操作的頁面。白宮主體、前面的噴泉、花壇、草坪和周圍的樹都在,頁面上也做好了建築名稱、視角切換和控制按鈕。
我先拖動鼠標,繞着建築轉了一圈,又拉近看了一下。
到這裏,已經能理解為什麼這類視頻最近會火:
原本平面照片裡的東西,突然有了可以繞過去看的空間。
然後我點了自由漫遊。
我靠,居然還能用 WASD走路?
你可以自己往建築前面走,靠近柱子和門窗,也可以換個位置看庭院。
這裏的區別,在你按下鍵盤的時候就能感覺出來。
看一張渲染圖時,角度已經被選好了;進入場景以後,你可以決定自己站在哪裏、往哪邊

再往下點,還有日光調節。
拖動滑塊,場景里的光線和陰影會跟着變化。
我確實要求了自由瀏覽,但沒有逐條要求漫遊怎麼做、視角怎麼切、光線怎麼調。
這些東西,是它在實現需求的過程中自己補上的。
做完這一步,我覺得單說它能生成三維模型,已經有點說窄了。
我拿到的是一個圍繞建築搭好的瀏覽體驗,模型只是其中一部分。
那些看起來不起眼的按鈕,決定了這個東西打開以後,到底有什麼可玩。
當然,一張正面照片沒有提供建築背面的信息,沒拍到的部分只能近似補全,不能當成精確的建築復原。
過程中也有一次訪問報錯,我把問題發回去,它切到本地預覽後才正常打開。
但這些都沒有改變最終的結果:我拿着一張照片,得到了一個可以自己走進去看的場景。

接下來測 SVG,也就是用代碼畫矢量圖,再讓裏面的東西動起來。
以前這類測試的保留節目是鵜鶘騎自行車。

但這道題出現得實在太多,我也會懷疑,模型是不是已經見過類似訓練材料,甚至對這道題有了過擬合。
再畫好一隻鵜鶘,對我的參考價值已經沒那麼大。
所以這次換成社區也在玩的秦始皇騎北極熊,再加一個逛長城。
這當然也算不上嚴格排除了訓練污染,就是換道題,看看它處理幾個不太搭的元素會是什麼樣。
我發過去的原話是:你幫我用 SVG畫一個秦始皇騎着北極熊逛長城,要能動。
界面顯示,它做了8分34秒。
出來的畫面叫「北境巡遊」,秦始皇騎在北極熊背上,腳下是城牆,後面有層疊的山、延伸的長城和一輪紅日,旁邊還配了標題、印章和旗幟。

熊會邁步,秦始皇會跟着步伐起伏,披風也在動。
整張畫裏,人物、坐騎和背景能放在一起看,動作也有配合。
我當時的評價是,這是我見過最好的 SVG之一。
這裏面讓我覺得好玩的,是我只交代了幾個對象,它卻自己給這些對象找了一種畫法。
配色、構圖、遠近關係、標題,都要作選擇。
秦始皇騎北極熊本來就很離譜,但畫面做出來以後,居然有點像那麼回事。
它也沒有把「要能動」理解成讓整幅畫平移一下。
熊走路,騎在上面的人就得有相應的起伏,披風也要跟着動。
這個要求只有三個字,真正落實到畫面里,會變成好幾個相互關聯的問題。這次,它把這些關係處理得不錯。
做完這兩項,再看朋友@路燈同學創業筆記發來的賽車遊戲,我的第一反應是:
任天堂死了。
玩笑歸玩笑,視頻確實值得看。
據朋友說,他也是用一句話,讓 GPT-6做了一個馬里奧風格的賽車遊戲。
我剛才也單獨聊過這個案例,這裏把視頻放上來。
打開以後,先是一個完整的比賽入口。
可以選馬里奧、路易吉、碧姬、耀西這些角色,旁邊是三維賽道,蘑菇、城堡、樹和起跑線都做好了。
頁面還列了競速賽、道具賽兩個選項,錄屏里實際玩的是競速賽。
進入比賽,左上角顯示名次、圈數和時間,右上角有賽道小地圖,下面是車速和漂移蓄力條。
其他車手會一起跑,排名隨着比賽變化,鏡頭跟着車走。
漂移可以蓄力,攢夠以後能用氮氣加速,界面上還有對應的提示。
GPT-6甚至做了自動油門的開關。
打開以後,就可以把注意力放在轉向和漂移上。
我看這個視頻的時候,最在意的就是這些細節。
一個賽車遊戲,畫出車和賽道以後,還得讓人知道怎麼開始、怎麼操作、自己排第幾、什麼時候能加速。
這些部分放在一起,才有了實際玩一局的感覺。
白宮補了自由漫遊和日光,賽車補了比賽界面和駕駛輔助。
兩個例子連起來看,很容易明白我為什麼會覺得這輪體驗好:需求里的那個名詞,開始能帶出一整套相關的功能。
它離一款經過長期打磨的商業遊戲還有距離,手感、關卡和耐玩程度也不能靠一段錄屏判斷。
但從一句話出發,已經能拿到這種程度的原型,足夠讓很多人願意先動手試一次。

最後,我還測了一下寫作。
這項對我更直接。
我每天都要寫東西,一個模型會不會寫,讀上幾段,通常就能感覺出來。
有些文章單看每句話都沒問題,連起來卻很空。
開頭給你鋪一堆背景,中間換着說法重複,最後再強行講一個時代已經到來。
所以這次我拿了一個具體的素材。
昨天我寫過推特上的一個老哥 Josh Cohenzadeh:看到 GPT-6 Astra的表現以後,他發帖說要搬去懷俄明州,儘量遠離 AI。
帖子裏還有一串帶着技術圈笑話的生活計劃,最後說要在那裏劈柴,等算力耗盡。
我把這件事交給 GPT-6,讓它模仿孫宇晨那類小作文的風格,寫一篇文章。
出來的標題是《他去懷俄明州,等算力耗盡》,第一句只有:十五分鐘以後,他訂了機票。
接下來從這個人的反應寫起,寫到選房子的條件、柴火爐、水井和紙質地圖,慢慢把那個有點荒誕的決定展開。
我覺得它寫得好的地方,可以直接看這一段。
寫到他想找牙醫、木匠等人組建社區,並把這些本事叫作 AGI前技能時,文章接了一句:
仿佛一個時代還沒結束,已經有人開始給裏面的東西貼標籤,準備保存下來。
前面有具體的人和職業,這句話才接得住。
它把那個玩笑里有點複雜的情緒寫出來了,又沒有停下來解釋一大段技術焦慮。
結尾也一樣。
前面已經寫過柴火爐,最後回到他要劈柴、等算力耗盡的說法,文章收在這裏:
至於算力什麼時候耗盡,沒有人能給他一個準信。
柴倒是可以先準備起來。
這兩句我很喜歡。
關於未來的大問題還懸在那裏,但文章回到了一個人眼下能做的事。
開頭的機票,中間的紙質地圖和柴火爐,最後的劈柴,是能一路讀下來的。
對我來說,這比單純模仿幾個口頭禪難得多。
寫作要判斷哪裏值得展開,哪個細節可以留下,什麼地方已經說夠了。
尤其是結尾,很多 AI寫到這裏就開始捨不得停,好像不把意義再解釋三遍,前面的文章就白寫了。
這次的收尾,我覺得相當好。
這一晚看下來,三維場景、SVG、賽車和寫作,其實給了我一個相近的感受:
我交代一個目標以後,它已經能替我處理相當一部分中間的選擇。
白宮要怎麼逛,賽車要怎麼開始,動畫裏哪些東西應該一起動,文章里哪個細節應該放到最後。
這些都曾經需要人在做的過程中一項項決定。現在,模型交回來的第一版里,已經帶着它自己的處理。
幾次體驗當然不能證明所有任務都到了這個水平。
但它改變了我對嘗試成本的判斷。
以前一個想法冒出來,想到要學工具、找素材、搭環境,可能就先放下了。
現在可以先交給它做,等結果出來,再判斷這個想法值不值得繼續。
當第一版越來越容易做出來,選擇什麼值得做、判斷哪裏做得不好,就會佔據更多精力。
這對寫作者、產品經理和想做點東西的普通人,都很具體。
我們能更早拿着作品討論,也能更便宜地發現自己原來的想法不成立。
這會改變很多討論發生的時間。
以前,你得先把一個想法解釋得足夠清楚,說服自己或者別人投入時間,才有機會看到結果。
現在,一些原本要等到做出來才知道的問題,可以更早得到回答:這個視角合不合適,操作順不順手,這個故事到底有沒有意思。
拿做內容來說,文章里要解釋一個場景,以前可能到一張配圖就結束了。
如果這種完成度能夠穩定復現,我就可以考慮把它做成一個讀者能進去看的頁面,或者一個能親手操作的小演示。
一個人能使用的表達方式,會跟着製作成本的下降一起增加。
很多原本覺得不值得專門做的東西,可能就會因此被做出來。
所以這一晚之後,我對 GPT-6最直接的期待是:
下次想到一個東西,可以少在腦子裏空轉一會兒,先讓它做出來看看。
畢竟,一張白宮的照片,我已經真的走進去逛過了。













