AILIFELAB.CO VOL. 2026 · 10
AI 生活實驗室▪
工具實測 2026 · 09 · 09

三句指令做出可以走進去的 3D 場景:特洛伊木馬實測全流程

去年這種東西要一個 3D 美術做好幾天。現在你只要會描述你想看到什麼。

我花了一個晚上做出一座特洛伊木馬的場景,城牆、城門、營帳、士兵、地上的蹄印都在裡面,而且可以用鍵盤走進去繞一圈。這篇把做法拆開來講,你照著做也做得出來。

成品長什麼樣

線上版的實際畫面:巨大的特洛伊木馬停在城牆前,前景站著一名戴牛角盔的衛兵,右邊是敞開的城門與插紅旗的城樓

上面那張就是線上版的實際畫面。成品是一個網頁,打開之後你就站在木馬旁邊,可以用鍵盤前後左右走,滑鼠看四周,走到牆邊會被擋住,走近衛兵他會看著你。

想先看看的話:troy-walk.pages.dev。電腦開比較好走,手機也開得起來。

這個場景由四個部分組成

搞懂這四塊,你就知道每一句指令在做什麼。

一、場景骨架

這一步其實分兩半。

先弄一張整體的概念圖,把氣氛、比例、時間、光線先定下來。網路上找得到現成的參考圖就用現成的,找不到好的再讓生圖模型生一張。接著 AI 照著那張圖的大概,用程式在 Blender 裡把地形、城牆、城門、地面起伏一塊一塊蓋出來。

這一步很值得做。概念圖幾秒鐘就有,而且你一眼就知道方向對不對,比等 AI 蓋完一整版才發現整個氣氛不是你要的省太多時間。概念圖不用很精確,它的功用是「定調」,不是「照著描」。

至於為什麼骨架是用程式蓋、不是用模型:因為這類東西的規則很單純,石塊是一排一排交錯堆上去的,地面是幾個正弦波疊起來的起伏。AI 寫幾十行程式就能生成,而且之後要改尺寸、要加一座塔、要把牆拉高,改一個數字就好。用模型反而綁手綁腳。

二、物件

木馬、士兵、營帳、岩石、盾牌,這些是模型。

做法分兩步。先弄一張乾淨背景的正面照,只有那個物件、沒有其他東西、背景是灰色。一樣是找得到現成的就用現成的,沒有就生一張。再把那張圖丟進 image-to-3D 服務,它會吐出一個帶紋理的 3D 模型檔。

用網路上找的圖要留意授權。自己玩沒問題,要公開發布的話就挑標了可自由使用的,或是乾脆自己生。

左邊是 AI 生成的木馬平面圖,灰色背景乾淨無雜物;右邊是它被轉成 3D 模型之後的樣子

左邊那張是生圖模型畫的平面圖,右邊是轉完的 3D 模型。中間沒有人手動建模。

三、材質

木板、沙地、石牆這些表面的紋理,要求跟前面不一樣:必須是四方連續,也就是上下左右接起來看不出接縫,才能鋪滿一整面牆或一整片地。

網路上有很多免費的四方連續材質庫,找得到合用的就直接用。找不到再讓生圖模型生,記得在指令裡寫明「四方連續」。

三張四方連續的材質貼圖,由左到右分別是深色木板、沙地碎石、石灰岩牆面

貼上去之後,整個場景就從一堆灰色方塊變成前面那張圖的樣子。

四、走進去

最後把整個場景匯出成一個檔案,丟進網頁,再寫一段程式控制鏡頭:怎麼走、怎麼看、撞到牆要停下來。這段對 AI 來說是標準功課,不用你操心。

你需要準備什麼

四類東西,每一類都有不只一種選擇。我列我自己用的,也列其他能用的,你手上有什麼就用什麼。

一個會寫程式、又看得懂圖的 AI

這是唯一不能省的一項。它要能寫程式、能執行、還要能看自己算出來的圖再判斷該改哪裡。

我用的是 Claude Code,模型掛 Fable 5.1。GPT-6 Astra 也很強,最近網路上那些讓人驚訝的 3D 作品,很多都是它做出來的。這兩個能力都夠,你已經在用哪一個就用哪一個,不用為了這件事再多開一個訂閱。

3D 軟體

Blender。免費、開源、社群夠大,新手拿來試完全沒有負擔,做壞了也不心疼。

而且你不用學它怎麼操作。AI 是用命令列在驅動它,你從頭到尾只會看到算出來的圖,介面連打開都不用打開。

生圖

我用 OpenAI 的 gpt-image-2,按張計費、很便宜。Nano Banana、Seedream 這類的也可以。材質貼圖跟乾淨背景的物件圖對現在的生圖模型來說都不難,差別多半在細節密度,不影響你先做出第一版。

圖片轉 3D 模型

我用 Tripo。Meshy 也是常見的選擇,兩家官網都有免費月額度,夠你先試出感覺再決定要不要付費。

品質有差,但都能用。真的要照片級的模型,那是另一條路,我在後面「想做到照片級擬真」那段會講。

一句話總結:這四樣裡面只有 AI 是訂閱制,其他三樣都可以先用免費的玩過一輪再說。

三句指令

重點來了。你不需要寫落落長的規格,也不需要事先想清楚每個細節。

先講一個心法:你的指令只要交代「你想看到什麼」,剩下的讓 AI 反問你。它問什麼你就答什麼,這比你自己憋一份完美的需求書快十倍,而且結果更接近你要的。

第一句:先把場景蓋出來

我想用 Blender 做一個可以走進去的 3D 場景。
先問我想做什麼場景、什麼氣氛,然後找一張參考圖給我看
(網路上找得到合適的就用現成的,沒有好的再生一張)。
我確認圖之後,再用程式照著那張圖把地面、牆面這些大結構蓋出來。

這一句不用填任何東西,直接貼過去就好。它會反問你要做什麼場景,你再回答。

概念圖那一步不要省。你看到圖才知道自己想的跟 AI 想的是不是同一件事,不對就換一張,很快。

第二句:把物件跟材質補上

這個場景需要哪些物件,你先列給我確認。
每一個都先弄一張乾淨灰底的正面圖(找得到現成的就用,沒有就生),
再用 image-to-3D 轉成模型匯進場景。
表面的材質也一樣處理,記得要四方連續的。

這句是整個流程裡最關鍵的一句。它同時交代了物件跟材質兩件事,而且指定了「乾淨灰底的正面圖」這個關鍵條件,image-to-3D 才轉得準。

物件清單讓它先列出來給你確認,比你自己想快,也不會漏掉像岩石、雜草這種你不會主動想到、但少了就很空的東西。

第三句:變成可以走進去的網頁

把整個場景匯出成 GLB,做一個網頁版,
我可以用鍵盤走動、滑鼠看四周,走到牆會被擋住。

到這裡就有一個可以打開來走的網頁了。

想做到照片級擬真,該往哪走

如果你不怕燒 token 也願意付費,方向不是「多迭代幾輪」。這是我這次最大的體悟。

我一開始的想法是讓 AI 在 Blender 裡不斷調參數、算圖、看圖、再改,修個幾十輪應該就會很真。實際上不會。渲染器本身是照片級的,光影、材質、景深、霧氣交給它都會真。真正卡住的是形狀跟貼圖:木馬要有幾千片木板、繩結、鉚釘,這些用程式一筆一筆堆,修幾百輪還是「像樣的模型」,很難變成「像照片」。

所以要更真,走這三個方向:

  1. 主體物件換成照片級素材。掃描模型、Megascans 這類資源庫、或是更高階的 image-to-3D。這一步一次到位,比迭代一百輪有效。
  2. 讓 AI 只負責打光、鏡頭、氛圍、擺放。這四件事迭代幾輪就有明顯進步,而且是照片感的真正來源。
  3. 算圖等級拉高。取樣數調高、開啟降噪、算 4K。這只是時間問題,不是能力問題。

反過來說,讓 AI 從零雕細節這條路,只留給小東西。一個門把、一塊石頭可以,一整隻怪獸不行。

還有一個要有心理準備的:迭代很燒。每一輪都要算一張圖、AI 看圖、判斷、改程式、再算,一張圖進 AI 的上下文就是一筆成本,十幾輪下來比生一張圖貴很多倍。而且越接近真實,每一輪的進步越小,會有一種「花了三輪只換到陰影軟一點」的感覺。所以請把預算花在素材,不要花在迭代。

常見問題

完全不會 Blender 可以做嗎

可以。我從頭到尾沒有打開過 Blender 的介面。AI 是用命令列驅動它,你看到的只有算出來的圖。

一定要付費嗎

生圖跟 image-to-3D 都有免費額度可以先試。Blender 完全免費。真正的成本在那個會寫程式的 AI,那是訂閱制。

要花多久

我這次是一個晚上,包含來回修改。如果你的場景比較單純,例如一個房間、一間店面,會快很多。

可以拿來做什麼

室內設計師可以做線上的 3D 展示間,藝術家可以做線上展覽館,寫小說的人可以把場景蓋出來讓讀者走進去,房仲可以把房源做成可以逛的空間。你自己的行業裡,只要有「我想讓對方親眼看看那個空間」的需求,這條路都用得上。

做出來的東西可以放在網路上嗎

可以,就是一個普通網頁,丟到任何靜態網站服務都能跑。

最後

這件事最有趣的地方不是技術,是門檻真的不見了。以前你要嘛會建模、要嘛付錢找人,現在你只要說得出你想看到什麼。

我還在繼續玩這個,之後會把更擬真的版本、還有怎麼把角色做成可以動的,都記錄下來。

想看用 AI 讓生活跟工作更輕省,追蹤 AI 生活實驗室 👉 @life.coach.mtcity,我們一起玩 AI。你做出什麼場景,也歡迎留言或私訊給我看,我真的會看。