SoulVid
Upgrade

如何用 AI 製作短片|75 秒懸疑短片完整工作流程

以《不要開門》為例,完整拆解 AI 短片製作流程:從故事與劇本、角色設定、分鏡和逐鏡提示詞,到配音、剪輯與連續性檢查。

一支 AI 短片最難的地方,通常不是生成一個漂亮鏡頭,而是讓故事、角色、場景、聲音和節奏在一分鐘後仍然像同一部作品。只要直接要求模型「做一支懸疑短片」,常見結果就是人物換臉、房間格局改變、道具消失,或每個鏡頭都好看卻接不起來。

這篇教學會用一支約 75 秒的懸疑故事《不要開門》,示範如何用 AI 製作短片。我們會從一句故事概念開始,依序完成劇本、角色與場景設定、8 鏡頭分鏡、關鍵影格、逐鏡影片提示詞、語音、環境音和最後剪輯。案例刻意只使用一名可見角色、一間公寓、一扇門和一支手機,讓你能把注意力放在敘事與連續性,而不是同時處理太多變數。

快速答案

要用 AI 做出完整短片,先把故事限制在一個可控制的核心事件,再把劇本拆成能獨立生成與修正的鏡頭。先鎖定角色、服裝、場景和重要道具,接著製作分鏡與關鍵影格,再逐鏡生成動作、對白和聲音。最後透過剪輯與連續性檢查,把這些片段組成一支真正能看懂的短片。

在 SoulVid Short Drama 模式輸入 75 秒 AI 懸疑短片故事設定
在 SoulVid 的 Short Drama 模式中,先輸入故事、角色、場景、長度與結局限制,再進入劇本和分鏡流程。

AI 短片製作不是一次生成一部電影

目前的影片模型更擅長完成一個明確鏡頭,而不是在單次生成裡維持 60 至 90 秒的角色、空間和劇情連續性。真正可控的 AI 影片製作流程,比較接近一個小型劇組:先寫劇本,建立角色和場景參考,再安排每一個鏡頭,最後才生成影片與聲音。

階段 要解決的問題 本文案例產出
故事限制 這支短片到底要講什麼? 一名女子收到來自明天的警告
劇本 何時發生什麼事? 約 75 秒、8 個故事節點
視覺設定 哪些細節不能改變? 角色卡、公寓與道具設定
分鏡 每個鏡頭如何呈現資訊? 8 鏡頭時間表與構圖
影片生成 人物和攝影機如何動? 每鏡頭獨立的動作提示詞
聲音與剪輯 如何建立懸疑和節奏? 未來語音、敲門聲、切黑結尾

這個方法需要多幾個步驟,卻能讓你只重做失敗的鏡頭,不必因為最後五秒出錯而重新生成整支影片。

案例設定:《不要開門》

故事發生在深夜 11:47。一名 30 歲出頭的女子獨自在公寓裡,手機忽然收到一段來自自己號碼的語音訊息,但訊息日期顯示為明天。

訊息裡的她急促警告:

幾秒後會有人敲門。不管你聽見誰的聲音,都不要開門,也不要回答。

語音結束後,門外真的響起三次敲門聲。接著,走廊傳來她自己的聲音:「是我,快開門。」她從門眼看出去,外面沒有人,門把卻開始緩慢轉動。當她重播語音時,發現錄音裡提前出現了自己此刻的呼吸和腳步聲。她終於明白,自己必須錄下同一段警告,傳給昨天的自己。

手機顯示「已傳送至昨天 23:47」後,走廊的敲門聲停止了。她剛鬆一口氣,公寓內部卻傳來最後一聲敲擊,畫面切黑。

這個故事適合 AI 製作,因為它只需要一名可見角色、一個主要場景和少數固定道具。懸疑主要靠聲音、反應與資訊順序建立,不需要大量群眾、打鬥或複雜場景切換。

步驟 1:先把故事縮小到可控制的範圍

短片不是把長片加速播放。60 至 90 秒的故事最好只保留一個衝突、一個轉折和一個結尾。

《不要開門》的故事骨架可以寫成三句話:

  1. 衝突:女子收到來自明天的警告,不可以開門。
  2. 轉折:門外出現她自己的聲音,而語音可以預測她當下的動作。
  3. 結尾:她把警告傳回昨天,卻發現真正的危險可能已在屋內。

如果一句故事概念同時包含三名角色、五個地點、兩段追逐和完整世界觀,先刪掉不影響核心反轉的部分。AI 影片越短,越需要把生成預算留給觀眾真正會記住的畫面。

SoulVid Short Drama 的 9:16 畫面比例、英文語言、真人風格與懸疑類型設定
故事範圍確認後,先固定畫面比例、語言、真人風格與懸疑類型,避免後續分鏡偏離最初方向。

步驟 2:把故事寫成 75 秒短片劇本

劇本要描述可被看見或聽見的資訊,而不是只寫角色心裡的想法。以下版本把故事分成 8 個節點,每一段都會對應後面的分鏡。

時間 畫面與聲音 故事任務
0-6 秒 深夜公寓,手機顯示 23:47,女子獨自坐在桌前 建立時間、角色和孤立感
6-14 秒 手機收到來自自己號碼的語音,日期卻是明天 提出不可能事件
14-23 秒 未來語音警告她不要開門 說明規則與危險
23-33 秒 三次敲門,門外傳來她自己的聲音 讓警告成真
33-44 秒 她看向門眼,走廊空無一人,門把轉動 提高威脅但不揭露怪物
44-55 秒 重播語音,錄音提前出現她的呼吸與腳步 證明時間異常
55-67 秒 她錄下相同警告並傳給昨天 角色做出選擇
67-75 秒 手機顯示傳送成功,屋內傳來最後敲擊,切黑 完成時間循環與反轉

對白要短,讓觀眾有時間讀懂畫面。這個故事真正必要的台詞只有未來語音、門外的一句話和女主角重新錄製的警告。

SoulVid 產生《不要開門》AI 懸疑短片的故事摘要與確認選項
先檢查故事摘要是否保留時間、警告、敲門、時間循環與切黑結局,再確認產生詳細內容。

步驟 3:建立角色、場景與道具設定

角色一致不是反覆寫「同一個女人」,而是建立一組每次都能重複的可見特徵。場景也一樣,門的位置、牆面顏色、燈光方向和家具關係都應該固定。

女主角設定

  • 30 歲出頭的成年東亞女性
  • 肩下深棕色直髮,右側自然分線
  • 深棕色眼睛,臉型偏長,妝容極淡
  • 炭灰色針織外套、象牙白 T 恤、深色長褲
  • 全片不更換服裝、髮型、飾品或妝容
  • 表演從放鬆、疑惑、警覺,逐步進入壓抑恐懼

公寓設定

  • 小型現代公寓,深夜,冷色城市環境光
  • 暖色桌燈作為主要室內光源
  • 深灰色前門位於客廳右側,銀色水平門把
  • 木質餐桌位於畫面左側,桌上只有黑色手機和玻璃杯
  • 門後方沒有窗戶,門外是狹窄的白色走廊

道具設定

手機必須是同一支黑色直板智慧型手機。畫面上的時間、訊息日期和傳送狀態是故事線索,最好把手機特寫當成獨立鏡頭製作,避免模型在人物表演的同時還要生成完全正確的介面文字。

更完整的角色參考方法,可以搭配 AI 影片角色一致性教學,先做中性正面、四分之三側面和主要表情參考,再進入分鏡。

步驟 4:把劇本拆成 8 個可生成分鏡

分鏡要決定的不只是畫面內容,也包含景別、相機位置、角色動作和鏡頭如何接到下一段。

鏡頭 景別與運鏡 主要動作 鏡頭結尾
1 35mm 中廣角,緩慢推近 女子坐在桌前,抬眼看向震動的手機 手伸向手機
2 50mm 手機近特寫,固定鏡位 螢幕顯示自己的號碼和明天日期 手指按下播放
3 85mm 臉部近景,極慢推近 她聽完警告,表情從疑惑變得僵硬 第一次敲門響起
4 35mm 側面中景,輕微手持感 她轉向門口,三次敲門後站起 門外聲音說話
5 50mm 肩後跟拍至門眼 她靠近門眼,走廊空無一人 銀色門把開始轉動
6 85mm 手機與臉部交替特寫 她重播語音,聽見提前出現的呼吸 她看向錄音按鈕
7 50mm 半身近景,固定鏡位 她壓低聲音錄下同一段警告 螢幕顯示傳送至昨天
8 35mm 緩慢後退 她背對黑暗的公寓深處,敲門停止 屋內一聲敲擊,立即切黑

如果你還不熟悉鏡頭拆解,可以先閱讀 AI 故事板教學,確認每個鏡頭只承擔一個主要資訊。

SoulVid 將心理懸疑短片拆成包含時長、場景、角色、動作與情緒的詳細分鏡
詳細分鏡應該清楚標示每段時長、場景、角色、動作、對白與情緒,確認後再進入素材生成。

先把故事變成可修改的分鏡

在 SoulVid 中輸入故事、角色和結局方向,先整理劇本、人物關係與鏡頭順序,再決定哪些片段值得生成。

建立 AI 短劇分鏡

步驟 5:先生成關鍵影格,再讓畫面動起來

關鍵影格是每個鏡頭最重要的靜止畫面。先確認人物、構圖、服裝、場景和道具,再把影格送進圖片轉影片模型,通常比直接從文字生成影片更容易維持一致。

第一鏡的關鍵影格提示詞可以這樣寫:

鏡頭 1 關鍵影格提示詞

寫實電影感靜態畫面,時間為深夜 11:47,小型現代公寓內,一名 30 歲出頭的成年東亞女性獨自坐在木質餐桌前。她有肩下深棕色直髮、右側自然分線,穿炭灰色針織外套、象牙白 T 恤和深色長褲。黑色智慧型手機在透明玻璃杯旁震動。畫面左側是暖色桌燈,窗外冷藍色城市光進入室內,深灰色前門位於房間右側,配有銀色水平門把。克制的心理驚悚氛圍,真實皮膚質感,35mm 鏡頭,中廣角構圖,細微陰影。不要出現其他人物、文字或變形的手部。

門眼鏡頭可以先生成「女子肩後看向深灰色前門」的構圖,再單獨製作走廊空景。不要要求同一個短片段同時穿越門眼、旋轉相機、顯示走廊和回到角色臉部。

步驟 6:逐鏡頭撰寫動作與運鏡提示詞

影片提示詞應該說清楚誰在動、如何動、相機怎麼動,以及畫面中哪些東西不能改變。每個鏡頭盡量只保留一個主要動作。

鏡頭 5 影片提示詞

沿用已確認的公寓與角色參考。從同一名女子身後進行肩後跟拍,她緩慢走向深灰色前門。一隻手靠近胸前,身體靠向門眼,但不要碰觸門把。攝影機以克制的步行速度跟隨,只有輕微自然晃動。暖色桌燈仍位於她身後左側,冷色光線勾勒門板輪廓。鏡頭結尾停在保持一致的銀色水平門把上,門把自行向下轉動幾公分。不要顯示入侵者,不要新增人物、家具或服裝,不要造成臉部變形,也不要突然旋轉攝影機。

最後一鏡影片提示詞

沿用同一名女子、服裝、公寓格局、前門、光線與黑色智慧型手機。以中景開始,她在傳送警告後低頭看著手機螢幕。走廊的敲門聲停止,她的肩膀稍微放鬆,但不要微笑。攝影機緩慢向後拉,逐漸露出她身後更深的公寓黑暗,而她始終面向前門。她聽見公寓內部傳來一聲沉重敲擊,立刻僵住,不要轉身。停留一秒後迅速切黑。不要出現怪物、可見攻擊者、血腥畫面、新增角色或改變的房間格局。

運鏡語言可以參考 電影感提示詞指南,但不要為了顯得華麗而讓每個鏡頭都旋轉、變焦或快速穿越空間。這個故事需要的是克制,而不是技術展示。

步驟 7:設計來自「明天的自己」的聲音

聲音是這支短片真正的第二個角色。未來語音、門外聲音和女主角現場錄製的警告,都應使用同一個聲線,但透過距離、壓縮和情緒做出差異。

未來語音

聽我說。幾秒後會有人敲門。不管你聽見誰的聲音,都不要開門,也不要回答。別相信門外的人。

語速偏快,呼吸不穩,但必須壓低音量。加上手機播放的頻率壓縮和微弱底噪,讓它聽起來像一段真正收到的語音訊息。

門外聲音

是我。快開門。

使用同一個聲音,但讓它更平靜、更靠近門板。這種不自然的冷靜,比尖叫更有威脅。

現場錄製

女主角在第 7 鏡重新說出未來語音。她已經理解時間循環,所以前半句急促,後半句逐漸變成她在第一段訊息裡聽到的語氣。觀眾應該在這裡意識到,兩段語音本來就是同一段錄音。

環境聲保持簡單:冰箱低頻、遠處車流、手機震動、三次敲門、門把金屬摩擦,以及最後來自屋內的一聲敲擊。背景音樂不要太早說明恐怖情緒,可以等第一次敲門後才加入低頻音色。

步驟 8:用剪輯建立懸疑節奏

懸疑來自觀眾比角色早知道一點,卻又無法看見全部資訊。剪輯時可以使用下面幾個方法:

  • 聲音先行:第一次敲門可以在角色近景結束前先響起,再切到門口。
  • 保留停頓:警告結束後留半秒安靜,讓觀眾等待預言是否成真。
  • 固定敲門次數:每次都清楚保留三次,讓錄音與現實形成對照。
  • 不要過度切換:角色聽語音時,讓鏡頭停留在她的反應,而不是一直切手機畫面。
  • 延後揭露:最後一聲敲擊後直接切黑,不顯示危險來源。

手機介面文字可以在剪輯階段疊加,確保「明天」、「23:47」和「已傳送至昨天」準確可讀。不要把關鍵劇情完全交給影片模型生成的隨機文字。

AI 短片連續性檢查表

完成初剪後,逐鏡確認下面項目:

  • 角色:臉型、髮長、分線、服裝和年齡是否一致?
  • 空間:桌子、門、燈和走廊的相對位置是否改變?
  • 道具:手機顏色、門把方向和玻璃杯是否突然換款?
  • 時間:手機日期和 23:47 的時間線是否符合故事?
  • 聲音:未來語音、門外聲音和現場錄音是否像同一個人?
  • 動作:角色在前一鏡伸出的手,是否能接上下一鏡的姿勢?
  • 故事:沒有說明製作流程的情況下,觀眾是否仍能理解時間循環?

如果只有一個鏡頭失敗,回到該鏡頭的參考影格、動作提示詞或結束姿勢修正。不要因為門把方向錯了,就重做已經穩定的角色近景和聲音。

完整可複製的 AI 短片專案指示詞

下面這份指示詞適合放在專案建立階段,用來產生劇本、角色設定和第一版分鏡。逐鏡生成影片時,仍然應使用前面的鏡頭專用提示詞。

《不要開門》專案指示詞

製作一支約 75 秒、9:16 直式、寫實風格的心理懸疑短片,片名為《不要開門》。
主角是一名 30 歲出頭的成年東亞女性。她有肩下深棕色直髮、右側自然分線、深棕色眼睛,穿炭灰色針織外套、象牙白 T 恤和深色長褲。全片只能有這一名可見角色,臉部、髮型、服裝和身形必須保持一致。
故事發生在晚上 11:47 的小型現代公寓。室內使用暖色桌燈和冷色城市環境光。深灰色前門位於客廳右側,使用銀色水平門把。木質餐桌位於左側,桌上只有一支黑色智慧型手機和一個透明玻璃杯。公寓格局、門、燈、桌子和手機在所有鏡頭中保持一致。
故事內容:女子的手機收到一段來自自己號碼、但日期顯示為明天的語音。未來的她警告:「幾秒後會有人敲門。不管你聽見誰的聲音,都不要開門,也不要回答。」接著門外響起三次敲門聲,並傳來她自己的聲音:「是我,快開門。」她從門眼看出去,走廊空無一人,門把卻開始緩慢轉動。她重播語音,發現錄音提前收錄了自己此刻的呼吸和腳步。她理解自己必須錄下同一段警告並傳給昨天。手機顯示「已傳送至昨天 23:47」後,走廊的敲門聲停止,但公寓內部傳來最後一聲敲擊,畫面立即切黑。
先產出故事摘要、75 秒劇本、角色設定表、公寓與道具設定、8 個相互連接的分鏡、每鏡頭時長、景別、角色動作、攝影機運動、光線、聲音和鏡頭結束狀態。再為每個鏡頭撰寫可以獨立生成的圖片提示詞與影片提示詞。
整體使用克制、寫實的心理驚悚攝影,35mm、50mm 和 85mm 鏡頭語言,緩慢推近、肩後跟拍和固定特寫。不要使用血腥畫面,不顯示入侵者或怪物,不新增人物,不改變角色服裝、房間格局、前門、門把或手機,不使用極端廣角變形、突然旋轉的攝影機或無意義特效。結局必須清楚呈現時間循環,同時保留危險已進入公寓的懸念。

從故事概念到可以修改的 AI 短片

好的 AI 短片不是由最長的提示詞產生,而是由一連串清楚決策組成:故事要多小、角色哪些細節不能變、每個鏡頭只完成什麼、聲音何時提供資訊,以及哪一個錯誤值得單獨重做。

SoulVid 可以把故事概念、劇本、角色、素材和分鏡放在同一個短劇工作流程中。先檢查故事和鏡頭規劃,再生成影片,能讓你保留已經成功的內容,只修改失敗的場景。

把下一個故事做成可看的短片

從一句故事概念開始,建立角色、劇本、分鏡和逐鏡影片,再把所有場景整理成完整短劇。

開始製作 AI 短片

常見問題

AI 可以直接生成一整支 60 至 90 秒短片嗎?
部分工作流程可以協助建立完整專案,但影片通常仍需要拆成多個鏡頭生成。逐鏡製作比較容易維持角色、場景和動作連續性,也能只重做失敗片段。
AI 短片做多長最容易保持一致?
第一次製作可以從 30 至 90 秒開始,控制在一至兩名主要角色和少數場景。長度不是唯一問題,角色數、換裝、地點和複雜動作都會增加連續性難度。
如何讓同一角色出現在不同鏡頭?
先建立固定角色參考圖和可重複的外觀描述,每個鏡頭使用同一組角色、服裝和臉部參考。不要只依賴角色名字,也不要在生成中途隨意更換描述。
一定要先生成圖片,再生成影片嗎?
不是每個鏡頭都一定需要,但角色特寫、重要場景和構圖要求高的鏡頭,先確認關鍵影格通常更穩定。空景、簡單轉場或低風險鏡頭可以直接使用文字生成影片測試。
手機畫面上的文字應該交給 AI 生成嗎?
如果時間、日期或訊息內容會影響劇情,建議在剪輯階段疊加正確介面文字。影片模型生成的文字可能拼錯、跳動或在不同影格間改變。
如何讓未來語音和現場角色聽起來是同一個人?
使用同一個基礎聲線,再透過語速、呼吸、距離和音訊處理區分狀態。手機語音可以加壓縮和底噪,門外聲音則保留較近但被門板遮擋的質感。
製作一支 75 秒 AI 短片需要多少鏡頭?
本文使用 8 個主要鏡頭,平均每鏡約 6 至 12 秒。實際數量取決於節奏和資訊密度;懸疑片通常需要停頓,不必為了快速而加入過多剪接。
AI 生成的短片可以發布到 YouTube、TikTok 或 Reels 嗎?
可以,但發布前要確認所使用模型、音樂、聲音和參考素材的商用條款,也要檢查平台對 AI 生成內容、人物肖像與標示方式的最新要求。
Ethan Brooks 作者頭像

作者

Ethan Brooks

SoulVid AI 影片工作流程作者

Ethan 專注撰寫實用指南,協助創作者與小型團隊把圖片、歌詞和提示詞轉化為以故事板驅動的 AI 影片。

繼續閱讀

Janitor AI 原始長回覆與縮短回覆的對照
如何讓 Janitor AI 回覆變短
同一位寫實角色以不同表情、服裝和場景呈現
如何在 AI 影片中保持角色一致|短劇、動漫 MV 與廣告指南
用商品參考圖片製作 AI 商品宣傳影片的工作流程
AI 產品影片製作教學|用商品圖片生成 30 秒廣告