最近 X 上一張「黃果 AI 短劇製作流水線(逆向推測版)」在社群瘋傳,作者交叉比對後,總結出「雙軌模型」技術假說、五條可證偽預測、成本真相,以及刑事法律的紅線。本文整理、編譯自 X 帳號王大锤。
(前情提要:「黃果短劇」AI 成人短片平台爆紅中文圈,「關掉過濾器」成付費賣點 )
(背景補充:AI 殺死短劇》中國橫店改賣遊客「一日演員夢」:人人能當霸總&灰姑娘,宮鬥、武俠劇樣樣有 )
AI 短劇看起來是「一鍵生成」,拆開發現是 13 道工序、500 次廢片、人工精修佔了 40% 工時。我把一部 8 分鐘成片的 117 個鏡頭逐幀扒了一遍,寫了份萬字驗屍報告。本文基於公開資訊的獨立分析,所有判斷均為推測,歡迎製作方勘誤。
先說這張圖做對了什麼
最近在 AI 短劇圈子裡流傳著一張製作流水線圖,標題是《AI 短劇〈黃果〉製作流水線(逆向推測版)》。作者做了扎實的工作:對一部 8 分鐘、117 個鏡頭的成片做了逐幀分析,檢測出 24fps→30fps 的補幀痕跡,繪製了完整的 13 步工序流程圖,還給出了硬體配置建議。
這張圖在技術社群引發了不少討論。但當我自己去搜黃果短劇的公開資訊、交叉比對各個影片生成模型的技術參數之後,發現這張圖至少有三個關鍵判斷需要修正。有些不是「錯了」,而是「證據不夠就下了結論」。
以下是結合 Claude 的分析。
第一槍:黃果不是一部劇,是一個平台
這張圖犯了一個前提性的錯誤:它把「黃果」當成一部具體作品來拆解,畫出一條線性的 13 步流水線。但黃果短劇(huangguoai.com)實際上是一個多創作者投稿制的內容分發平台。
證據很直接。黃果在自己的 Telegram 官方頻道和招募頁面上明確寫著:
「現面向全球招募簽約創作者。無論您是成熟的 AI 導演、編劇,還是腦洞大開的視覺藝術家,只要您的作品符合我們的標準,我們就統統收購。」
他們的商業模式是:平台方提供分發管道(官網 + Telegram + TikTok)、提供「破限模型」的使用權,創作者負責製作內容,平台方收購版權。
這意味著什麼?意味著黃果上的不同短劇,很可能來自不同的創作者或小團隊,使用不同的模型、不同的工作流、不同的畫質標準。你不能從一部劇的逐幀分析推導出「黃果的製作流水線」,因為根本不存在一條統一的流水線。
換句話說,那張圖畫的可能是黃果上某一部特定作品的製作流程,但把它標題寫成「《黃果》製作流水線」,等於把一個樣本的特徵當成了總體的特徵。
黃果更像是 AI 短劇界的 YouTube,而不是 Netflix。Netflix 有統一的製作標準和內部流程,YouTube 上每個頻道各搞各的。當你要分析 YouTube 的「製作流水線」,正確的做法不是拆一個影片就下結論,而是要看平台層面的共性基礎設施是什麼。
對黃果來說,這個共性基礎設施就是「破限模型」。後面會展開。
第二槍:24fps 不等於 Wan,Seedance 也是 24fps
那張圖裡最硬的一條技術論證是:成片封裝幀率 30fps,但逐幀檢測發現每 5 幀有 1 幀重複,是典型的 24→30 pulldown 痕跡。然後結論是:24fps 原生輸出 → 指向 Wan 2.1 / 2.2。
這條推理鏈的前半段沒問題。24→30fps 的補幀痕跡確實能證明原始素材不是 30fps 生成的。但後半段的結論跳得太快了。
因為不只是 Wan 輸出 24fps。
我交叉比對了 2026 年主流影片生成模型的原生輸出幀率:
關鍵數據:Seedance 1.0 Pro 的輸出同樣是 24fps。ByteDance 的技術文件明確標註其輸出為「up to 1080p at 24 fps, with durations from 2 to 12 seconds」。
也就是說,「24fps 痕跡」這條證據,同時指向 Wan 和 Seedance 兩個模型家族,無法單獨鎖定 Wan。
那張圖給出的其他間接證據(鏡頭長度分布、一致性漂移特徵、I2V 啟動感)也不具有排他性。72% 的鏡頭在 5 秒以內這個分布,和 Seedance 1.0 的「2-12 秒」生成窗口同樣吻合。一致性漂移在所有當前模型中都存在程度不同的問題。I2V 的「啟動感」是所有 Image-to-Video 管線的共性特徵,不是 Wan 獨有的。
更有意思的是,Kling 的原生幀率是 30fps 以上(2.6 版本是 30-48fps,3.0 版本是 60fps)。如果黃果的某些作品裡檢測到了 24→30 的補幀痕跡,那至少可以排除這些鏡頭是用 Kling 直接生成的,因為 Kling 輸出本身就是 30fps+,不需要做 pulldown。
所以更合理的推斷是:
黃果平台上的創作者大概率混用多種模型。Kling 用於不需要破限的常規鏡頭(30fps 直出),Wan 或 Seedance 用於需要更多客製化控制的鏡頭(24fps 生成後統一上 30fps 時間線)。而「破限內容」幾乎必然依賴開源模型(Wan),因為閉源 API 不可能允許你微調出 NSFW 內容。
這就引出了第三個修正。
第三槍:真正的護城河不是 13 步工序,是「破限模型」
那張圖的 13 步流水線把成人內容的處理放在了第 8 步,標題是「成人鏡頭處理(成人向微調 / LoRA)」,輕描淡寫地歸入了工序流程裡。
但從黃果的商業邏輯來看,這不是 13 步中的一步。這是整個商業模式的核心。
黃果的創作者招募貼文裡有一句話特別關鍵:「為優質創作者有償提供破限模型的使用權,讓您的每一滴靈感完美落地。」
「有償提供破限模型使用權」,這句話包含了幾層資訊:
第一,破限模型是平台方的資產,不是創作者自己煉的。 黃果作為平台方,投入資源訓練或維護這些模型,然後以工具使用權的形式提供給簽約創作者。這是一種「基礎設施即服務」的模式。
第二,這些模型是在開源底模上微調的。 要生成閉源商用 API(如 Seedance 或 Kling)不允許的內容,你必須用自己的資料微調自己的模型。這只有開源模型才能做到。在當前(2026 年 8 月)的開源生態裡,最適合做影片生成微調的底模就是 Wan 2.2(Apache 2.0 授權,14B 參數量的 MoE 架構,社群已有成熟的 LoRA 訓練流程)。
第三,這才是黃果相對於個人創作者的真正壁壘。 個人創作者可以用 Kling API 或 Seedance API 生成常規內容,但要生成「破限」內容,需要自己收集資料集、訓練 LoRA、維護模型版本,這些工作的門檻遠高於「會寫提示詞」。黃果把這個門檻打包成了平台服務。
所以如果要畫一張更準確的「黃果商業架構圖」,不應該是一條線性的 13 步流水線,而是一個分層結構:
- 底層: 破限模型(平台方持有,基於 Wan 微調,包含角色 LoRA 庫和場景預設)
- 中層: 創作者工具鏈(各創作者自選,Kling / Seedance / Wan 混用,各自的後期流程)
- 上層: 分發與變現(官網 + Telegram + TikTok,廣告 + 訂閱 + 版權收購)
那張圖畫的是中層,而且只畫了一個創作者的中層。真正決定黃果是黃果、而不是「又一個 AI 短劇帳號」的,是底層和上層。
從底模倒推回來:一個更合理的技術假說
綜合以上三個修正,我重新建構一個關於黃果短劇技術棧的假說。強調一下,這仍然是推測,但是基於更多公開資訊的、更審慎的推測。
假說:雙軌模型 + 後期統一
常規鏡頭(非 NSFW): 創作者使用 Kling 或 Seedance 的商業 API 生成。這些 API 有成熟的角色一致性工具(Kling 的 Elements 功能支援最多 4 張參考圖鎖定角色),生成品質高、速度快、不需要本地算力。對話鏡頭可以利用 Seedance 1.5 的原生口型同步功能,省掉後期 Lip-sync 的工序。
破限鏡頭(NSFW): 使用平台方提供的、基於 Wan 2.2 微調的本地模型。這些模型經過 NSFW 資料集的 LoRA 訓練,能生成商業 API 不允許的內容。需要本地 GPU 算力,推理速度較慢,但在自有硬體上跑沒有內容審核限制。
後期統一: 兩軌鏡頭在後期階段匯合。Kling 原生 30fps+ 的鏡頭和 Wan / Seedance 原生 24fps 的鏡頭,統一轉換到 30fps 時間線上。這就解釋了為什麼逐幀檢測時,部分鏡頭有 24→30 的補幀痕跡,而另一些鏡頭沒有。如果所有鏡頭都是同一個模型生成的,補幀痕跡應該均勻分布;但如果是混用模型,痕跡分布就會不均勻。
這個假說比「全部用 Wan」更能解釋已知的證據:
- 為什麼黃果招募貼文寫的是 Seedance 和 Kling 而不是 Wan → 因為常規鏡頭確實用這些
- 為什麼存在 24fps 補幀痕跡 → 因為破限鏡頭用的是 Wan(24fps 輸出)
- 為什麼不同鏡頭的畫質有時不一致 → 因為不同鏡頭可能來自不同模型
- 為什麼黃果要「有償提供」破限模型 → 因為這是閉源 API 做不到的能力
2026 年 8 月主流影片生成模型全參數對比
要驗證「雙軌假說」,必須先把每個模型的硬參數攤開看。以下數據來自各模型官方文件和第三方基準測試:
這張表裡最關鍵的一列是「可否自訂微調」。只有 Wan 2.2 允許你用自己的資料集訓練 LoRA。所有閉源 API 都有內容安全審核,不可能讓你微調出 NSFW 模型。這一條就鎖死了破限內容的底模選擇範圍。
另一個值得注意的點是「原生音訊」。Kling 2.6+ 和 Seedance 1.5+ 都支援影片和音訊同步生成,這在對話密集型短劇中是巨大的效率優勢。傳統流程需要先生成無聲影片,再單獨做 TTS,再做口型同步,至少三步。有原生音訊的模型一步到位。
這進一步支持了「常規鏡頭用閉源 API」的假說,因為創作者沒有理由放棄這個效率優勢。
五條可證偽的預測
一個好的假說必須可以被證偽。以下是「雙軌模型假說」的五條可檢驗預測,任何人拿到成片都可以驗證:
預測 1:補幀痕跡分布不均勻。 如果逐鏡頭標記 24→30 補幀痕跡的有無,NSFW 鏡頭中出現補幀痕跡的比例應顯著高於非 NSFW 鏡頭。因為 NSFW 鏡頭用的 Wan 是 24fps 輸出,非 NSFW 鏡頭如果用 Kling(30fps+)則無需補幀。
預測 2:非 NSFW 鏡頭的解析度天花板更高。 Kling 3.0 支援原生 4K,Wan 2.2 上限是 720p。在 100% 縮放下對比不同鏡頭的細節銳度,非 NSFW 鏡頭(可能用 Kling)應該比 NSFW 鏡頭(可能用 Wan)更清晰。
預測 3:對話鏡頭的口型同步品質兩極分化。 使用 Seedance / Kling 原生音訊管線的對話鏡頭,口型同步應該流暢自然。使用 Wan + 後期 Lip-sync 的對話鏡頭,可能存在嘴型與語音的微小延遲或不匹配。
預測 4:運動流暢度存在系統性差異。 Kling 3.0 / 3.5 在 60fps 下生成的運動非常流暢,即使下轉到 30fps 時間線也保留了較好的運動資訊。Wan 24fps 生成的運動在快速動作時會出現更明顯的頓挫感。逐鏡頭對比運動流暢度,應該能分出兩組。
預測 5:同一角色在不同類型鏡頭中的一致性漂移方向不同。 Kling 的 Elements(參考圖鎖定)和 Wan 的 LoRA(微調鎖定)在一致性上的失敗模式不同。Kling 傾向於保持面部但丟失體態細節,LoRA 傾向於保持整體風格但在極端角度下面部偏移。如果在同一部劇裡觀察到兩種不同的漂移模式,就是混用模型的直接證據。
以上五條,任何一條被證實都會增強雙軌假說的可信度;任何一條被明確否定(比如所有鏡頭的補幀痕跡完全均勻),都會削弱它。
那張圖裡仍然有價值的部分
批評完三個判斷,也要說說那張圖做得好的地方。以下幾點對任何想理解 AI 短劇工業化的人都有參考價值。
鏡頭密度分析
117 個鏡頭 / 8 分鐘 = 平均每個鏡頭 4.1 秒,中位數 3.2 秒。這個數據本身比任何定性討論都更有說服力。它直接量化了「AI 短劇為什麼看起來節奏那麼快」的原因:不是導演喜歡快切,是模型單次生成時長上限在 5-8 秒,逼得你只能快切。
傳統短劇同時長約 40-60 個鏡頭,AI 短劇翻了一倍。這個倍數差異會隨著模型進化(更長的單次生成時長)逐步縮小,但在 2026 年,它仍然是區分 AI 短劇和真人短劇的一個硬指標。
「資產層」的概念
圖裡把工序 1-3(劇本分鏡、角色 LoRA、場景模板庫)歸為「資產層」,這個分類方式很有洞察力。它指出了一個被大多數入門者忽略的事實:AI 短劇的核心競爭力不是寫提示詞的能力,而是建資產庫的能力。
角色 LoRA、場景模板、風格預設,這些都是可以跨專案復用的數位資產。一個團隊做過 10 部劇之後累積下來的資產庫,和一個新手從零開始的體驗完全不同。資產庫越厚,每部新劇的邊際成本越低。
這也解釋了為什麼黃果要做平台而不是做內容工作室。如果你有一套好用的破限模型資產庫,自己做劇的產能是線性的(人力瓶頸),但把資產庫開放給多個創作者,產能就變成了乘數關係。
人工精修占比的判斷
圖裡暗示人工精修(修手、修臉、修服裝、修五官)占總工時的 40% 以上。這個判斷和產業公開數據高度一致。根據產業調研報告,角色一致性是 AI 短劇製作中最大的技術痛點,76% 的創作者把它列為首要挑戰。
即使到了 2026 年 8 月,模型在手部生成、面部一致性、服裝穩定性上仍然需要大量人工收尾補救。角色一致性的解決方案已經演進到了第三代(PuLID + ADetailer + ControlNet + IP-Adapter FaceID 組合使用),一致性可達 95%,但那 5% 的不一致在連續剪輯中仍然會被觀眾捕捉到。
模型在進步,但精修的工時縮不到零。縮減的是精修的密度,不是精修本身的存在。
成本真相:比你以為的便宜,但沒有某些人吹的那麼便宜
產業數據給出了一些可參考的成本基準:
- 搞笑表情包類 AI 漫劇:每分鐘 50-150 元
- 精細 AI 漫劇:每分鐘 1000-3000 元
- AI 擬真人短劇(黃果這個品類):成本比漫劇高約 30%
- 精品 AI 擬真人短劇全劇:可控制在 20 萬元以內
- 傳統真人短劇同等時長:50-150 萬元
降幅超過 90%。這是真實的數據。
但有一個關鍵變數是產能。2026 年春節檔有一個公開案例:3 人團隊用 5 天完成了 75 集 AI 漫劇《氣運三角洲》的全流程製作,上線 16 小時播放量破億。
這種效率意味著什麼?意味著成本的大頭不是算力,不是模型調用費用,而是人力的時間成本。如果一個創作者一週能產出一部,月收入只要覆蓋人力成本和算力租賃就能跑正。
黃果的模式更進一步降低了創作者的啟動門檻:你不需要自己煉破限模型(平台提供),不需要自己搞分發管道(平台提供),你只需要有分鏡能力 + 模型操作能力 + 後期剪輯能力。這把「一個人做一部 AI 短劇」從理論上的可能變成了實際可執行的事情。
法律風險:不是「灰色地帶」,是實打實的刑事紅線
寫到這裡必須把風險講清楚。黃果短劇的內容性質決定了它不是在灰色地帶打擦邊球,而是在明確的法律紅線附近操作。
製作傳播淫穢物品牟利罪(刑法第 363 條)。 以牟利為目的製作、複製、出版、販賣、傳播淫穢物品的,處三年以下有期徒刑、拘役或者管制,並處罰金。情節嚴重的,三年以上十年以下。AI 生成的淫穢內容在司法實踐中已被認定屬於「淫穢物品」,不因「非真人」而豁免。
深度偽造與肖像權。 如果角色 LoRA 使用了真人面部數據訓練而未獲授權,涉嫌侵犯肖像權(民法典第 1019 條)。如果用於製作淫穢內容,可能觸犯多項刑事法規。
平台運營風險。 黃果的伺服器和域名目前在境外,但中國刑法對中國公民有屬人管轄權。如果運營者或創作者是中國公民,即使伺服器在境外,仍可能被追訴。
黃果自身的定位也很有意思:他們用了「huangguoai.com」「huangguoai.ai」等多個域名,Telegram 群組作為主要社群,TikTok 作為引流管道。這種分散式的域名和管道策略,本身就暗示了對合規風險的主動規避。
對於創作者來說,需要非常清醒地認識到:為黃果供稿和自己在自媒體平台發擦邊影片是完全不同量級的法律風險。前者是有組織的內容生產和分發,後者可能只是個人行為。
遷移價值:拋開內容看工藝
拋開黃果的內容屬性,其背後驗證過的工藝能力對合規賽道有直接的遷移價值。
核心可遷移能力有三項:
多模型混用的工程能力。 在不同環節使用不同模型(Kling 做常規鏡頭,Seedance 做口型同步,Wan 做需要深度客製的鏡頭),然後在後期統一風格和幀率。這種「最佳模型選路」的能力,在品牌 TVC、知識短劇、文旅宣傳片等合規場景中同樣適用。
角色資產管理。 訓練和維護角色 LoRA、建立場景模板庫、管理跨鏡頭一致性。這套資產管理方法論不依賴於內容是否合規,它解決的是所有 AI 影像工業化都面臨的一致性問題。
QC 驗收標準。 「什麼樣的鏡頭可以過、什麼樣的必須重做」。有了這套標準,才能把個人創作變成可規模化的生產。黃果作為平台方在收購內容時必然有一套內部品質檢驗標準,這套標準本身就是有價值的方法論資產。
具體應用場景不展開了,和產業報告裡列的大同小異:品牌廣告、知識科普、有聲書視覺化、企業培訓、文旅宣傳。唯一想補充的是,同一條工藝遷移到合規賽道後,最大的變化不是去掉第 8 步(NSFW 內容),而是加上內容審核和版權合規這兩個新工序。這兩個工序在灰色內容生產中不存在,但在合規生產中是成本和時間的大頭。
結語:分析框架比結論重要
這篇文章花了大量篇幅質疑一張流傳甚廣的流水線圖,這不是因為那張圖沒有價值,恰恰相反,它是目前我看到的對 AI 短劇製作流程最詳細的公開分析。
但好的分析框架應該經得起交叉驗證。當我拿著那張圖的結論去對照黃果的公開資訊、對照各模型的技術參數、對照產業數據時,發現了三個需要修正的判斷。這些修正不是推翻了原圖,而是讓推理變得更審慎。
AI 短劇在 2026 年正處於一個特殊的階段。模型能力在快速進化(從 Wan 2.2 的 720p / 24fps 到 Kling 3.5 的原生 1080p / 60fps,中間只隔了幾個月),工業化流程在快速迭代(從一個人做一切到平台化分工),商業模式在快速試錯(從免費引流到訂閱付費到版權收購)。
在這種高速變化的環境中,具體的結論保存期限很短(這篇文章的數據在發布一個月後可能就過時了),但分析框架可以復用:逐幀檢測驗證幀率、交叉比對模型參數排除替代解釋、區分平台層和創作者層的不同邏輯、從商業模式倒推技術選型。
這套方法論,比「它用的是 Wan 還是 Kling」這個具體答案,有用得多。
本文分析基於 2026 年 8 月的公開資訊。AI 影片生成領域迭代速度極快,文中涉及的模型能力、成本數據在發布時可能已有變化。
原文》王大锤
📍相關報導📍
AI 殺死短劇》中國橫店改賣遊客「一日演員夢」:人人能當霸總&灰姑娘,宮鬥、武俠劇樣樣有

