• 【超完整懶人包】認識比特幣!原理與應用全面解析|動區新手村
  • Account
  • Account
  • BlockTempo Beginner – 動區新手村
  • Change Password
  • Forgot Password?
  • Home 3
  • Login
  • Login
  • Logout
  • Members
  • Password Reset
  • Register
  • Register
  • Reset Password
  • User
  • 不只加密貨幣,談談那些你不知道的區塊鏈應用|動區新手村
  • 動區動趨 BlockTempo – 最有影響力的區塊鏈新聞媒體 (比特幣, 加密貨幣)
  • 所有文章
  • 最完整的「區塊鏈入門懶人包」|動區新手村
  • 服務條款 (Terms of Use)
  • 關於 BlockTempo
  • 隱私政策政策頁面 / Privacy Policy
動區動趨-最具影響力的區塊鏈新聞媒體
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
  • 登入
No Result
View All Result
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
  • 登入
No Result
View All Result
動區動趨-最具影響力的區塊鏈新聞媒體
No Result
View All Result
Home 區塊鏈商業應用 AI

豆包 Seed Audio 1.0 上線:人聲+配樂+環境聲一步生成

Token 形上學 by Token 形上學
2026-07-22
in AI, 中國
A A
36
SHARES
分享至Facebook分享至Twitter

字節跳動旗下豆包團隊本週正式發表音訊生成模型 Seed Audio 1.0,同步上線火山方舟體驗中心開放創作者測試。這款模型把人聲、配樂、音效、環境聲視為同一個聲音場景,一次生成長達 2 分鐘、支援 20 餘種語言的完整音軌。
(前情提要:字節跳動發布AI模型「OmniHuman-1」:讓黃仁勳變Rapper、泰勒絲唱日文歌,網讚超逼真)
(背景補充:字節跳動首創「豆包股」!發行獨立期權防堵騰訊挖角,打響 AI 人才保衛戰)

本文目錄

Toggle
  • 從念稿子到搭場景
  • 為什麼要把聲音拆開重新看待
  • ElevenLabs 的三步,豆包的一步

 

字節跳動旗下豆包本週正式發表 Seed Audio 1.0,也叫豆包音訊生成模型 1.0,同步上線火山方舟體驗中心開放創作者測試,企業端 API 也一起邀測。

過去做一段配音,人聲、配樂、音效通常得分開錄、分開對時間軸,最後才在剪輯軟體裡手動拼在一起。這次豆包想做的,是讓一次推理就把整個聲音場景生出來,人不用再當中間的接線生。

個人用戶可以在火山方舟體驗中心直接上手,國際開發者則透過 BytePlus 接入,這個模型也已經整合進豆包 app 本身。

從念稿子到搭場景

Seed Audio 1.0 不是傳統的 TTS。TTS 是文字轉語音,簡單來說就是把一段文字唸出來;而 Seed Audio 1.0 把人聲、背景音樂、音效、環境聲都當成同一個聲音場景裡的元素,對映進一個統一的聲學表徵。

簡單來說就是,模型不是分開處理誰在說話跟背景在放什麼,而是把整個場景當一件事一起生出來。

它支援零樣本(zero-shot)多模態參考,簡單來說就是,不用重新訓練,丟一段文字或一段音訊當範例,模型就能模仿那個聲音的音色與風格。一條提示詞可以同時安排多角色對白、背景音樂與擬音特效,擬音也就是配音圈說的音效;就算生成的音訊拉長到將近 2 分鐘,裡面好幾個角色的音色也不會中途走調。

時間軸的控制精度到 100 毫秒,對白什麼時候開口、音效什麼時候進場,都能卡得很準。語言支援超過 20 種,中文、英語、日語都在裡面,音色和風格也可以分開調,不必為了換一種說話方式重新換一個聲音。

這套能力對應的是影視級音訊創作,涵蓋配音、配樂、擬音、混音等環節,也延伸到有聲書、廣播劇、Podcast、短影音、遊戲與互動媒體,等於把過去需要一整組後期團隊分工的活,收攏到一個模型裡。

為什麼要把聲音拆開重新看待

過去語音生成的思路,通常是把任務拆成好幾條線:語音合成一條、配樂一條、音效一條,各自訓練、各自輸出,用戶再自己把它們對在同一條時間軸上。

Seed Audio 1.0 的邏輯反過來,先把所有聲音元素放進同一個表徵空間,再一次生成。這麼做的好處,是角色之間的音色、場景裡的音樂與音效,天生就是同步的,不用事後校準。

ElevenLabs 的三步,豆包的一步

拿 ElevenLabs 的 Studio 對照最清楚。ElevenLabs 的做法是語音、音樂、音效三個獨立 API,各自生成,用戶要自己在時間軸上拼接對齊;豆包想用一次推理取代這幾個環節。

價格上,ElevenLabs Pro 一個月要 99 美元,豆包走火山引擎的 token 計費,也就是按用量算錢,在中文場景下成本明顯更低。

配音、配樂、音效,過去是三個工種,三套軟體,三次匯出。Seed Audio 1.0 想證明的是,這些工序可以壓進同一次推理裡完成。

至於它能不能真的取代影視配音、有聲書、Podcast 這些場景裡的專業分工,就創作者用了之後怎麼說。

加入動區 Telegram 頻道

📍相關報導📍

字節跳動 Seedance 2.5 發布:升級 30 秒影片+50 份參考,推出合規版權模板 首波合作周星馳

馬斯克大讚 Seedance 2.0「AI影片發展太快」!字節跳動認為模型不夠完美

TikTok母公司字節跳動豪擲 230 億美元!計劃在 2026 年搶下 AI 生存權

Tags: ElevenLabsTikTok字節跳動豆包阿里巴巴


關於我們

動區動趨

為您帶來最即時最全面
區塊鏈世界脈動剖析
之動感新聞站

訂閱我們的最新消息

動區精選-為您整理一週間的國際動態

戰略夥伴

Foresight Ventures Foresight News MEXC

主題分類

  • 關於 BlockTempo

動區動趨 BlockTempo © All Rights Reserved.

No Result
View All Result
  • 所有文章
  • 搶先看
  • 市場脈動
  • 商業應用
  • 區塊鏈新手教學
  • 區塊鏈技術
  • 數據洞察
  • 政府法規
  • RootData
  • 登入

動區動趨 BlockTempo © All Rights Reserved.