智通財經APP獲悉,英偉達(NVDA.US) 推出了一款用於生成音樂和音頻的新型人工智能(AI)模型,旨在為製作音樂、電影和視頻遊戲的人們提供服務。
根據英偉達的説法,這款模型名為Fugatto(Foundational Generative Audio Transformer
Opus),可以使用任何文本和音頻文件來生成或修改音樂和聲音。
例如,該模型可以根據文本提示創建音樂片段,從現有歌曲中刪除或添加樂器,改變聲音中的口音或情緒,甚至發出從未聽過的聲音。
英偉達應用音頻研究經理、管絃樂隊指揮兼作曲家Rafael Valle表示:“我們希望創建一個能像人類一樣理解和產生聲音的模型。”
英偉達指出,廣告代理商可以使用Fugatto快速定位多個地區的現有廣告,並在配音中加入不同的口音和情感。此外,視頻遊戲開發者可以使用人工智能模型修改遊戲中預先錄製的資產,以適應用户在玩遊戲時不斷變化的動作。
Fugatto可以使小號發出狗吠聲或薩克斯管發出喵喵聲。該公司補充説,通過微調和少量的歌唱數據,研究人員發現它可以處理未經預先訓練的任務,比如從文本中生成高質量的歌聲。
英偉達表示,Fugatto的完整版本使用了25億個參數,並在包含32個Nvidia H100 Tensor Core GPU的Nvidia
DGX系統上進行了訓練。該模型的整體工作耗時一年多。
Fugatto可能會與Runway等初創公司以及 Meta Platforms(META.US) 等大公司的類似技術展開競爭。10月,Meta
發佈了名為Movie Gen的人工智能模型,該模型可以根據用户提示創建逼真的視頻和音頻剪輯。
今年 2
月,ChatGPT製造商OpenAI推出了Sora,它可以根據文本指令創建逼真且富有想象力的場景。這家由微軟(MSFT.US) 支持的公司尚未向公眾發佈文本轉視頻模型。
(美股為即時串流報價; OTC市場股票除外,資料延遲最少15分鐘。)新聞來源 (不包括新聞圖片): 智通財經