VoiceStudio
VoiceStudio 是開源、完全本機的 ElevenLabs 替代方案 — 語音複製、語音設計、影片配音、聽寫、轉錄與有聲書製作
比較 217 款經過品質篩選的 語音與音訊工具,參考公開熱門度、活躍度、授權與資料來源。
瀏覽經品質篩選的 語音與音訊工具,可依資料來源、收費方式或新舊程度縮小範圍,更快找到合適選項。
VoiceStudio 是開源、完全本機的 ElevenLabs 替代方案 — 語音複製、語音設計、影片配音、聽寫、轉錄與有聲書製作
利用 AI 大模型和自動化工作流,根據主題或關鍵詞一鍵生成高畫質短影片。Generate HD short videos from a topic or keyword with an automated AI workflow.
YuE2: 前沿音樂生成,具備符號規劃、零樣本翻唱與代理式音樂編輯功能。
開放原始碼的對話式語音AI代理框架
使用開源模型建立語音代理
免費且注重隱私的螢幕錄影工具,無任何限制 🎥
用於語音代理、多模態應用和即時 AI 的開源框架。由 Daily 和社群維護。
ModelScope:將模型即服務(Model-as-a-Service)的概念化為現實。
ODS V3:將您的PC、Mac或Linux電腦轉變為AI伺服器。支援LLM推理、對話介面、語音、代理、工作流程、RAG及影像生成。
影片轉字幕、字幕翻譯、AI 配音與聲音克隆、字幕燒錄——免費開源的一站式桌面工具。基於 Whisper / FunASR 等本地模型離線語音轉文字,批次處理 + 全平台 GPU 加速,跨 Wind
全方位多模態評測工具組:涵蓋文字、影像、影片與音訊任務
簡單、高品質的語音轉換工具,專注於易用性與效能。
用於在網頁上建立影音播放器的UI元件和鉤子。穩定、可自訂且無障礙。JW Player和Video.js的現代替代方案。
一個整合 Gradio + React 的 WebUI,支援 ACE-Step、OmniVoice、Kimi Audio、Piper TTS、GPT-SoVITS、CosyVoice、XTTSv2、DIA、Kokoro、OpenVoice、ParlerTTS、Stable Audio、MMS、StyleTTS2、MAG
一個全功能、純 C++ 的音訊模型推理引擎,基於 ggml。支援 TTS、STT、VAD、語音轉換、音樂生成等,並具有高度優化的效能。
音訊訊號處理的資料操作與轉換,由 PyTorch 驅動
一個即時語音運行時,讓AI代理持續對話、運作並保持存在。適用於AI代理的即時語音運行時。
OpenVidu Platform:自架即時影音服務,適用於您的應用程式,建構於 LiveKit 與 mediasoup 之上
模型壓縮工具包,專為提升易用性、全面性和效率而設計。
SALMONN 系列:一套先進的多模態大型語言模型
支援長篇多說話者對話合成的多語言模型,具備靈活的說話者控制與零樣本語音複製功能
處理機器學習專案中多模態資料的工具。
當今 Android 上最先進、完全離線的客戶端 AI 套件。
🎙️ 智慧語音生產力助手,將語音轉換為清晰文字、實用操作與結構化知識,協助使用者捕捉靈感、自然溝通、自動化重複任務,並在各種應用與工作流程中保持高效。