jumpcutter
⏩ 自動快轉句子之間的長停頓 — 讓講課影片觀看速度提升約 1.5 倍(瀏覽器擴充功能)
比較 217 款經過品質篩選的 語音與音訊工具,參考公開熱門度、活躍度、授權與資料來源。
瀏覽經品質篩選的 語音與音訊工具,可依資料來源、收費方式或新舊程度縮小範圍,更快找到合適選項。
⏩ 自動快轉句子之間的長停頓 — 讓講課影片觀看速度提升約 1.5 倍(瀏覽器擴充功能)
🎩 一個用於透過 OpenAI Chat API 與 GPT 模型互動的 Alfred 5 工作流程 🤖💬 它還支援圖片生成/編輯/理解 🖼️、語音轉文字轉換 🎤 以及文字轉語音合成 🔈
MCP 外掛程式 for Unreal Engine 5.7 & 5.8 — 賦予 AI 助手對 Blueprints、Materials、Niagara、Animation、Mesh、AI、GAS、Logic Driver、C 的完整讀寫存取權限
飛快速度、裝置端處理、多語言、準確的 TTS(文字轉語音)引擎。
採用 C# 撰寫、基於 ONNX Runtime 的高速本機 TTS 推理引擎。支援多說話者、多平台與多語言。 透過隨插即用的方式整合至您的 .NET 專案。
video-SALMONN 2 是一個強大的音視覺大型語言模型(LLM),能生成高品質的音視覺影片字幕,由清華大學電子工程系與字節跳動共同開發。
自訂 TTS 元件,適用於 Home Assistant。利用 OpenAI 語音引擎或任何相容端點,提供高品質語音合成。可選用提示音與音訊正規化功能。
Hermes Agent 可攜式桌面版 (Windows) — 100 種工具、圖形介面、LM Studio 本機模型、語音合成、音樂、ComfyUI、工作流程、工具建立器。免安裝、免 Docker。
超快速、裝置端、多語言 TTS
適用於 Linux、macOS、Windows、Android 及 iOS 的開源語音轉文字與語音輸入工具精選清單。支援離線、本機與雲端。
全功能 DAW、DJ 與 VJ 應用程式,可與 Ableton、Reaper、Resolume 等軟體互通。支援 Stable Audio 3、Magenta RT2、Suno API、Chimera 音軌融合、Demucs 分軌、MIDI 生成與記譜、圖像轉頻譜轉音樂、繪畫轉音樂、VST3 與 .gan 外掛、自動混
Jarvis 為你的程式碼代理而生 — Claude Code、Codex、OpenClaw、Hermes 及任何 AI 工作流程的語音層。你的代理會說話;你可以免持回話。
一個高效能語音轉文字(STT)與文字轉語音(TTS)處理的通用 AI 工具包,專為低延遲與簡易模型整合而設計。
基於 OpenAI GPT 的資訊型有聲書/播客 MP3 產生器
這個機器人從 Telegram 聊天室或群組抓取新訊息,並將其放入本機的 Obsidian 筆記庫中。
一個強大的開源音訊分析與播放工具組。驗證無損品質、偵測AI生成的曲目,並使用內建高解析播放器與進階等化器探索您的音樂庫。支援 h
開源、自托管的AI語言學習平台,搭配本地或雲端LLM、CEFR學習計畫、AI導師、語音對話、單字卡與間隔重複。
Windows 專用免費離線 AI 影片配音工作室 — 語音克隆、翻譯、字幕與螢幕文字在地化。100% 本地執行,單一原生 .exe,無需 Python
可程式化的語音 AI 平台:SIP 與 WebRTC 通話控制、多方混音、錄音、TTS/STT,以及可插拔的 AI 代理(ElevenLabs、VAPI、Pipecat、Deepgram)
即時運行完整的 3.96M 及 9.36M 文本轉波形模型。
在地化AI音樂工作室,整合ACE-Step 1.5與YuE2-3B於單一Vue介面——文字轉音樂生成、音軌分離、MIDI轉譜及LoRA微調
專為 AI 時代重新設計的 FFmpeg。React 圖形介面。自訂 AI 整合,包括 YOLOv8 物件與人臉偵測、Whisper、Vidi2.5。
用於自託管 Whisper 語音轉文字伺服器的 Docker 映像,具備說話者辨識以及與 OpenAI 相容的轉錄和翻譯 API。由 faste 提供支援。
提供更簡單、更有效率的方式,讓您的客戶透過語音信箱與您聯繫並表達需求。