Skip to content
buxukuPublic

About

视频转字幕、字幕翻译、AI 配音与声音克隆、字幕烧录——免费开源的一站式桌面工具。基于 Whisper / FunASR 等本地模型离线语音转文字,批量处理 + 全平台 GPU 加速,跨 Windows / macOS / Linux。Free, open-source desktop app to generate, translate, dub & burn video subtitles — local Whisper speech-to-text, AI dubbing & voice cloning, offline, GPU-accelerated.

Topics

Resources

Code of conduct

Stars

5.6k stars

Watchers

28 watching

Forks

Latest commit

 

History

528 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

SmartSub

妙幕 / SmartSub

视频转字幕、字幕翻译、AI 创作助手、AI 配音与声音克隆、字幕烧录、MCP/CLI 自动化——一站式开源桌面工具

让每一帧画面都能美妙地表达

buxuku%2FSmartSub | Trendshift buxuku%2FSmartSub | Trendshift

Release Downloads Platform License

中文 | English | 日本語

下载安装 · 功能特性 · AI 助手与自动化 · 免费方案 · 常见问题 · 更新日志

SmartSub 主界面

妙幕是什么

妙幕(SmartSub)是一款开源的音视频字幕与配音工具,把「语音转文字 → 字幕翻译 → 校对润色 → TTS 配音 → 烧录合成」整条流水线装进一个桌面应用,还内置在线视频下载,粘贴 B 站 / YouTube 等平台链接即可直接取材。转写基于 whisper.cpp、sherpa-onnx 等本地模型完成,文件不出本机;支持批量处理,支持 NVIDIA / AMD / Intel / Apple Silicon 硬件加速,可在 Windows、macOS、Linux 上运行。

妙幕深度融合了现代 AI 协同与 Agentic 自动化能力:

  • 内置 AI 创作助手(智能副驾):随时按快捷键呼出,具备全工作台上下文感知、多模态视觉截图诊断、实时字幕润色与自主工具调用(Agentic Tool-Calling)能力,用自然语言即可驱动复杂操作;
  • MCP 与 CLI 命令行自动化:深度支持 Model Context Protocol(提供 111 个标准工具与对应 CLI 命令),内置 Electron/Node 运行时免配环境,不仅可让 Cursor、Claude Code、Codex 等外部 AI 智能体直接调度,还能在终端脚本与 CI 中全自动化执行流水线。

整条流水线可以完全免费跑通:本地模型转写、内置免费翻译源、本地 TTS 配音(含声音克隆)、本地 ffmpeg 烧录——不需要 API Key,本地环节也没有用量限制。同时可按需接入 20 个翻译服务、9 家云端听写、6 类云端配音服务作为增强。

它能帮你做什么

你想做的事 妙幕的做法
用自然语言搞定字幕编辑与排障 随时呼出内置 AI 助手,上下文感知与多模态截图诊断,一句话润色、改口语化或自动下发任务
让 Cursor / Claude / 脚本接管音视频流水线 借助 111 个 MCP 工具与 CLI 命令,外部 AI Agent 或终端脚本直接全自动批量转写、翻译、配音与合成
看无字幕的外语视频、公开课 拖入视频,本地转写并翻译,得到双语字幕,播放器直接挂载
给 B 站 / YouTube 在线视频配字幕 粘贴链接应用内直接下载,官方字幕自动配对,无需第三方下载工具
做视频出海 / 多语言内容 字幕翻译成目标语言,再用 TTS 配成外语音轨,导出成品视频
用自己的声音给视频配音 录一段参考音频,零样本克隆音色,整条视频用你的声音朗读
整理播客、网课、会议录音 批量转写成 SRT 字幕文件,供剪辑、检索或存档
给成片压制字幕 校对台逐句核对后硬烧或软封装,样式所见即所得

功能特性

在线视频下载 / 本地音视频 → 转写 → 翻译 → 校对 → 配音 → 合成导出。每一步都可以独立使用,也可以串成流水线批量执行;更能通过内置 AI 创作助手实时对话协作,或通过 MCP / CLI 交由外部 AI 智能体全自动化调度。

🌟 AI 创作助手(智能副驾)

  • 随时唤起与多轮交互:顶部工具栏一键开启或按快捷键 ⌘J(macOS)/ Ctrl+J(Windows、Linux)随时呼出右侧抽屉面板,支持调整宽度,会话记录自动持久化保存在本地
  • 工作台深度上下文感知:智能感知当前界面状态,自动关联当前视频播放进度、选中的字幕单行、邻近上下文、任务列表运行状态与近期报错日志,无需反复手动交代背景
  • Agentic 自主工具调用:全面打通底层 111 个自动化工具!不仅能答疑解惑,更可根据自然语言指令直接代劳——如「把当前视频转成中英双语字幕并合成」、「查看我安装了哪些模型」、「排查刚才任务失败的原因」
  • 字幕精修与安全编辑:校对时直接说「把当前这句改得更口语化」、「解释这一段的专业术语」、「修正同音错字」,修改实时渲染在编辑器中并自动进入撤销/重做栈(支持快捷键随时撤回);严格版本保护,说「保存」才写入物理文件
  • 多模态视觉截图诊断:任务失败或参数不知如何配置?助手内置截屏工具,点击相机图标即可一键捕获当前工作区,结合视觉多模态大模型分析报错弹窗、Toast 提示与控件状态,秒级给出排查与修复方案
  • 多类型文件与媒体对话(File Chat):支持将音视频(MP4、MKV、MOV、MP3、WAV、FLAC 等)、字幕(SRT、VTT、ASS、LRC)、参考文稿(TXT、MD)及图片直接拖入对话框。音视频文件不上传云端,仅传递本地绝对路径给底层工具处理,兼具大模型智能与隐私安全
  • 主流大模型自由接入:支持 DeepSeek、通义千问 (Qwen)、Gemini、SiliconFlow、DeerAPI 及任意 OpenAI 兼容端点,支持流式回复与独立系统提示词。详见 AI 助手使用文档

⚡ MCP 协议与 CLI 命令行自动化(Agentic Automation)

  • 111 个标准 MCP 工具与对应 CLI 命令:无死角覆盖音视频下载、转写、翻译、校对、配音、音视频封装、格式转换、音频抽取以及模型与服务商配置等全链路能力,详见 操作参考文档
  • 免配置 Node.js 运行时(Zero-Config):直接复用应用自带的 Electron/Node 运行时,客户端用户和外部 AI 完全不需要额外安装 Node.js,开箱即用
  • 主流 AI 客户端一键打通:应用内「设置 → 连接 AI 工具(MCP)」提供一键导入 Cursor(支持官方 MCP 协议一键拉起)、一键复制 Codex 配置(TOML 格式)、Claude Code(一键注册)及通用客户端 JSON 配置,让各种 AI Agent 秒变音视频流水线总指挥
  • 无窗口后台守护(Headless Daemon):AI 工具或 CLI 首次调用时自动启动无界面后台常驻守护,与桌面客户端无缝共享任务状态、配置和模型资源,闲置自动回收,桌面打开无缝接入
  • 强大的 CLI 命令行与脚本批处理:提供 smartsub 统一命令行入口,支持复杂任务流水线一键编排(pipeline.run)、JSON / stdin 管道传参、任务状态轮询与去重机制,让音视频生产轻松融入 Shell 脚本与 CI/CD 自动化。详见 MCP 与 CLI 接入指南

在线视频下载

  • 粘贴链接即可下载 B 站、YouTube 等平台的在线视频,一行一条批量下载,可从混杂文本中自动识别链接
  • yt-dlp(YouTube 及 1800+ 站点)与 lux(B 站、抖音、小红书等国内平台)双引擎,按平台自动匹配,应用内一键安装 / 更新
  • 可同时下载平台官方字幕(含自动生成字幕),任务向导中自动配对——有官方字幕就无需再转写
  • 支持导入站点 Cookie(浏览器一键提取 / cookies.txt / 手动粘贴),解锁登录后可见的高清画质与会员内容,Cookie 仅保存在本地
  • 保存目录、清晰度(最佳 / 指定档位)、并发数可调,下载完成一键衔接转写 / 翻译任务

字幕生成(转写)

  • 多种视频 / 音频格式批量生成字幕,并发任务数可调
  • 8 类转写引擎逐任务切换:内置 whisper.cpp、faster-whisper、FunASR、Qwen3-ASR、FireRedASR、NVIDIA Parakeet、本地 Whisper CLI,以及免 GPU 的云端听写(9 家服务商)
  • 本地引擎完全离线,无需联网上传;中文场景可选 FunASR / FireRedASR,英语、欧洲语言与日语可选对应 Parakeet 模型
  • AI 字幕精修(可选):大模型语义断句 + 批量校正——断句按语义重组且时间轴仍精确到词(连接词不吊行尾、数字不被停顿劈开),校正修同音字、去语气词、规范标点;服务商默认跟随 AI 翻译配置(本地 Ollama 零成本),失败自动回退规则断句
  • 简繁转换、自定义字幕文件名(方便不同播放器挂载识别)、可选中文字幕去标点

字幕翻译

  • 20 个翻译服务:内置免费翻译(必应 / 谷歌免费接口,自动回退与限速)、百度、阿里云、腾讯、讯飞、火山引擎、豆包、小牛、DeepLX、Azure、Google,以及 Ollama(本地模型)、DeepSeek、Gemini、通义千问、SiliconFlow、Azure OpenAI、DeerAPI 等大模型服务
  • 兼容任意 OpenAI 风格 API,可接入自有服务
  • 输出纯译文,或「原文 + 译文」双语字幕
  • 每个 AI 服务可在界面直接配置自定义请求参数,支持导出导入,无需改代码

字幕校对

  • 内置校对台,逐句对照视频检查修改,定位精准
  • 撤销 / 重做,单条删除可恢复
  • AI 一键润色,并可随时呼出右侧 AI 助手进行对话式修改与答疑

🎙️ AI 助手与自动化协同

除了常规界面操作外,妙幕提供了强大的智能化副驾体验与开发者级自动化支持:

  • 实时协作(智能副驾):在校对、配音或任务页面遇到问题,随时呼出 AI 助手,自然语言对话即可直接修改当前字幕内容、排查任务失败原因或解答音视频术语。
  • 视觉排障(截屏多模态):遇到不会设置的参数或复杂的报错界面,点击相机图标截取工作台发送给模型,AI 即可看图定位问题并指导操作。
  • 外部 AI 与脚本调度(MCP & CLI):无需打开前端 UI,支持 Cursor、Claude Code、终端脚本通过标准 MCP 协议或 smartsub CLI 批量处理大规模音视频流水线。

TTS 配音与声音克隆

  • 独立配音工作台:一份字幕 + 可选视频,逐条语音合成并自动对齐时间轴
  • 本地引擎离线免费:Kokoro 多语 103 音色、VITS 中文 174 音色
  • 声音克隆:本地 ZipVoice 零样本克隆(一段参考音频即建即用),也支持火山引擎声音复刻 2.0、ElevenLabs 即时克隆
  • 云端服务:Edge TTS 免费档、OpenAI 兼容端点(OpenAI / 硅基流动等)、Azure Speech、火山引擎豆包、ElevenLabs、Xiaomi MiMo
  • 时间轴对齐:语速预控制、实测复核、静音间隙借用;超限行列入人工处理清单(改文案 / 单行重生成 / 接受变速)
  • 逐行试听、换音色、重新合成;背景音可静音原轨或压低原轨(ducking)
  • 输出纯音频(wav / mp3)、替换音轨、混音视频或 MKV 双音轨,可同时导出对齐后的字幕

视频合成(字幕烧录)

  • 硬字幕:把字幕永久烧进画面,任何播放器都能显示
  • 软字幕:以流复制方式无损封装可切换字幕轨
  • 字体、字号、颜色、描边、阴影、九宫格位置与多种预设样式
  • 所见即所得实时预览

隐私与硬件加速

  • 本地处理,文件不出本机;云端服务均为可选,首次使用有隐私确认
  • GPU 加速:NVIDIA CUDA、AMD / Intel Vulkan、Apple Core ML / Metal
  • 应用内下载加速包,无需手动安装 CUDA Toolkit;加载失败自动回退 CPU

界面一览

视频合成(字幕烧录) 字幕校对
merge proofread

全流程免费方案

对价格敏感的用户,下面这条路线不花一分钱,也不需要注册任何服务:

环节 免费方案 说明
视频下载 yt-dlp / lux 开源引擎 应用内一键安装,免费使用
语音转写 whisper.cpp / faster-whisper / FunASR / Qwen3-ASR / FireRedASR / Parakeet 本地模型 模型下载一次,离线可用
字幕翻译 内置免费翻译(必应 / 谷歌接口,自动回退)、Ollama 本地大模型、DeepLX 免费翻译开箱即用,零配置
TTS 配音 本地 Kokoro / VITS / ZipVoice 声音克隆;Edge TTS 免费档 本地模型离线合成,无用量限制
字幕烧录 内置 ffmpeg 本地合成

付费云服务(OpenAI、ElevenLabs、火山引擎、腾讯云等)全部是可选增强,按需选用。

下载安装

根据电脑系统和芯片选择安装包。GPU 加速包无须在下载时选择,安装后在应用内按需下载。

系统 芯片 安装包 说明
Windows x64 windows-x64 NVIDIA 用 CUDA,AMD / Intel 用 Vulkan,应用内下载
macOS Apple mac-arm64 自动启用 Core ML / Metal 加速
macOS Intel mac-x64 仅 CPU,不支持 GPU 加速
Linux x64 linux-x64 NVIDIA 用 CUDA,AMD / Intel 用 Vulkan,应用内下载

下载入口:GitHub Releases | 夸克网盘

macOS 用户推荐使用 Homebrew 安装,会自动匹配芯片类型:

brew tap buxuku/tap          # 只需执行一次
brew install --cask smartsub # 安装
brew upgrade --cask smartsub # 升级

三步上手

  1. 安装后跟随新手引导下载一个语音模型(无 GPU 或不想下模型,也可配置云端听写)
  2. 在启动台选择任务,拖入音视频或字幕文件(或粘贴链接下载在线视频),设置源语言、目标语言等参数
  3. 开始处理;完成后可继续校对字幕、配音或烧录合成

进阶指南

转写引擎对比与选择

转写引擎可逐任务切换,运行时与模型在「引擎与模型」页面统一管理:

引擎 说明 运行方式
whisper.cpp(内置) 默认引擎,支持 ggml 量化模型与 GPU 加速 随应用内置,开箱即用
faster-whisper 基于 CTranslate2,速度更快,模型按需从 HuggingFace 下载 自包含 Python 运行时(应用内下载)
FunASR SenseVoice(中 / 英 / 日 / 韩 / 粤)与 Paraformer-zh,中文表现优秀 内置 sherpa-onnx 原生库
Qwen3-ASR 通义千问语音识别(qwen3-asr-0.6b / 1.7b) 内置 sherpa-onnx 原生库
FireRedASR FireRedASR-AED large(中英),中文表现优秀 内置 sherpa-onnx 原生库
NVIDIA Parakeet 英语 TDT v2、多语种 TDT v3(25 种欧洲语言)、日语 0.6B CTC,支持标点 内置 sherpa-onnx 原生库
本地 Whisper CLI 调用你自行安装的 whisper 兼容命令 使用系统已装命令
云端听写(在线 ASR) 9 家在线服务商,免 GPU、支持多服务商多实例 在线服务(音频上传到你配置的端点)

FunASR / Qwen3-ASR / FireRedASR / Parakeet 均通过内置的 sherpa-onnx 原生库运行,无需额外环境;faster-whisper 会在应用内下载一个自包含运行时。

云端听写:9 家服务商配置说明

云端听写在「引擎与模型」左栏的「云端听写」分组中配置。每个服务商是一个独立入口,选中即见配置表单,填入凭据即可(支持「测试连接」)。转写时音频会上传到你配置的端点,首次运行有隐私确认——请勿用于敏感内容,并留意服务商的用量费用。

  • OpenAI 兼容:audio/transcriptions 协议(whisper-1、gpt-4o-transcribe 等)。OpenAI / Groq / 硅基流动预设直接列在侧栏,其它兼容端点(自建服务、中转站)经「添加自定义」接入,可添加多个
  • ElevenLabs Scribe:scribe_v1 模型
  • Deepgram:nova-2 / nova-3 模型
  • 火山引擎豆包:录音文件识别·极速版(bigmodel)。使用新版「豆包语音」控制台「API Key 管理」签发的 API Key(需先开通对应模型;火山方舟的 API Key 不通用),按转写时长计费
  • 腾讯云:录音文件识别极速版。使用「语音识别」控制台的 AppID / SecretId / SecretKey(需先开通,每月赠 5 小时免费额度)。识别语言自动跟随任务的「原语言」,模型只选档位——standard 普通版或 large 大模型版(识别更强、计费更高、免费并发仅 5)
  • 阿里云:录音文件识别极速版。使用 RAM 访问控制的 AccessKey ID / Secret,外加智能语音交互控制台项目的 Appkey。识别语种在项目「功能配置」中设定(任务原语言对阿里云不生效),默认普通话模型可识别中英混合。注意该服务仅提供商用版(无免费试用),开通后按转写时长计费
  • 讯飞:录音文件转写大模型。异步订单制,退出应用不丢任务
  • Gladia:solaria 模型,支持 100+ 语种,每月赠 10 小时免费额度
  • Xiaomi MiMo:mimo-v2.5-asr,中英文与中文方言;按时长计费,使用 20 秒静音分片生成粗粒度时间轴
whisper 模型怎么选

whisper.cpp / faster-whisper 使用 whisper 系列模型,模型越大越准、越慢、越吃显存:

  • 低端设备或核显:推荐 tiny / base,速度快、占用小
  • 普通电脑:从 small / base 起步,平衡精度与资源
  • 高性能显卡 / 工作站:推荐 large 系列,精度最高
  • 纯英文音视频:选带 en 的模型,专为英语优化
  • 在意体积:可用 q5 / q8 量化版本,牺牲少量精度换取更小体积
GPU 加速

软件内置 GPU 加速包管理,无须手动安装 CUDA Toolkit。安装后在「引擎与模型」页面管理 GPU 加速,软件会自动检测显卡并推荐合适的加速方案。

平台 加速后端 说明
Windows / Linux + NVIDIA CUDA 支持 CUDA 11.8.0 / 12.2.0 / 12.4.0 / 13.0.2,应用内下载对应加速包
Windows / Linux + AMD / Intel Vulkan 应用已内置 Vulkan 加速包
macOS(Apple 芯片) Core ML / Metal 下载 mac arm64 版本后自动启用
任意平台 CPU 无可用 GPU 时自动回退
  • 加速模式支持「自动 / 仅 GPU / 仅 CPU」,加载失败会自动降级到 CPU,并在诊断面板给出原因
  • 如启用加速后出现闪退,可切换为「仅 CPU」模式,或改用其它转写引擎
翻译服务与自定义参数

使用云端翻译服务需要相应的 API 密钥或配置。百度翻译、火山引擎等服务的 API 申请方法可参考 Bob 的服务申请文档,感谢 Bob 这款优秀的软件。

AI 翻译的结果受模型和提示词影响较大,可以尝试不同的模型和提示词组合,找到适合自己的搭配。

每个 AI 翻译服务都支持自定义参数配置,精确控制模型行为:

  • 直接在界面添加和管理参数,无需修改代码
  • 支持 String、Float、Boolean、Array、Object、Integer 类型
  • 参数修改实时校验,防止无效配置
  • 支持导出导入,方便共享和备份
配音引擎与输出模式

本地引擎基于 sherpa-onnx 运行,完全离线免费:

模型 语言 音色 说明
Kokoro 多语 v1.1 中 / 英 103 多语模型,英文与中文音色均衡
VITS 中文 AIShell3 中 174 中文说话人库
ZipVoice 声音克隆 中 / 英 用户自建 零样本克隆:一段参考音频 + 对应文本即建即用

云端服务商按需接入:

服务 说明
Edge TTS 免费、无需 Key;属逆向接口试用档,不承诺可用性,断供时建议切换其它引擎
OpenAI 兼容 audio/speech 协议,内置 OpenAI / 硅基流动预设,可添加多个自定义端点
Azure Speech 微软 Neural 音色体系(700+ 音色),SSML 语速控制
火山引擎豆包 豆包语音合成大模型音色,支持声音复刻 2.0 克隆音色
ElevenLabs 多语模型,支持即时声音克隆(IVC)
Xiaomi MiMo mimo-v2.5-tts,8 个中英文预置音色,当前限时免费

时间轴对齐机制:合成前按目标时长预控语速,合成后实测时长复核(本地引擎免费重合成,云端用 atempo 变速),不足时向相邻静音间隙借用时间;仍超过 1.5 倍语速红线的行进入人工处理清单,可改文案、单行重生成或接受变速。

创建克隆音色时会自动质检参考音频(时长、信噪比、削波、音量等),给出问题定位与修复建议。

AI 助手与 MCP / CLI 自动化配置

1. AI 创作助手(智能副驾)

  • 快捷键:⌘J(macOS)或 Ctrl+J(Windows / Linux)可随时呼出或收起右侧 AI 助手面板,展开后自动聚焦输入框。
  • 配置服务:在应用「翻译」设置页中配置的大模型(OpenAI 兼容、DeepSeek、通义千问、Gemini、SiliconFlow、DeerAPI 等)可直接用于助手对话。在聊天面板底部可随时切换当前对话的模型。
  • 上下文引用:默认勾选「引用当前上下文」,助手能自动读取当前播放进度、选中的字幕行、错误日志和工作区状态。取消勾选即可开启纯独立会话。
  • 视觉截图排障:点击输入框的相机图标,助手自动捕获当前工作区画面,并结合多模态模型视觉能力定位报错弹窗与配置问题。
  • 文件与媒体对话:直接拖拽音视频(MP4/MKV/MP3/WAV 等)、字幕或参考文稿到对话框,由助手调用底层 MCP 工具直接在本地提取音频、生成或润色字幕。

2. 连接外部 AI 工具(Cursor / Codex / Claude Code)

在软件中打开 设置 → 连接 AI 工具(MCP):

  • Cursor:点击「一键导入 Cursor」,在 Cursor 打开的页面中点击确认即可自动注册。
  • OpenAI Codex:点击「复制配置」,将生成的 TOML 块粘贴到 ~/.codex/config.toml 中。
  • Claude Code:在终端运行随包自带命令安装:
    # macOS
    "/Applications/SmartSub.app/Contents/Resources/automation/smartsub" setup cli --install
    "$HOME/.local/bin/smartsub" setup mcp --client claude --install
  • 其他 MCP 客户端:复制通用 JSON 配置,将 smartsub 条目合并到客户端的 mcpServers 字段中即可。无需额外安装 Node.js!

详细使用指引请参阅 AI 助手使用文档 与 MCP 与 CLI 接入指南。

手动下载与导入模型

模型文件较大,如果应用内下载困难,可以手动下载后导入。whisper 模型下载源:

  1. 国内镜像(速度较快):https://hf-mirror.com/ggerganov/whisper.cpp/tree/main
  2. Hugging Face 官方:https://huggingface.co/ggerganov/whisper.cpp/tree/main

苹果芯片需同时下载模型对应的 encoder.mlmodelc 文件,解压后放在模型相同目录下(q5 / q8 系列模型无须此文件)。

导入步骤:在「引擎与模型」页面点击「导入模型」,选择下载好的模型文件确认导入;或直接复制到模型目录。

FunASR / Qwen3-ASR / FireRedASR / Parakeet 等引擎的模型可在「引擎与模型」页面内按需下载(支持 ModelScope / GitHub 等多源)。

常见问题

macOS 提示「应用程序已损坏,无法打开」

在终端中执行以下命令后重新运行应用:

sudo xattr -dr com.apple.quarantine /Applications/SmartSub.app
模型下载缓慢或失败

可以手动下载模型文件后导入应用,见 手动下载与导入模型。国内用户建议使用 hf-mirror 镜像源。

启用 GPU 加速后应用闪退

在「引擎与模型」页面把加速模式切换为「仅 CPU」,或改用其它转写引擎;诊断面板会给出失败原因。

参与开发

欢迎提交 Issue 和 Pull Request 改进这个项目。

本地构建
  1. 克隆项目并安装依赖(安装钩子会自动下载 whisper addon 与 sherpa-onnx 原生库):
git clone https://github.com/buxuku/SmartSub.git
cd SmartSub
yarn install
  1. 启动开发环境:
yarn dev

如原生依赖自动下载失败(网络受限等),可手动执行 yarn native:fetch 重试。

赞助商

本项目由以下赞助商支持:

DigitalOcean

社区与支持

如果这个项目对你有帮助,欢迎点一个 star,或者请作者喝一杯咖啡(请备注你的 GitHub 账号)。使用中有任何问题,欢迎加入 QQ 交流群(群号:655348339)。

支付宝收款码 微信赞赏码 QQ 交流群
支付宝收款码 微信赞赏码 QQ 交流群

致谢

  • whisper.cpp — 本地转写引擎基础
  • sherpa-onnx — FunASR / Qwen3-ASR / FireRedASR / Parakeet 与本地 TTS 的运行时
  • FFmpeg — 音视频处理与字幕烧录
  • Bob — 翻译服务申请文档

许可证

本项目采用 MIT 许可证,详情见 LICENSE 文件。

Star History

Star History Chart

About

视频转字幕、字幕翻译、AI 配音与声音克隆、字幕烧录——免费开源的一站式桌面工具。基于 Whisper / FunASR 等本地模型离线语音转文字,批量处理 + 全平台 GPU 加速,跨 Windows / macOS / Linux。Free, open-source desktop app to generate, translate, dub & burn video subtitles — local Whisper speech-to-text, AI dubbing & voice cloning, offline, GPU-accelerated.

Topics

Resources

Code of conduct

Stars

5.6k stars

Watchers

28 watching

Forks

Releases

Used by

Contributors

Languages