免费开源的 Descript 替代品 Rescript:像改文字一样剪视频,浏览器打开就能用
featuredImage: https://cdn.lpflpf.cn/covers/free-2026-08-09.png
做口播视频、录播客的人,大概都有过这种体验:一段 30 分钟的访谈,中间说错了一句话、卡壳了三秒钟,就得在剪辑软件里对着时间轴一寸一寸地找、一刀一刀地切。剪完一条片子,半天没了。
过去两年,很多人靠 Descript 解决这个问题——把视频转成文字稿,删掉哪句话,对应的画面就跟着剪掉,剪辑变成了「删字」。但 Descript 要订阅,一个月 12 到 24 美元,一年下来够买一台入门级平板了。
今天要介绍的是它的开源替代品:Rescript。免费、无账号、全本地处理,浏览器打开就能用,桌面版本周也发布了。

Rescript 是什么
Rescript(GitHub: wassgha/rescript)是一个「转写式」视频/音频编辑器,项目上线两周多,GitHub 682 星,本周刚发布 v1.1 桌面版(Windows/macOS/Linux),更新很勤。
它的核心思路一句话:像编辑文本一样编辑视频。
工作流程是这样的:
- 拖入一个视频或音频文件,本地自动转写——逐词打上时间戳,还能按说话人分组;
- 在转写稿里选中不想要的词,按下删除键;
- 对应的视频片段就被裁掉了,预览时直接跳过;
- 导出成片。
转录用的 Whisper 模型(Hugging Face 的开源语音识别模型)跑在本地浏览器里,支持 WebGPU 加速,文件全程不出你的设备。没有账号、没有上传、没有订阅,断网都能用。
除了「删字」,它还能干什么
如果你以为它只是个「文字版剪刀」,就小看它了。几个高频场景:
一键去语气词。 「嗯」「那个」「呃」这类口头禅,人耳听不出来,机器一抓一个准。Rescript 可以一键把所有「um / uh」标记出来,全选删除,口播立刻干净一个档次。中文的「嗯」「啊」同理,Whisper 会转写出来,你手动圈选删掉就行。
一键去静音。 停顿、空白、冷场,超过 0.3 秒的静音自动识别,一键全剪。访谈类内容最实用——两个人对话里的沉默期,本来就是要剪掉的。
说话人分离。 转写稿自动按说话人分组,两个人的访谈一眼分清谁说了什么,剪的时候不会误删对方的话。
导入现成字幕。 如果你已经有 SRT、VTT 字幕文件,可以直接导入,跳过本地转写这一步——适合批量处理已经有字幕的素材。
导出灵活。 视频可以导出 MP4/WebM(720p 到 4K),音频可以导出 M4A/MP3/WAV,字幕可以导出 SRT/VTT/JSON。录屏、播客、口播、访谈,基本覆盖了轻量剪辑的全部出口。
时间轴也不是摆设:波形图、逐词拖拽修正时间、分割工具、按词边界精修,都有。不是那种「只能删字」的玩具。
技术上是怎么做到的
Rescript 能在浏览器里完成整套流程,靠的是三个开源组件的组合:
Whisper 负责转写。 它跑的是 Hugging Face 的 transformers.js 版 Whisper 模型(Base 和 Small 两个档位),在 Web Worker 里运行,优先用 WebGPU 加速,不支持时退回 WASM。转写是流式的——一边转一边出字,不用干等。每个词都带时间戳,这是「删字即剪片」能成立的基础。
pyannote 负责分人。 说话人分离用的是 pyannote-segmentation-3.0 的 ONNX 版本,同样跑在本地。两个人的访谈,转写稿自动分成 Speaker 1、Speaker 2,每一句标好归属。
ffmpeg.wasm 负责导出。 剪辑本质是「保留区间拼起来重新编码」,这个活儿由浏览器里的 ffmpeg 完成,支持 720p 到 4K 的 MP4/WebM 导出。因为所有操作都是无损定位 + 最终一次编码,所以不会像某些工具那样反复压缩导致画质劣化。
技术选型的直接好处是零成本、零部署、零隐私风险——作者(Wassim Gharbi)把整个服务端省掉了,连账号系统都没有。这也解释了为什么浏览器版要求 Chromium 内核:SharedArrayBuffer 和 WebGPU 这两个能力,Safari/Firefox 支持得还不完整。
隐私是它最大的卖点
先说个很多人会担心的点:所有处理都在本地完成。
转写用的是本地 Whisper 模型(可以在 Base 和 Small 两个精度档位之间选),导出用 ffmpeg.wasm 在浏览器里重新编码。你的视频不会上传到任何服务器——对访谈、课程、商业素材这类敏感内容,这一点很重要。
需要提醒两点:
- 浏览器版建议用 Chrome/Edge 等 Chromium 内核浏览器,需要 WebGPU 支持,转写速度才有保障;
- 它默认会上报匿名使用统计(用于统计功能使用情况),可以在设置里关掉——但要注意,这跟「上传你的视频」是两回事,素材本身始终在本地。
多少钱?跟 Descript 比怎么样
Rescript 完全免费。但注意它的授权协议:PolyForm Noncommercial License 1.0.0——个人和非商业用途免费、可自由使用修改,但商业使用(包括用它做收费服务)需要联系作者单独授权。早期版本是 MIT 协议的,那些版本仍保持 MIT。商用之前,先读一遍 License,别踩坑。
对比 Descript(月费 12–24 美元):
- 价格:0 vs 12–24 美元/月;
- 隐私:全本地 vs 云端处理;
- 功能:Descript 有 AI 配音、多轨等更多高级功能;Rescript 聚焦转写式剪辑,功能更纯粹;
- 中文:Whisper 模型对中文转写质量不错,但 Descript 的中文体验经过更多打磨。
一句话:轻中度剪辑用户,Rescript 足够;重度专业用户,再评估。
常见问题
中文支持怎么样? 转写用的是 Whisper 模型,对中文的识别质量在开源方案里属于第一梯队,但比不上大厂打磨过的中文语音服务。普通话标准的录音没问题,方言、口音重的素材,识别率会打折扣——好在转写稿可以直接手动修正,改完照样导出。
视频多长合适? 半小时以内的素材体验最好。一小时以上的长视频,转写时间会明显拉长,浏览器标签页别关。批量做长内容的话,建议用桌面版,稳定性更好。
手机上能用吗? 官方定位是桌面端。手机浏览器受限于算力,转写会很慢,不建议。轻量修一下倒是可以,但主力剪辑请上电脑。
导出会掉画质吗? 导出是最终一次重编码,选好码率后画质损失可以接受。剪短视频(5 分钟以内)导出速度很快;长视频导出会花时间,属于正常现象。
能剪横屏竖屏、多机位吗? 横屏竖屏取决于素材本身,导出会保持原始比例。多机位、多轨混编是它的盲区——Rescript 是单轨思维,别拿它当 Premiere 用。
别用它做什么
把边界说清楚,省得踩坑:
- 它不擅长复杂包装——特效、转场、调色、花字,找别的工具;
- 它不适合多轨混编——B-roll、画中画、多音轨,不是它的设计目标;
- 它做不了AI 配音和数字人——那是 Descript 订阅版的增值功能,Rescript 专注剪辑本身;
- 商业用途注意授权——PolyForm Noncommercial 协议,商用要联系作者拿授权。
Rescript 的定位非常清晰:把「说话类内容」的剪辑做到极致,其余一概不碰。这种克制,反而让它在这个细分领域比很多大而全的工具好用。
值不值得用
我的判断:值,特别适合三类人。
第一类是播客主播。音频剪辑用 Rescript 体验最好——拖入录音、删语气词、去静音、导出 MP3,全程十分钟,比在 Audition 里手工修快一个数量级。
第二类是口播视频创作者。脚本即转写稿,删字即剪辑,改稿和改片是同一件事,效率提升立竿见影。
第三类是隐私敏感的用户。课程、内部培训、客户访谈素材不想过云端,Rescript 是少有的「本地完成」选项。
短板也要说清楚:长视频转写在浏览器里会比较慢——1 小时的视频,普通电脑转写可能要等一阵子,建议用桌面版并选 Whisper Base 档。至于功能边界,前面「别用它做什么」已经说透,它适合的是说话类内容,不是影视级制作。
上手步骤
- 浏览器打开 app.getrescript.com(或用桌面版,官网 getrescript.com 下载,macOS 版已签名);
- 拖入你的视频或音频,选择转写精度(Base 快、Small 准);
- 等转写完成,删掉不想要的词、一键去语气词和静音;
- 导出视频或音频。
全程不需要注册账号,不需要信用卡。
给播客和口播党的建议:这个月先别急着续 Descript,用 Rescript 跑完一条完整片子,感受一下省下的订阅费,再决定要不要换。