浏览器本地分段,纯前端音视频转文字:基于讯飞 API 的开源工具
无需后端,纯前端工具在浏览器内自动切分长音频,对接讯飞 API 识别,合并输出文本。适合自备 API 凭证、追求成本控制的用户。
核心原理:浏览器分段 + 讯飞 API
很多转文字网页只是套了个好看的界面,当你上传大文件时,依然会因为 API 的时长限制而报错。这个纯前端工具真正有价值的地方在于引入了 FFmpeg WebAssembly,相当于把音视频处理能力搬到了浏览器里。

当上传一段 1 小时的会议录音,工具会在本地浏览器自动切成几十秒的小段,再按讯飞接口规则逐段发送识别,最后将结果合并成完整文本。它利用本地算力,巧妙适配了 API 的单次音频时长限制。
简单来说,大厂接口规定一次只能处理一小段,以前要么放弃,要么手动剪音频。这个网页就像一个自动剪辑助理,在浏览器里自动分段、分批识别、合并输出。
上手流程:纯前端怎么配大厂 API?
因为没有后端,使用前需要自备 API 凭证。步骤如下:
- 注册讯飞开放平台账号,完成实名认证。
- 在控制台创建语音听写应用,获取 APPID、API Key 和 API Secret。
- 打开工具网页(在线演示或本地 HTML),在设置中填入三项凭证,上传文件即可开始转录。
纯前端不等于完全离线,隐私边界需知晓
“无后端服务器”容易让人误以为完全离线或数据绝不上传。实际上,项目不会将 API Key 发送到作者服务器,凭证只保存在浏览器 localStorage,防止中间商窃取。但语音识别过程仍需联网,音频切片会发送到科大讯飞云端解析。
安全提醒: - 涉及商业机密或敏感资料,不能依赖此工具实现物理隔离,不建议走云端 API。 - 识别质量由讯飞后端决定,工具只是前端封装,准确率和方言支持取决于 API 能力。
适合哪些人使用,不适合哪些场景?
适合: - 个人用户偶尔转录长会议、课程、采访录音。 - 不想付费商业工具,愿意自己配置 API 的独立开发者或极客。 - 需要快速搭建自用转文字页面,部署到静态托管平台。
不适合: - 对数据合规有严格要求、不允许第三方处理的企业用户。 - 需要团队协作、云同步和历史记录的场景(工具无账户体系)。 - 不想配置、只想一键出结果的小白用户。
常见问题
Q:讯飞 API 免费额度如何? A:根据讯飞语音听写接口文档,新应用默认通常有每日 500 次免费调用。具体以讯飞控制台为准,政策可能调整。
Q:音视频文件会被第三方小网站存储吗? A:不会。文件在本地浏览器分段,识别时音频直接发送给讯飞 API,不经过项目作者的任何中转服务器。
项目信息
- 官方网站:在线演示体验,需自备并填入讯飞凭证。
- GitHub 项目主页:查看完整前端源码与自部署说明。
免责声明:本文基于项目公开源码及官方接口文档介绍。工具仅提供前端切片与调用框架,实际识别质量、隐私处理及免费配额受限于第三方服务商(科大讯飞)政策。本站不对第三方 API 稳定性及计费负责。