适用场景
适合将会议录音、访谈、课程、播客及其他本地音视频整理为带时间轴的文字,并继续制作字幕、中文文稿、摘要、关键要点和行动项。
核心功能
- 本地离线转写:在当前页面解码音视频,并使用 Whisper 多语言模型识别语音。长文件按约 2 分钟分段处理,近似静音片段会被跳过。
- 时间轴校对:识别结果按时间片段展示,可逐段编辑;有原始文件时,点击时间可从对应位置播放。
- 自动 AI 校对:完整转写后自动分批校对明确的错字、拼写和识别错误。改动幅度过大的建议会被拒绝,并保留原识别文字。
- 英文翻译:识别语言选择“英语”,或“自动识别”判定内容为英文时,会先校对英文,再逐段生成简体中文翻译,并沿用原时间轴。
- 摘要整理:可根据已校对的文字及已有中文译文生成简体中文摘要、关键要点和行动项。
- 多格式输出:支持复制带时间的文字,以及导出 SRT、VTT 和 TXT。
- 历史记录:保存最近 20 条文字化记录,包括原始转写、校对文字、翻译、时间轴、摘要和行动项;不保存原始音视频。
开始使用
1. 准备运行环境
离线识别需要当前客户端支持 WebAssembly 和独立计算线程。可在“设置”页查看这两项是否可用。
AI 校对、英文翻译、自然段 TXT 和一键总结需要客户端存在已就绪的 AI 模型连接。默认使用首个可用连接的默认模型,无需先在小程序内创建配置;如需指定连接、模型或自定义规则,可前往“设置”选择“自选 AI 配置”。
2. 下载离线识别模型
在左侧“离线识别模型”区域选择模型:
- Tiny Q5_1:约 31MB,速度更快,适合清晰语音和快速初稿。
- Base Q5_1:约 57MB,准确率更高,适合会议、数字和专有名词。
点击“下载所选模型”,等待下载、完整性校验和保存完成。两个模型分别缓存,切换模型不会删除已经下载的模型。
3. 选择音视频
- 点击“选择文件”,选择本地音频或视频。
- 支持浏览器可解码的常见格式;无法解码时可改用 WAV、MP3、M4A、AAC、WebM 或 MP4。
- 单个文件不能超过 250MB,时长不能超过 60 分钟。
- 选择后可在页面内预览或播放原文件。
4. 设置识别选项
“识别语言”可选择:自动识别、中文、英语、日语、韩语、法语、德语或西班牙语。
当选择“自动识别”或“中文”时,还可设置中文字形:
- 统一为简体中文:识别片段出现时转换为简体字,AI 校对后再次统一。
- 保持识别原样:保留识别得到的中文字形。
英文翻译始终输出简体中文,不受该选项影响。
主要操作
转写并自动校对
- 确认已选择文件,且当前离线模型显示“可用”。
- 点击“开始转写”。
- 页面依次显示文件解码、模型装载、分段识别、文字校对及英文翻译进度。
- 自动处理完成后,“转写”页一次性显示最终时间轴文字;英文内容显示“校对英文”和“简体中文”两栏。
处理过程中可点击“取消”或“停止转写”。取消后,已经完成的片段仍可继续校对和保存。
如果离线转写完成但 AI 校对或翻译失败,已识别文字仍会保存。可在“转写”页点击“重新校对”或“重新校对与翻译”继续处理。
校对和编辑时间轴
- 点击左侧时间,可从该片段起点播放当前音视频;打开历史记录时没有原始媒体,因此时间按钮不可播放。
- 可直接编辑每段文字。
- 英文记录可分别编辑校对英文和简体中文译文。
- 修改校对英文后,该片段原有中文翻译会被清除,需要重新校对与翻译。
- 手动修改文字后,记录会重新变为待校对状态,需再次完成校对后才能导出 TXT。
主动点击“重新校对”或“重新校对与翻译”时,应用会打开“校对与翻译预览”,仅列出有变化的片段。确认后点击“应用”,或点击“取消”放弃本次建议。
如需撤销已应用的 AI 结果,点击“恢复原文”。确认后,当前校对文字、翻译和摘要会被清除,并恢复为原始识别文字。
完成检查后,可点击“保存校对”或“保存双语”写入历史记录。
生成摘要和行动项
- 打开“摘要”页。
- 点击“一键总结”。
- 查看“摘要”“关键要点”和“行动项”。
如果当前文字尚未校对,该操作会先执行校对;英文内容还会先生成简体中文翻译,再生成整理结果。行动项只显示转写内容中能够明确识别出的任务;没有明确行动项时会显示相应提示。
复制与导出
在“转写”页工具栏中选择需要的操作:
- 复制:复制带片段起始时间的文字。英文记录同时保留校对英文和简体中文译文。
- SRT:导出带起止时间的字幕文件。英文记录导出双语字幕。
- VTT:导出 WebVTT 字幕文件。英文记录导出双语字幕。
- TXT:仅在完成校对后可用,不包含时间轴。
TXT 提供两种格式:
- 文字直排版本:去除标点并按句换行。英文记录只导出简体中文译文,非英文记录导出校对后的原文。
- 自然段版本:使用所选或客户端默认 AI 恢复标点并按主题语义分段。生成结果会检查原文字符、标点密度和段落长度;检查失败时不会下载文件。
历史与设置
历史记录
打开“历史”页可查看文件名、创建时间、时长、片段数、双语状态和所用模型。点击记录可重新打开文字、翻译及摘要;点击删除按钮并确认后可移除该记录。
历史记录最多保留 20 条,超过后会移除较早的记录。
AI 设置
在“设置”页可选择:
- 客户端默认模型:自动使用客户端中已就绪连接的默认模型。
- 自选 AI 配置:指定连接、模型或自定义校对与总结规则;选择此模式后必须指定有效配置。
数据与注意事项
- 原始音视频只在当前小程序页面中解码,不上传,也不会写入历史记录或应用资产库。
- 离线识别模型需要联网下载,下载完成后保存在当前应用的私有资产中。
- AI 校对、翻译、自然段整理和总结需要可用的 AI 模型连接,并会以转写文字作为处理输入。
- 原始识别文字会随记录保留,便于恢复;恢复原文会清除当前校对文字、翻译和摘要。
- 自动校对以保守修正为原则。片段数量、ID 或顺序不完整,或建议改动幅度过大时,应用会拒绝相应结果或保留原文。
- 音质较差、语音不清或近似静音的文件可能无法识别出清晰内容;遇到提示时可更换更清晰的片段。
- 模型下载、AI 连接或环境能力不可用时,对应功能无法执行,请根据页面提示检查模型状态、AI 配置及当前环境。