装上就能干活的 AI 小程序

精选官方与社区 AI 小程序,安装即可使用

音视频文字化社区

把音频或视频整理成可校对的时间轴文字和字幕,英文内容自动校对并翻译为简体中文,还可生成摘要和行动项

作者阿东
价格
免费
免费使用无需付费,安装后即可在光年AI电脑版运行。
使用说明

适用场景

适合将会议录音、访谈、课程、播客及其他本地音视频整理为带时间轴的文字,并继续制作字幕、中文文稿、摘要、关键要点和行动项。

核心功能

  • 本地离线转写:在当前页面解码音视频,并使用 Whisper 多语言模型识别语音。长文件按约 2 分钟分段处理,近似静音片段会被跳过。
  • 时间轴校对:识别结果按时间片段展示,可逐段编辑;有原始文件时,点击时间可从对应位置播放。
  • 自动 AI 校对:完整转写后自动分批校对明确的错字、拼写和识别错误。改动幅度过大的建议会被拒绝,并保留原识别文字。
  • 英文翻译:识别语言选择“英语”,或“自动识别”判定内容为英文时,会先校对英文,再逐段生成简体中文翻译,并沿用原时间轴。
  • 摘要整理:可根据已校对的文字及已有中文译文生成简体中文摘要、关键要点和行动项。
  • 多格式输出:支持复制带时间的文字,以及导出 SRT、VTT 和 TXT。
  • 历史记录:保存最近 20 条文字化记录,包括原始转写、校对文字、翻译、时间轴、摘要和行动项;不保存原始音视频。

开始使用

1. 准备运行环境

离线识别需要当前客户端支持 WebAssembly 和独立计算线程。可在“设置”页查看这两项是否可用。

AI 校对、英文翻译、自然段 TXT 和一键总结需要客户端存在已就绪的 AI 模型连接。默认使用首个可用连接的默认模型,无需先在小程序内创建配置;如需指定连接、模型或自定义规则,可前往“设置”选择“自选 AI 配置”。

2. 下载离线识别模型

在左侧“离线识别模型”区域选择模型:

  • Tiny Q5_1:约 31MB,速度更快,适合清晰语音和快速初稿。
  • Base Q5_1:约 57MB,准确率更高,适合会议、数字和专有名词。

点击“下载所选模型”,等待下载、完整性校验和保存完成。两个模型分别缓存,切换模型不会删除已经下载的模型。

3. 选择音视频

  1. 点击“选择文件”,选择本地音频或视频。
  2. 支持浏览器可解码的常见格式;无法解码时可改用 WAV、MP3、M4A、AAC、WebM 或 MP4。
  3. 单个文件不能超过 250MB,时长不能超过 60 分钟
  4. 选择后可在页面内预览或播放原文件。

4. 设置识别选项

“识别语言”可选择:自动识别、中文、英语、日语、韩语、法语、德语或西班牙语。

当选择“自动识别”或“中文”时,还可设置中文字形:

  • 统一为简体中文:识别片段出现时转换为简体字,AI 校对后再次统一。
  • 保持识别原样:保留识别得到的中文字形。

英文翻译始终输出简体中文,不受该选项影响。

主要操作

转写并自动校对

  1. 确认已选择文件,且当前离线模型显示“可用”。
  2. 点击“开始转写”。
  3. 页面依次显示文件解码、模型装载、分段识别、文字校对及英文翻译进度。
  4. 自动处理完成后,“转写”页一次性显示最终时间轴文字;英文内容显示“校对英文”和“简体中文”两栏。

处理过程中可点击“取消”或“停止转写”。取消后,已经完成的片段仍可继续校对和保存。

如果离线转写完成但 AI 校对或翻译失败,已识别文字仍会保存。可在“转写”页点击“重新校对”或“重新校对与翻译”继续处理。

校对和编辑时间轴

  • 点击左侧时间,可从该片段起点播放当前音视频;打开历史记录时没有原始媒体,因此时间按钮不可播放。
  • 可直接编辑每段文字。
  • 英文记录可分别编辑校对英文和简体中文译文。
  • 修改校对英文后,该片段原有中文翻译会被清除,需要重新校对与翻译。
  • 手动修改文字后,记录会重新变为待校对状态,需再次完成校对后才能导出 TXT。

主动点击“重新校对”或“重新校对与翻译”时,应用会打开“校对与翻译预览”,仅列出有变化的片段。确认后点击“应用”,或点击“取消”放弃本次建议。

如需撤销已应用的 AI 结果,点击“恢复原文”。确认后,当前校对文字、翻译和摘要会被清除,并恢复为原始识别文字。

完成检查后,可点击“保存校对”或“保存双语”写入历史记录。

生成摘要和行动项

  1. 打开“摘要”页。
  2. 点击“一键总结”。
  3. 查看“摘要”“关键要点”和“行动项”。

如果当前文字尚未校对,该操作会先执行校对;英文内容还会先生成简体中文翻译,再生成整理结果。行动项只显示转写内容中能够明确识别出的任务;没有明确行动项时会显示相应提示。

复制与导出

在“转写”页工具栏中选择需要的操作:

  • 复制:复制带片段起始时间的文字。英文记录同时保留校对英文和简体中文译文。
  • SRT:导出带起止时间的字幕文件。英文记录导出双语字幕。
  • VTT:导出 WebVTT 字幕文件。英文记录导出双语字幕。
  • TXT:仅在完成校对后可用,不包含时间轴。

TXT 提供两种格式:

  • 文字直排版本:去除标点并按句换行。英文记录只导出简体中文译文,非英文记录导出校对后的原文。
  • 自然段版本:使用所选或客户端默认 AI 恢复标点并按主题语义分段。生成结果会检查原文字符、标点密度和段落长度;检查失败时不会下载文件。

历史与设置

历史记录

打开“历史”页可查看文件名、创建时间、时长、片段数、双语状态和所用模型。点击记录可重新打开文字、翻译及摘要;点击删除按钮并确认后可移除该记录。

历史记录最多保留 20 条,超过后会移除较早的记录。

AI 设置

在“设置”页可选择:

  • 客户端默认模型:自动使用客户端中已就绪连接的默认模型。
  • 自选 AI 配置:指定连接、模型或自定义校对与总结规则;选择此模式后必须指定有效配置。

数据与注意事项

  • 原始音视频只在当前小程序页面中解码,不上传,也不会写入历史记录或应用资产库。
  • 离线识别模型需要联网下载,下载完成后保存在当前应用的私有资产中。
  • AI 校对、翻译、自然段整理和总结需要可用的 AI 模型连接,并会以转写文字作为处理输入。
  • 原始识别文字会随记录保留,便于恢复;恢复原文会清除当前校对文字、翻译和摘要。
  • 自动校对以保守修正为原则。片段数量、ID 或顺序不完整,或建议改动幅度过大时,应用会拒绝相应结果或保留原文。
  • 音质较差、语音不清或近似静音的文件可能无法识别出清晰内容;遇到提示时可更换更清晰的片段。
  • 模型下载、AI 连接或环境能力不可用时,对应功能无法执行,请根据页面提示检查模型状态、AI 配置及当前环境。

 

封装了哪些能力
音视频转写字幕生成时间轴整理英文校对中英翻译内容摘要行动项提取
信息
作者阿东
分类内容生产
版本0.3.1
安装量34
更新于2026-09-08