分享一个最近做的音频转文字工具,想听听大家的建议

最近做了一个音频转文字的小工具,主要是因为自己经常需要整理技术分享、会议录音和视频内容。

过程中踩了一些坑,例如:

  • 长音频如何切分,避免超时;
  • 中英文混合识别效果如何提升;
  • 上传大文件时的体验优化;
  • 转录之后如何继续做总结、翻译或者导出。

目前做了一个在线版本:

https://transvio.ai/

整个项目主要还是围绕 Web 技术实现,前端是 Next.js,后端主要负责异步任务和转录流程,最近也在持续优化长音频的处理速度。

想请教一下大家:

如果是日常使用 Emacs,大家会希望有一个什么样的工作流?

例如:

  • Org Mode 一键导入会议记录?
  • 导出 Org / Markdown 格式?
  • 或者直接做成一个 Emacs Package,通过命令调用?

如果大家有相关需求或者使用场景,也欢迎交流,我也可以考虑把接口开放出来做集成。

使用的什么模型? 能不能识别多角色? 支持多长的音频?