支持的格式和限制
XMOX接受以下文件类型直接上传:
- 音频:MP3、WAV、M4A、FLAC、OGG、OPUS
- 视频容器(音频轨道自动提取):MP4、MOV、WEBM、MKV
最大文件大小为500 MB。对于较长的录音,请考虑分割文件或使用直接从源传输的云集成(Zoom、Google Meet、Teams)。
分步指南:上传文件
1
打开您的XMOX工作区,点击+ 新建任务按钮(或工具栏中的上传图标)。
2
在来源选择器中,选择"音频/视频文件"。
3
点击"选择文件"或将文件拖放到上传区域。上传进度条将立即出现。
4
上传后,XMOX自动开始转录。任务列表中的任务卡将显示处理中状态标志,同时AI正在工作。
5
当状态变为就绪时,点击任务打开转录文本。您现在可以阅读、搜索并提问关于内容的问题。
了解处理时间
处理速度取决于文件长度和当前服务器负载。大致参考:
- 10分钟的录音通常在1分钟内完成。
- 1小时的录音通常在3–5分钟内就绪。
- 很长的录音(3小时以上)可能需要10–15分钟。
无需保持页面打开——XMOX在后台处理。返回时刷新任务列表即可。
转录后提问
任务就绪后,右侧的AI聊天面板允许您用自然语言查询转录文本。以下是一些有效的提示语可供尝试:
- "总结这次会议的要点。"
- "列出所有提到的行动项目。"
- "前15分钟讨论了哪些主题?"
- "找出所有使用'截止日期'这个词的地方。"
- "谁发言最多,他们关注的是什么?"
您也可以点击转录文本中的任意行,跳转到音频播放器中的确切时刻——有助于验证特定答案周围的上下文。
获得最佳转录质量
XMOX使用Gemini AI进行转录,即使在带口音的语音和技术词汇方面也非常准确。为获得最佳结果:
- 在安静房间中用近距离麦克风录制可产生最少错误。
- 如果可能,在上传前减少背景噪音(Audacity的降噪工具等效果很好)。
- 带有多个发言者在独立声道的立体声录音会自动处理——转录文本会区分发言者。
- 如果某个词一直被错误转录,您可以内联更正,更正版本会保留在所有导出中。
质量非常低的录音(严重压缩伪影、严重背景噪音或非常轻柔的语音)可能产生精度较低的转录文本。AI仍会尽力而为,但某些词语可能被标记为不确定。
准备好上传您的第一个音频文件了吗?打开您的XMOX工作区,几秒钟即可开始。
打开工作区 →