Unterstützte Formate und Limits

XMOX akzeptiert folgende Dateitypen für den direkten Upload:

  • Audio: MP3, WAV, M4A, FLAC, OGG, OPUS
  • Video-Container (Audiospur wird automatisch extrahiert): MP4, MOV, WEBM, MKV
Die maximale Dateigröße beträgt 500 MB. Für längere Aufnahmen sollten Sie die Datei aufteilen oder eine Cloud-Integration (Zoom, Google Meet, Teams) verwenden, die direkt aus der Quelle streamt.

Schritt für Schritt: Eine Datei hochladen

1
Öffnen Sie Ihren XMOX-Arbeitsbereich und klicken Sie auf die Schaltfläche + Neuer Auftrag (oder das Upload-Symbol in der Symbolleiste).
2
Wählen Sie im Quellen-Picker "Audio-/Videodatei" aus.
3
Klicken Sie auf "Datei auswählen" oder ziehen Sie Ihre Datei per Drag-and-Drop in den Upload-Bereich. Die Fortschrittsleiste erscheint sofort.
4
Nach dem Upload beginnt XMOX automatisch mit der Transkription. Die Auftragskarte in Ihrer Liste zeigt ein Status-Badge wird verarbeitet, während die KI arbeitet.
5
Wenn der Status zu Bereit wechselt, klicken Sie auf den Auftrag, um die Transkription zu öffnen. Sie können den Inhalt nun lesen, durchsuchen und Fragen dazu stellen.

Verarbeitungszeit verstehen

Die Verarbeitungsgeschwindigkeit hängt von der Dateilänge und der aktuellen Serverlast ab. Als grobe Orientierung:

  • Eine 10-minütige Aufnahme ist in der Regel in weniger als 1 Minute fertig.
  • Eine 1-stündige Aufnahme ist in der Regel innerhalb von 3–5 Minuten bereit.
  • Sehr lange Aufnahmen (3 Stunden+) können 10–15 Minuten dauern.

Sie müssen die Seite nicht geöffnet lassen — XMOX verarbeitet im Hintergrund. Aktualisieren Sie die Auftragsliste, wenn Sie zurückkehren.

Fragen nach der Transkription stellen

Wenn ein Auftrag bereit ist, können Sie über das KI-Chat-Panel auf der rechten Seite die Transkription in natürlicher Sprache abfragen. Hier sind einige wirksame Prompts zum Ausprobieren:

  • "Fasse die wichtigsten Punkte dieses Meetings zusammen."
  • "Liste alle erwähnten Aktionspunkte auf."
  • "Welche Themen wurden in den ersten 15 Minuten besprochen?"
  • "Finde jede Verwendung des Wortes 'Frist'."
  • "Wer hat am meisten gesprochen und worauf hat er sich konzentriert?"
Sie können auch auf jede Zeile der Transkription klicken, um zu diesem genauen Moment im Audioplayer zu springen — nützlich zum Überprüfen des Kontexts rund um eine bestimmte Antwort.

Beste Transkriptionsqualität erzielen

XMOX verwendet Gemini AI für die Transkription, die auch bei akzentbehafteter Sprache und technischem Vokabular sehr genau ist. Für optimale Ergebnisse:

  • Aufnahmen in einem ruhigen Raum mit einem nahen Mikrofon erzeugen die wenigsten Fehler.
  • Reduzieren Sie Hintergrundgeräusche vor dem Upload wenn möglich (Tools wie Audacitys Rauschunterdrückung funktionieren gut).
  • Stereo-Aufnahmen mit mehreren Sprechern auf getrennten Kanälen werden automatisch behandelt — die Transkription unterscheidet die Sprecher.
  • Wenn ein Wort konsequent falsch transkribiert wird, können Sie es inline korrigieren und die korrigierte Version wird in allen Exporten gespeichert.
Aufnahmen sehr schlechter Qualität (starke Kompressionsartefakte, starkes Hintergrundrauschen oder sehr leise Sprache) können Transkriptionen mit verringerter Genauigkeit erzeugen. Die KI wird trotzdem ihr Bestes tun, aber einige Wörter können als unsicher markiert werden.

Bereit, Ihre erste Audiodatei hochzuladen? Öffnen Sie Ihren XMOX-Arbeitsbereich und starten Sie in Sekunden.

Arbeitsbereich öffnen →