In fast jedem Erstgespräch über die Umwandlung von Telefonaten oder diktierten Notizen in strukturierte Daten kommt eine Frage: Unsere Aufnahmen klingen rau — bricht das System daran? Die ehrliche Antwort lautet „es kommt darauf an, wie rau“, und das lässt sich messen. Also habe ich es gemessen, statt zu raten.
Der Trick, der es messbar macht
Man kann das Transkript eines Modells nicht mit der Wahrheit vergleichen, solange man nicht weiß, was gesagt wurde. Also beginnt man mit sauberen Aufnahmen, deren genauer Wortlaut bereits bekannt ist, und verschlechtert dann gezielt das Audio zu den Bedingungen, die ein Kunde tatsächlich hat — ein Festnetzanschluss, eine schlechte Mobilverbindung, Maschinenlärm im Hintergrund, ein halliger Besprechungsraum. Was gesagt wurde, ändert sich nie, also bewertet dieselbe bekannte Antwort jede Variante, und jeder Unterschied zwischen ihnen geht allein auf das Audio zurück.
Das Modell ist whisper und läuft vollständig auf einem lokalen Rechner — keine Cloud, keine Daten, die das Haus verlassen. Der Wert unten ist der Recall: der Anteil der gesprochenen Wörter, den das Modell zurückgewinnt.
Was es zeigt
Die beruhigende Hälfte: Telefon-Audio kostet praktisch nichts. Ein Festnetzanschluss, ein komprimierter Mobilfunkanruf, Übersteuerung durch eine zu hoch eingestellte Aussteuerung, sogar verlorene Pakete — das Modell steckt all das weg. Für alles, was auf Telefonaten aufbaut, ist die Aufnahmequalität nicht der Engpass.
Die nützliche Hälfte: Beim Besprechungsraum biegt es sich. Stellt man das Mikrofon ans andere Ende des Tisches — Abstand, Hall und Hintergrundgeräusch zusammen — fällt der Recall von nahezu perfekt auf 88 %. Das ist die eine Bedingung, in die zu investieren sich lohnt, und die Lösung ist ein besseres Mikrofon, kein besseres Modell.
Es gab noch ein leiseres Signal. Das Modell gibt an, wie sicher es ist, und diese Sicherheit sank im Gleichschritt mit der Audioqualität — am höchsten beim sauberen Anruf, am niedrigsten im halligen Raum aus der Ferne. Ein Wert, der genau dann fällt, wenn die Genauigkeit fällt, ist für sich schon nützlich: Er erlaubt es dem System, jene Aufnahmen zu markieren, die ein Mensch nachprüfen sollte, statt still zu scheitern.
Ehrlicher Rahmen
Dies ist ein kleiner, kontrollierter Test — zwölf kurze vorgelesene Sätze, keine spontane Geschäftssprache mit ihren Unterbrechungen und Zwischenrufen. Die Raum- und Lärmbedingungen sind getreue Näherungen, bewusst von den echten Telefonkanälen getrennt ausgewiesen, denn eine Näherung kann Optionen ehrlich einordnen, aber keinen konkreten realen Raum ersetzen. Lesen Sie also die Form, nicht die Nachkommastellen: Audio in Telefonqualität ist unproblematisch; die Aufnahme aus der Ferne ist der wunde Punkt. Eine Zahl, auf die sich ein Kunde verlassen kann, braucht dessen eigene Aufnahmen — was, da der ganze Sinn darin besteht, dass das Audio das Haus nie verlässt, genau die Art Messung vor Ort ist.