Gast
#2692855
Hallo, hat hier schon mal jemand eine Spracherkennung programmiert(also selbst, keine vorgefertigte Library), die eine Mikrofon-Aufnahme eines beliebigen Sprechers mit einer abgespeicherten Referenz-Aufnahme vergleicht? Beispiel: Ich speichere eine Mikrofon-Aufnahme mit meiner eigenen Stimme des Wortes "Beenden". Jetzt nehme ich eine andere Person zwei mal auf, diese sagt bei der ersten Aufnahme "Beenden" und bei der zweiten Aufnahme "Verenden". Die andere Person hat natürlich eine vollkommen andere Stimme als ich. Die Spracherkennung sollte im ersten Fall ein TRUE liefern, im zweiten Fall ein FALSE. Es ist nun nicht so, dass ich überhaupt keine Ahnung vom Programmieren habe. Mir ist bewußt, dass das nicht in 5 Minuten geht, weil so Sachen wie Beginn des Sprechens, unterschiedliche Lautstärke der Sprecher, Sprechgeschwindigkeit, Umgebungsgeräusche, usw. zu Berücksichtigen sind. Dies soll auch kein "Wie fliege ich mal eben zum Mars"-Thread werden und die Spracherkennung soll auch nicht in einem ausverkauften Fussballstadion funktionieren. Eventuell gibt es ja irgendeine Quick-And-Dirty-Lösung, die zumindest unter ordentlichen Bedingungen(leise Umgebung, Aufnahme ist laut und deutlich) mit hinreichender Genauigkeit funktioniert. Ich bin so weit, dass ich die Mikrofon-Aufnahmen durchführen und die Roh-Daten auf Bit-Ebene bearbeiten bzw. mit meiner Referenz-Aufnahme vergleichen kann. Ist doch schon mal ein Anfang... ;) Kann man so etwas überhaupt in akzeptabler Zeit selbst programmieren? Falls nicht, würden mich trotzdem die programmiertechnischen Arbeitsschritte in stark abstrahierter Form interessieren, damit ich mal sehe, wie viel Aufwand hinter so einer "Funktion" steckt. Gruß, Sunshine