Für Spracherkennung gibt es:
- Pocketsphinx: in C geschrieben, der Code sieht aber recht "gewachsen"
aus und ist nicht sehr gut dokumentiert. Die verfügbaren akustischen
Modelle für Englisch funktionieren gut, zumindest solange man eine
eingeschränkte Grammatik verwendet (JSGF). Wenn man schnell einen
Echtzeit-Erkenner auf die Beine stellen will, dann ist Pocketsphinx
erste Wahl. Wenn man neue DInge ausprobieren möchte, eher nicht.
- HTK: komisch lizenziert, traditionell oft in der Forschung verwendet,
aber heutzutage eher als veraltet zu betrachten.
- Kaldi: jung, in C++ geschrieben, sehr modular. Wird häufig in
aktueller Forschung verwendet. Ist vermutlich am ehesten mit OpenCV
vergleichbar, aber definitiv nicht so erwachsen, und vermutlich nicht so
ohne weiteres echtzeitfähig.
Schnittstellen für Audio Ein-/Ausgabe sind wieder eine andere Baustelle,
dafür gibt es andere Bibliotheken (libsndfile, portaudio).
Allgemein ist Spracherkennung ein komplexes Thema für das man sicherlich
mehr Hintergrundwissen und Einarbeitungszeit braucht als für erste
Experimente mit Bildverarbeitung.