Hallo,
ich plane einen eigenen Smart Home Assistenten zu bauen und recherchiere, welches Audio Frontend nutzbar wäre. Must have sind:
- AEC (Acoustic Echo Cancellation)
- Near/Mid/Far-field voice pick-up
- Beam forming / BSS (Blind Source Separation)
- AGC (Automatic Gain Control)
- VAD (Voice Activity Detection)
Nice to have:
- Sound location estimation
- ASR (Automatic Speech Recognition)
- Wake Word
Zu Hause hab ich noch ein ESP32-LyraTD-MSC gefunden und wollte damit beginnen. Dort ist der ZL38063 verbaut der alle Anforderungen erfüllt.
Beitrag "Espressif ESP32 LyraTD MSC"
Die Idee wäre den ZL38063 das Audio Preprocessing machen zu lassen und den ESP32-S3 für ein eigenes Wake Word Modell zu nutzen. Allerdings bekommt zum ZL38063 (und Konsorten) leider überhaupt keine Infos oder Tools wie den Timberwolf MiTuner. Die Websites, auf denen man angeblich die Infos nach Registrierung bekommt (sds.microchip.com/sds.microsemi.com) sind schlichtweg tot.
Die Alternative wäre wohl das ESP-SR Framework, nur leider wird der ESP32-S3 damit voll ausgelastet:
https://docs.espressif.com/projects/esp-sr/en/latest/esp32s3/audio_front_end/README.html
Hat jemand Erfahrung, ob man da überhaupt rankommt ohne große Mengen abzunehmen?
Liebe Grüße julian-w