Sprachgenerator?

#8020343
Lesenswert?

Stefan P. schrieb:

Christoph M. schrieb:

Kennt jemand was Besseres?

https://www.thorsten-voice.de

Ich habe die "Thorsten Voice" gerade mal mit meinem Lieblingstesttext ausprobiert. Diesen Text...

Achtung Computerraum! Dieser Raum ist voll bis unter die Decke mit den tollsten elektrischen und vollelektronischen Anlagen. Staunen und Gucken darf jeder, aber rumwurschteln und Knöpfchen drücken auf den Computern dörfe nur mir. Die Experten.

...in Hochdeutsch eingegeben und auf hessische Wiedergabe drücken, die Stimme hört sich dann fast so an wie der Originaltext auf dem Bild. Man muss bei der Texteingabe evtl. ein bisschen nachhelfen (am Ende das "ich" durch "mir" ersetzen).

Angehängte Dateien:
#8020349
Lesenswert?

Die zweite Möglichkeit ist, den gewünschten Text einfach beim Google Übersetzer eingeben und auf Lautsprecherwiedergabe drücken. Dann müsste man allerdings parallel noch ein Aufnahmegerät mitlaufen lassen.

Zum Beispiel den kostenlosen No23-Recorder. Der wandelt den gesprochenen Text direkt in eine MP3-Datei um!

#8020364
Lesenswert?

Ich war von Qwen3-TTS (https://github.com/QwenLM/Qwen3-TTS) ziemlich beeindruckt, Demo gibt’s unter https://qwen-qwen3-tts.hf.space/

Kann man bei Bedarf auch lokal laufen lassen – Nachteil mag sein, dass es nicht direkt echtzeitfähig ist, aber wenn man das nicht unbedingt braucht, wird das durch die Qualität der Sprachsynthese mehr als aufgewogen, finde ich.

: Bearbeitet durch User
OP #8093678
Lesenswert?

Wenn ich das richtig verstehe, kann man mittels den Fable 5.1 von Androphic mittels Vibe Coding ein Sprachausgabemodell auf der eigenen Graphikkarte trainieren.
https://www.reddit.com/r/KI_engineering_de/comments/1waogt7/sprachausgabe_mit_kleinem_speicherbedarf_mit/
Das müsste dann eigentlich auch mit der eigenen Stimme und in Deutsch gehen. Die Frage ist, ob man das auch brauchbar und nicht als Prototyp hinbekommt.

#8093719
Lesenswert?

Norbert schrieb:

Der schwäbische Akzent fehlt allerdings gerade bei diesem Text! ;-)

Zu openmoss gehört auch ein Voice-Designer (du beschreibst, wie die Stimme klingen soll, lässt kurz rechnen, und hast dann eine mehr oder weniger zur Beschreibung passende Stimme) Und Voice-Cloning (du gibst eine Sprachaufnahme rein, und daraus wird eine Stimme gebastelt, die du dann für TTS verwenden kannst)

Beides lokal ohne Cloud.

Aber ob sich damit schwäbisch oder andere Dialekte nachbilden lassen? Ich vermute eher weniger gut.

OP #8093855
Lesenswert?

Ich verwende supertonic
https://github.com/supertone-inc/supertonic

Interessant dabei ist, dass es manchmal eine andere Betonung verwendet. Vielleicht analysiert es den Textinhalt für die Betonung. Man kann verschiedene Stimmen auswählen und die Stimme im Anhang finde ich sehr gut. Bisweilen hat es Probleme, z.B. das Datum oder die Uhrzeit zu sagen.

Für den Satz

"Ich möchte jetzt das Datum und die Uhrzeit sagen. Es ist der 9.te
September 7 Uhr 10"

braucht es 2,6 Sekunden auf der Spark-DGX, die ja nicht sonderlich schnell ist. Wenn man einen Chatbot bauen will, müsste das etwas schneller sein, sonst ist es zu zäh.
Deshalb suche ich noch nach einer anderen Lösung die schnell ist und weniger Probleme bei den Zahlen hat.

Angehängte Dateien:

Antwort schreiben

Bitte melde dich an, um einen Beitrag zu schreiben.

oder

Mit Google-Account einloggen

Die Registrierung ist kostenlos und dauert nur eine Minute.

Jetzt registrieren