Technik

Loquendo, Mbrola, und andere TTS voices, die man als Projekt betrachten könnte.

Started by marchoffmann 24 posts last post 2 years ago Page 1 of 2

#1

Transcription

so wunderschön ich bin es noch mal ich mache sowas von voll aber ich weiß ja nicht wird sich jemand eigentlich die ambrose sowie hier oder die vier oder was ich muss das ja mit der e-speak im nvidia addon ich habe es auch mit sapi 5 da habe ich dann auch die anderen stimmen wie m6 und oder d6 d5 d7 d3 ist nicht so der rede wert aber ich würde ja also können mich zwar vielleicht fragen warum aber ich finde es einfach interessant damit herum zu experimentieren ich habe ein macbook pro 2009 mit mac os er kapitän und ich habe zurzeit ein macbook pro anfang 2015 mit picture kriege ich das da irgendwie drauf und die andere frage auf dem kanal 2004 gibt es ein video wo dieser lupendo installiert ist das ist man nicht bedrohungsfrei also windows hat sich da schon mal beschwert bei mir ist auch nur in englisch und ich hätte gerne in deutsch vielleicht weiß dass hier jemand das machen kann

McOi

#2

Transcription

hallo mark also ich habe die im bruder drüben im linux laufen gehabt ich muss es direkt noch mal ausziehen ich hatte das in einer früheren installation von art gehabt da lief das über ein speech dispatcher der ispeak und die also der hat ispeak benutzt um aus dem text vornehmen zu bauen und hat im bruder benutzt um diese von nehme so zu sagen in audio als au datei raus zu lassen und dieser au datei wurde dann auf der nachricht gebucht in dem пишen vornehmen dann mit play abgespielt ja und diese kommando kette die wurde dann jedes mal aufgerufen wenn man irgendwas spielen wollte da hat er dann hat er dann sogar pr play benutzt also puls audio unter windows habe ich das noch nicht hingekriegt unter windows habe ich das absolut noch nicht hingekriegt im roller und speak und so weiter miteinander zu vergeben da wüsste ich jetzt auch gar nicht da müsste ich mir dann alles mögliche erst mal an land holen also sox und ja ich speak ist auf der kommando zeile wahrscheinlich zu haben aber dass dann müsste ja auch ein treiber irgendwie existieren für sapi also der der das dann die sapi einträgt oder sonst was also damit habe ich mich noch nie befasst das unter windows irgendwie in die gänge zu kriegen ich weiß dass es da mal ein baukasten gab aber der lief alles andere als stabil und der lief dann auch nur mit der de4 und das ja alles andere als zufriedenstellend also ich habe es unter windows noch nicht hingekriegt wenn dann heißt unter linux hingekriegt und das lief auch recht recht gut muss ich sagen also wenngleich das ein bisschen mehr cpu gefressen hat als die e-speak alleine aber na ja hat eben funktioniert war ein bisschen fummelig einzurichten gebe ich zu damit mit speech dispatcher conf hacken und sowas also speech de conf und die im roller nee e-speak generic conf das alles richtig hin zu biegen da aber es hat funktioniert es hat funktioniert

#3

Transcription

hallo hier ist das 723 ich habe mal mit dem es gab mal ein plugin da hat das wohl auch über nvidia laufen lassen also da könnte man diese mbruler tools installieren die alten und dann hat man die add-on installiert das add-on hat die ganzen databases in den espeak ordner reinkopiert von der von der von der espeak von nvidia und dann kommt man irgendwann auf mbruler in espeak ordner schalten und dann hat man sämtliche stimmen von mbruler in espeak gehabt allerdings war das so blöd weil der hat immer nur so gut geklungen wie espeak geklungen hat und dann hat er teilweise auch die wörter so komisch zusammen und auseinander gezogen wie espeak das macht das war halt weil eigentlich konnte die stimme ja viel mehr also ich habe halt demos gehört davon und so an sich ohne sapi anbindung oder so konnte das ding ja viel mehr dann gab es immer noch mal eine version die wo man dann die daten in espeak reinkopiert wenn man das dann den installer genommen hat ich glaube auch dass die version immer noch vorhanden ist im netz allerdings weiß ich nicht ob die unter windows 10 noch läuft und dann muss man jedes mal wenn man irgendwas auf diese stimme loslassen will muss man nach dem er nach dem neustart oder nach dem computer hochfahren erstmal den lizenzvertrag akzeptieren bevor das dann losgeht und dann kann man die auch benutzen und dann heißt die glaube ich auch espeak mbola de2 oder so und die klingt dann aber auch nur so gut wie die espeak und da die windows version ein bisschen schlechter klingt als die nvda version ja war das irgendwann nicht mehr so schön ich habe die unter xp ab und an mal zwei laufen oder unter wind 7 auch nur zum laufen gehabt kriegt aber es ist halt blöd wenn er dann immer nur den espeak die espeak benutzt um da die die den sound von der stimme zu erzeugen und die dann halt nur so gut ist wie die espeak ist halt schade dass der da nicht sein volles potenzial ausschöpfen konnte sag ich jetzt mal genau aufnahme stoppen

#4

Transcription

naja das ist schon das ist schon schade dass das so beschränkt also im bruder und und die speak und so dass das so beschränkt ist aber immerhin immerhin haben wir jetzt den info also eine stimme die so klingt wie der info box gerhard tatsächlich als frei verfügbare stimme und zu zeiten der info box desktop 2 musste man dafür noch richtig viel geld bezahlen das war richtig heftig nee aber es ist schon interessant und die erweiterung vielleicht finde ich die auch noch aber danke für den tipp das ist so was tatsächlich als add-on gab und gibt cool die im bruder tools ja die habe ich auch noch herumliegen 3 1 0 h oder so hießen die also versionsmäßig das wurde ja nie mehr aktualisiert glücklicherweise gibt es ja inzwischen jetzt auch in paketformaten für alle möglichkeiten linux distribution ja im art kannst du das im aur bekommen auch die ganzen stimmen die kann man dann alle mit einmal ganz bequem ziehen über den aur manager und dann hat man die auch genau an der richtigen stelle das ispeak die sich greifen kann beziehungsweise man kann dann eben über speech friemeln da gibt es auch vor definierte konfigurationen dafür also es ist jetzt längst nicht mehr so schwierig wie es damals war mit text info und so weiter der ganzen mist ja aber danke für den tipp mit der im bruder wie die erweiterung

#5

Transcription

Ja, und was Loquendo angeht, ich glaube, die sind von irgendjemandem geschluckt worden, nuance oder so, denn ich kann mich noch erinnern, dass es die Webseite loquendo.com gab und da konnte man die ganzen Stimmen runterladen. Loquendo Stefan für Deutsch und Loquendo Dave für Englisch und so, also US-Englisch. Und das hat wunderbar, also die klangen wunderbar eigentlich. Und ja, die haben dann die Webseite aber Stück für Stück zurückgebaut. Da war es dann so, dass die Webseite... ...die Webseite zwar noch da war, aber man konnte dann die Stimmen nicht mehr runterladen. Die haben dann einfach nur noch geschrieben, ja, wir sind in den und den und den Bereichen aktiv und entwickeln für die und die und die und die Anwendungsgebiete individuelle Lösungen für Sprachsynthese und so. Und ja, weil runterladen konnte man sich diese Desktop-Varianten nicht mehr. Und die wurden auch nicht mehr zum Kauf angeboten. Ich kann mich erinnern, dass der Loquendo Stefan... ...damals 150 Euro gekostet hat. Und die wurden dann aber irgendwann gar nicht mehr zum Kauf angeboten. Und ja, die sind dann von irgendwem geschluckt worden. Ich weiß aber absolut nicht von wem. Beziehungsweise sie tauchen jetzt, glaube ich, auch bei NextUp auf. Da habe ich sie jedenfalls zuletzt angeboten gesehen. Ich weiß aber nicht mehr zu welchem Preis. Und ja, die sind richtig gut. Wer sich in Telefon-Chat-Systemen rumgetrieben hat, der wird noch das Irrenhaus in Hamburg kennen. Und das... ...hat auch den Loquendo Stefan. ...hat auch den Loquendo Stefan. ...hat auch den Loquendo Stefan. ...hat auch den Loquendo Stefan. Und das war eigentlich ganz gut. Also dafür ist das ja auch gedacht gewesen. Also telefonische Anwendung. Ja, der Telcaster von denen, der war auch nicht schlecht. Man hat Podcasts übers Telefon hören können. Das war nicht schlecht. Da haben die einen Scheiß drin gehabt. Podcasts. die es inzwischen gar nicht mehr gibt. Naja.

#6

Transcription

Wo wir es gerade vom Gerhard hatten. Die nutzen auch tatsächlich Ambrola Datenbanken. Ich habe ja die Infovox Desktop am Laufen. Gerade. Und die kann man tatsächlich ersetzen. Diese Datenbanken. Es muss halt eine 22 KHz Datenbank sein. Also entweder D6. Das ist die einzige männliche 22 KHz Datenbank. Und dann gibt es noch D3, D5 und D7. Die sind auch 22 KHz. Aber ja, ich finde mit dem D6 klingt das noch besser als mit der Original. Ich finde die haben, als sie es von 16 auf 22 KHz hochgesampelt haben, haben sie es echt verunstaltet, muss ich sagen. So, mit einer richtigen, die schon immer auf 22 KHz war, klingt das einfach besser. Ja, genau. Und ich muss ganz ehrlich sagen, die Art wie E-Speak Ambrola, also wie die E-Speak, na hier, die Art wie E-Speak Ambrola, die Art wie E-Speak Ambrola in E-Speak klingt, also wie die E-Speak Umsetzung da klingt, das mag ich überhaupt nicht. Das fand ich von Infobox viel besser gelöst. Ja.

#7

Transcription

Gibt es denn dieses Plugin noch, also dieses Addon noch, unter der aktuellen NVDA als lauffähige Version? Das würde mich mal interessieren, weil das wäre nicht schlecht.

#8

Transcription

Nee, das gibt's leider nicht für die Python 3 Version, also für 2019.3 und neuer gibt's das leider nicht. So nur noch für die alten halt, aber mit der SAPI 5 eSpeak lässt sich das auch nutzen. Ja.

#9

Transcription

So, hallo Leute, ich habe es jetzt hingekriegt mit Ambrola und eSpeak, allerdings mit SAPI 5. Und zwar funktioniert das so, dass ihr euch von der offiziellen eSpeak Seite, eSpeak.sourceforge.net, die aktuelle Version runterladet, eSpeak 1.4.8, die installiert ihr und dann fragt ihr euch nach Stimmen, die ihr hintereinander weg eintragen könnt. Also da sind dann, ich glaube, sechs Zeilen, sechs Eingaben. Wo ihr hintereinander Stimmen-Namen eintragen könnt, mit Leerzeichen getrennt, von Stimmen, die ihr registrieren wollt mit eSpeak für SAPI 5. Da tragt ihr dann meinetwegen die erste Zeile, wo dann irgendwie DE und DEF2 oder sowas steht, tragt ihr dann ein MB-DE1-Leerstelle. MB-DE1-Leerstelle. MB-DE1-Leerstelle. MB-DE2 und so weiter bis MB-DE8, weil das acht Stimmen sind, die für Deutsch verfügbar sind. In die zweite Zeile zum Beispiel MB-EN1 für die britische, englische Stimme zum Beispiel. Und in die dritte Zeile meinetwegen MB-US1, MB-US2, MB-US3. MB-US3 für die englische Stimme. Ja, oder auch polnische gibt es, glaube ich, auch. Ich weiß gar nicht, wie viele. Aber ich glaube, ich glaube, ich hatte da eine gesehen, mindestens. Die Stimmen gibt es nicht auf der offiziellen Ambrola-Seite nicht mehr. Die Webseite gibt es nicht mehr. Da sagt er 502 Bad Gateway. Aber wenn ihr nach Ambrola Voices... sucht, dann findet ihr ein GitHub Repository, wo die alle verfügbar sind. Wenn man das Repo auschecken würde, da hätte man alle Ambrola-Stimmen, die es gibt. Und das sind einzelne Dateien, die ihr dann nach... Also die haben auch keine Erweiterung. Die heißen dann einfach DE1, DE2, DE3. Und diese Dateien, die ihr dann bekommt auf der Seite, das ist eine Riesentabelle, die ihr dann kriegt unter dem GitHub Repo. Diese ganzen Dateien kopiert ihr nach Program Files x86, eSpeak, eSpeak Data, Ambrola. Ja. Das Rechner ist standardmäßig leer. Und da kopiert ihr die ganzen Stimmen rein. Und wenn ihr das gemacht habt und beispielsweise NVDA neu startet, dann habt ihr unter SAPI 5 auf einmal die ganzen Ambrola-Stimmen. eSpeak, MB, DE1, eSpeak, MB, DE2, eSpeak, MB. 3 und so weiter. Und sie funktionieren auch. Ob das jetzt nach demselben Strickmuster auch unter Linux funktionieren würde oder bei dem E-Speak, was bei NVDA mit dabei ist, das weiß ich nicht. Aber auf jeden Fall kann man sich damit eine E-Speak mit Ambrola-Stimmen machen. Also das funktioniert auf jeden Fall. Wie gesagt, man hat dasselbe Problem wie hier schon angesprochen, dass E-Speak die Phoneme manchmal nicht richtig bilden kann oder die Wörter manchmal nicht richtig aus Phonemen bilden kann. Aber das ist, ja, es funktioniert.

#10

Transcription

Hallo, guten Morgen. Hier ist DB920. Ja, ich habe das jetzt gemacht, wie du es gesagt hast, Dave, aber ich kriege es nicht hin. Er spricht immer mit der einer von den E-Speak-Stimmen, wo ich das genauso gemacht habe, wie du gesagt hast. Aufnahme stoppen. Schalter.

#11

Transcription

Na, wenn du den direkt in NVDA versucht hast reinzufügen, dann kann das natürlich sein, dass du die Stimme noch auswählen musst unter... Wo tauchte der auf? Variante glaube ich. Und dann... dann, dann könnte das sein, dass, dass der die auch benutzt. Aber wie gesagt, damit habe ich mich noch nie befasst mit der direkten Einbindung an NVDA. Also wie gesagt, SAPI 5, das funktioniert auf jeden Fall, aber... NVDA hat, nicht also oder oder wahrscheinlich nicht wie gesagt ich weiß es noch nicht und ispeak und ispeak ng die scheinen sich dann auch zu unterscheiden das kann natürlich auch sein dass die sich da unterscheiden nvidia benutzt ja ispeak ng und und ich habe hier die normale ispeak laufen die 148

#12

Transcription

Hallo, ja, ich habe hier die E-Speak laufen, ich habe sie auch schon so eingestellt gehabt, das ist der E-Speak MBD2, aber wie gesagt, er spricht halt mit dieser Stimme, genau. Bereit, Schalter, auf Amelie.

#13

Transcription

Dann kann es entweder sein, dass die EMPROLA Datenbank im ESPYC Ordner fehlt, also da ESPYC Data unter EMPROLA, es kann sein, dass da die Datenbank fehlt, die muss da rein, die EMPROLA Datenbank, oder dann kann es auch sein, dass die EMPROLA Tools noch nicht installiert sind. Die EMPROLA Tools, die kann ich dann gerne mal in einer privaten Nachricht euch schicken. Die habe ich noch rumliegen. Genau.

#14

Transcription

Hallo Sebi, das Problem könnte ein Lizenzvertrag sein, der manchmal aufpoppt und der akzeptiert werden will. Das Problem hatte ich nämlich gerade bei einer JAWS Installation. Da musste ich dann NVDA mit eSpeak betreiben und dann funktionierte das. Und zwar ist das Problem, dass dieser Lizenzvertrag nur dann akzeptiert werden kann, wenn du quasi die Sprache nicht, die SAPI nicht mit einem Screenreader ansprichst. Weil der Lizenzvertrag alles blockiert und damit ist auch der Screenreader blockiert. Weil der ja quasi seine Meldungen... Wenn er seine Meldung lesen will, kann er nicht, weil der Lizenzvertrag akzeptiert werden will. Und dann beißt sich die Katze in den Schwanz. Er will seine Meldung lesen, kann er nicht, weil das akzeptiert werden will. Und um das aber zu akzeptieren, muss diese Meldung irgendwie gelesen werden und das will er dann probieren, kann er nicht. Und so. Und das funktioniert eben nur, wenn man den Screenreader vorübergehend mit einer anderen Stimme betreibt. Zum Beispiel eSpeak oder auch wenn man ohne Sprachausgabe unterwegs ist, dann funktioniert das. Aber noch sicherer ist es eben SAPI völlig unabhängig vom Screenreader anzusprechen. Ja, mit Ballast. Oder mit dem Dialog SAPI-Stimme auswählen. Und den gibt es ja sowohl für 32 als auch für 64 Bit. Für 32 Bit gibt es den unter Windows-Sys-WOW-64-Speech-UX. Und der heißt SAPI-CP. Ja, also zum Beispiel sowas wie C://Windows-Sys-WOW-64-Speech-Speech-UX-SAPI-CPL. Und wenn man die aufruft und dann auf die Ambrola-Stimmen geht, sollte der Lizenzvertrag, der Lizenzvertrag erscheinen, sodass man den dann auch bequem akzeptieren kann. Ja, das ist das Problem, weil sich da die Katze unter Umständen in den Schwanz beißt. Und dann, ja, entweder überhaupt nicht mehr reagiert oder er fällt dann eben gleich auf eSpeak zurück. Jetzt weiß ich nicht, wie das Lizenz-Dilemma gelingt. Ich weiß nicht, wie das Lizenz-Dilemma gelöst wird, wenn man die Ambrola-Stimmen direkt in NVDA integrieren will. Denn die da einfach reinzukopieren, funktioniert ja dann auch nicht. Das lässt sich ja dann noch schwieriger lösen. Also eigentlich nur, indem man sich dann den Narrator dazu holt, der dann mit OneCore irgendwie spricht. Ähm, um dann den Dialog zu bedienen, ja, Lizenzvertrag. Das ist ein Lizenzvertrag von Ambrola, der dann aufpoppt, der dann akzeptiert werden will. Ähm, das hat also nix mit irgendwie SAPI zu tun oder damit, dass das, ähm, ja, fehlerhaft irgendwie programmiert wäre oder so, sondern das ist ein einfacher Lizenzvertrag, der da akzeptiert werden will. Ähm, das ist ein einfacher Lizenzvertrag, der da akzeptiert werden will. Ähm, das ist ein einfacher Lizenzvertrag, der da akzeptiert werden will.

#15

Transcription

Den hatte ich auch schon, aber er hat dann trotzdem mit der zuletzt eingestellten E-Speak Stimme gesprochen und hat dann aber in der Stimmenaufwahl auch E-Speak MBDE2 angezeigt. Aber er hat das dann zum Beispiel mit dem E-Speak Max gesprochen. Ich habe das dann auch noch mal probiert, weil Hot Sashi auch sagte, vielleicht die M-Roller Tools nochmal installieren und so. Dann kam auch der Lizenzvertrag, allerdings hat das leider nicht viel gebracht. Er hat dann weiterhin mit einer E-Speak Stimme gesprochen. Das ist etwas, oder hängt das an Windows 10, dass es da nicht mehr funktioniert. Aber wenn du sagst, es funktioniert, ja, verrückt.

#16

So, wollen wir das hier doch mal wieder erwecken! Bin gerade drauf gestoßen. Dieses Sapi ding habe ich auch probiert und bei mir kahm ja nicht mal dieses von der lizents die akzeptiert werden muss. Ich frage mich ob diese nvda Erweiterung irgendwie mit neuen nvda Versionen wieder zum Laufen gebracht werden kann. Sapi scheind ja nichts zu nützen
McOi

#17

Transcription

So, hallo Leute. Nach etlichen Jahren und Monaten möchte ich das hier mal wieder vorholen. Ich habe es jetzt hingekriegt, Ambrola und eSpeak unter Windows miteinander zu verweben. ChatGPT war da übrigens sehr hilfreich. Und zwar gibt es tatsächlich eine eSpeak 1.48 für SAPI. Und wenn man die nimmt und bei der Installation, ich glaube durch Leerzeichen getrennt, die Stimmen angibt, also DE, da steht schon vorgefertigt irgendwie drin, DE-F2, DE-Mail1 oder sowas. Und wenn man da dann eben sowas schreibt wie DE-MB. DE-MB, nein, MB, MB-DE1 oder so, MB-DE2, MB-DE3. Ich glaube das schreibt eSpeak sogar, dass man das so eingeben kann. MB-DE1, MB-DE2. So, da muss man sich die Ambrola Tools installieren. Und die wollen eine Datei Ambrola DLL nach System 32 kopieren. Das Problem ist aber, oder das Ding ist bei Windows 11, dass die über die Benutzerkontensteuerung umgeleitet wird nach Sys-WOW64. Ja, das muss man wissen. Die landet dann dort System-WOW64. Man kann ja auch... DIR-S nach Ambrola DLL suchen. So, die muss man sich nämlich schnappen. Und in das eSpeak Verzeichnis kopieren. Und dann eben die Ambrola Stimmen, also nur die Dateien, die keine Endungen haben, kopieren nach... App-Data, Local, eSpeak, eSpeak-Data, Ambrola. So, wenn man das alles gemacht hat, also eSpeak installiert, die Ambrola DLL an die richtige Stelle kopiert und die Ambrola Stimmen eingefügt, dann läuft das mit SAPI. Dann kommt auch keine Lizenz mehr, also zumindest ist mir das nicht begegnet, das Einzige, was eventuell passieren kann, was man wissen muss, wenn man NVDA an SAPI gebunden hat und fährt NVDA mit SAPI beim Systemstart hoch, dann kann das durchaus sein, dass er sich da verschluckt. Und dann ist es sehr... Ähm... Und dann ist es sehr... schwer, NVDA wieder in die Gänge zu bringen. Also, äh... Da hilft dann nur von außen, also über die Windows-RE oder mit einem Linux oder so, äh... oder den Narrator zu Hilfe nehmen und dann die NVDA-INI zu löschen und NVDA neu zu starten. Weil er nämlich dann eben auf SAPI zugreifen will und das klappt aber nicht und... Ja, da hängt er sich dann manchmal fest. Aber wenn jetzt das System normal läuft und man springt auf SAPI um, dann funktioniert das allermeistens. Ähm... Ja, das Problem ist halt wirklich, dass die Ambrola-Tools auch relativ schwer zu kriegen sind. Also, ich weiß nicht, bei Atyp gibt es die wohl noch. Es gibt auch eine belgische Webseite. Ambrola, war das? Ambrola.be? Ich weiß es nicht mehr. Ähm... Da gibt es auch noch die Stimmen. Also, das ist ein bisschen schwierig zusammenzusuchen. Ähm... Und... Ja, aber es funktioniert. Ähm... Und das Ergebnis ist dann eben eine Stimme. Also, die DE2, das ist dann... entspricht dann dem... äh... SVOX Gearhart. Ähm... Und die... Ich glaube, die DE1, das ist dann die... die Helga von SVOX. Äh, von SVOX, von Infovox. Infovox Gearhart und Infovox Helga. Ähm... Ähm... Ja, ich überlege gerade, ob die Stimmen wirklich richtig registriert werden. Ich glaube, ja. Sie werden entsprechend ihrer... ihres Geschlechts auch registriert. Äh... Das... Das passt alles. Ähm... Ja, und das... Das läuft stabiler als dieses SVOX-Gefrickel von damals. Ähm... Da kann ich mich noch erinnern. Da lief dann nur die DE4 und die auch nicht besonders stabil. Aber das hier mit E-Speak und Ambrola und so, das läuft... also zumindest stabiler als das andere. Also, ich will nicht sagen zu 100 Prozent, weil eben auch beim Start, beim Systemstart Dinge passieren können. Aber es ist schon ein Fortschritt im Gegensatz zu dem anderen.

#18

Transcription

Ihr könnt dazu übrigens auch Chat-GPT befragen, von wegen, wie richte ich Mbola mit eSpeak unter Windows ein. Da schreibt er genau diesen Ablauf. eSpeak installieren, die eSpeak-Stimmen bei der Installation angeben, also die Mbola-Stimmen bei der Installation mit angeben, die Mbola-Tools installieren, die Mbola-Stimmen an die richtige Stelle kopieren, die Mbola an die richtige Stelle kopieren und das Ding läuft.

#19

Finde ich den noch irgendeinen link zu den tools? Und wo genau finde ich dann diese dll, sprich wo in welchem Ordner ist das dann am Ende?
McOi