Eilmeldung 21:15 Barcelona drängt Camp Nou für das Finale der Weltmeisterschaft 2030, während Casablanca und Madrid konkurrieren 20:45 Marokkos Devisenreserven werden bis 2026 55 Milliarden Dollar übersteigen 19:15 AFCON 2027 Qualifikationen: Burkina Faso mit frustrierendem Unentschieden gegen Benin 18:15 Marokko Wahlen 2026: Meta-Werbeausgaben werfen Fragen zur digitalen Kampagnenführung auf 18:00 Leo XIV hebt die Würde der Migranten während seines Paris-Besuchs vor einer großen Messe hervor 17:45 Zugverkehr in Deutschland nach Vandalismus an Bahnkabeln in Gelsenkirchen gestört 16:39 Marokko zum Vizepräsidenten des UN-Kongresses zur Verbrechensprävention in Abu Dhabi gewählt 15:15 Bentley tritt mit seinem ersten vollelektrischen Auto in die Elektro-Ära ein 15:04 Vectis: Lockheed Martin präsentiert neues wiederverwendbares kollaboratives Kampfflugzeug 14:47 Wissenschaftler enthüllen die Kräfte hinter den mehrjährigen Veränderungen der Tageslänge der Erde 14:32 Akute Unterernährung bei Kindern im Jemen steigt, während die Kämpfe zunehmen 14:14 Elon Musk sagt, dass SpaceX in sechs Monaten OpenAI und Anthropic herausfordern könnte 14:08 Kylian Mbappé fällt für die bevorstehenden Nations-League-Spiele der französischen Nationalmannschaft aus 14:00 Frankreich entwickelt schnellen Troponin-Test zur schnelleren Erkennung von Herzinfarkten 13:30 OpenAI berichtet, dass KI-Agenten versehentlich 53 von Nutzern eingereichte Bilder online veröffentlicht haben 13:13 Die EU schaut über ihre Grenzen hinaus, um die Kapazität für Satellitenstarts zu erweitern 12:45 Lazzarini warnt vor humanitären Risiken, während die Debatte über die Zukunft der UNRWA in Gaza intensiver wird 12:25 Japan verstärkt Maßnahmen zur wirtschaftlichen Sicherheit angesichts von Risiken in der Lieferkette 12:10 Bill Gates fordert stärkere staatliche Aufsicht über künstliche Intelligenz 11:57 Manchester City Urteil: Klub steht vor ungewisser Zukunft nach 114 Anklagen der Premier League 11:47 Marokko gehört zu den Ländern mit starkem Optimismus hinsichtlich der wirtschaftlichen Aussichten 11:30 Marokko erreicht den 70. Platz im Reisewirtschaftsindex 2026 des Weltwirtschaftsforums 11:11 Elon Musk sagt, dass KI und Roboter der einzige Weg zu allgemeinem Wohlstand sind 11:00 Trump lehnt Berichten zufolge den iranischen Plan zur Wiedereröffnung der Straße von Hormuz innerhalb von sieben Tagen ab 10:45 Trump sagt, Xi-Besuch habe große Fortschritte gebracht, während Iran und Hormuz Gesprächsthemen waren 10:45 Militärflugzeugabsturz in der DR Kongo fordert 14 Todesopfer, darunter zwei Generäle 10:28 Bourita hebt Marokkos Ansatz zur Stärkung der Rolle Afrikas in der Krisenprävention und Friedenssicherung hervor 10:24 US unterstützt X und Elon Musk im Fall der EU-Strafe von 120 Millionen Euro 10:12 Marokko fordert internationale Zusammenarbeit, die besser auf einkommensschwache Länder zugeschnitten ist 09:47 Medizinische Untersuchungen am 2. Oktober in der Untersuchung zum Tod von Abderrahim Faqir in Italien 09:32 Bourita erklärt, dass die UN-Generalversammlung den internationalen Schwung für Marokkos Autonomieplan in der Sahara gestärkt hat 09:15 Mark Zuckerberg überholt Michael Dell und wird viertreichster Mensch der Welt

Gemini erweitert realistische Sprachsynthese und dramatische Sprachfähigkeiten

Yesterday 09:42
Gemini erweitert realistische Sprachsynthese und dramatische Sprachfähigkeiten

Google erweitert die Funktionen seiner Gemini-KI-Modelle mit neuer Text-zu-Sprache-Technologie, die darauf ausgelegt ist, ausdrucksstärkere und natürlicher klingende Stimmen zu erzeugen. Die neuesten Systeme können ein breiteres Spektrum an stimmlichen Eigenschaften reproduzieren, sodass die generierte Sprache Veränderungen in Ton, Akzent, Rhythmus und Emotion widerspiegeln kann.

Das Update ist Teil von Googles umfassender Entwicklung der Gemini-Familie, während das Unternehmen weiterhin über die grundlegende Textgenerierung hinausgeht und multimodale KI-Systeme entwickelt, die mit Sprache, Bildern, Videos und anderen Inhaltsformen arbeiten können.

Zu den neuen Angeboten gehören Gemini Flash TTS und Flash-Lite TTS, die Benutzern und Entwicklern mehr Kontrolle darüber geben, wie die generierte Sprache geliefert wird. Anstatt einfach geschriebenen Text in gesprochene Wörter umzuwandeln, können die Modelle detaillierte Anweisungen befolgen, die beschreiben, wie eine bestimmte Zeile klingen soll, einschließlich Änderungen in Tempo, Intensität, Pausen, Flüstern, Lachen und anderen stimmlichen Hinweisen.

Google sagt, dass seine Technologie originale Stimmen aus Beschreibungen in natürlicher Sprache erzeugen kann und mehr als 100 Sprachen und Dialekte unterstützt. Das Unternehmen stellt auch eine große Bibliothek von einsatzbereiten Stimmen für Produktionszwecke zur Verfügung, während eine kurze Sprachprobe verwendet werden kann, um eine konsistente synthetische Stimme zu erstellen, wenn der Benutzer die erforderliche Genehmigung hat.

Die Technologie eignet sich besonders für Situationen, die Dialoge und charakterbasierte Darbietungen umfassen. Ein einzelnes Skript kann in ein Gespräch mit verschiedenen Stimmen verwandelt werden, wobei das System die Konsistenz zwischen den Charakteren über längere Aufnahmen hinweg aufrechterhält. Solche Fähigkeiten könnten nützlich für Podcasts, Hörbücher, Synchronisationen, erzählte Videos und sprachbasierte Anwendungen sein.

Die Verbesserungen spiegeln auch den wachsenden Wettbewerb im Markt für KI-generierte Stimmen wider, in dem Unternehmen versuchen, synthetische Sprache zunehmend natürlich und ausdrucksstark klingen zu lassen. Googles eigene Tests haben in mehreren Sprachqualitätsbewertungen starke Ergebnisse gezeigt, obwohl konkurrierende Dienste in bestimmten Kategorien im Zusammenhang mit stimmlicher Realität und Vielfalt ebenfalls gut abgeschnitten haben.

Die neue Technologie ist nicht nur auf Entwickler beschränkt. Google hat begonnen, seine Sprachmodelle in Produkte wie NotebookLM zu integrieren, während Flash-Lite TTS auch in Google Vids eingeführt wird. Entwickler können über Googles KI-Entwicklungstools und APIs auf die Modelle zugreifen, wodurch die Technologie einer breiteren Palette von Anwendungen zugänglich wird.

Die Sprachsynthese wirft auch wichtige Fragen zu Einwilligung, Nachahmung und dem potenziellen Missbrauch synthetischer Stimmen auf. Google hat daher Sicherheitsvorkehrungen eingeführt, die eine Genehmigung zur Reproduktion der Stimme einer Person erfordern, und verwendet Technologien wie SynthID und C2PA-Zertifikate, um KI-generierte Inhalte zu identifizieren.

Die Verfügbarkeit einiger Funktionen zur Sprachsynthese unterliegt auch regionalen Einschränkungen, die die unterschiedlichen regulatorischen und rechtlichen Rahmenbedingungen für synthetische Medien widerspiegeln.

Mit diesen Entwicklungen bewegt sich die Sprachtechnologie von Gemini in Richtung eines leistungsorientierteren Ansatzes, bei dem KI-generierte Stimmen nicht nur Worte, sondern auch Elemente der Darbietung und Emotionen vermitteln können. Der Wandel verdeutlicht, wie generative KI zunehmend in die kreative Produktion integriert wird, während Fragen zu Einwilligung, Transparenz und verantwortungsvollem Einsatz weiterhin zentral für die Entwicklung der Sprachsynthesetechnologie bleiben.


  • Fajr
  • Sonnenaufgang
  • Dhuhr
  • Asr
  • Maghrib
  • Isha

Mehr lesen

Diese Website, walaw.press, verwendet Cookies, um Ihnen ein gutes Surferlebnis zu bieten und unsere Dienste kontinuierlich zu verbessern. Durch die weitere Nutzung dieser Website stimmen Sie der Verwendung dieser Cookies zu.