Gemini Live-Audio
· Quelle: Simon Willison
Google hat zwei neue sprachbasierte KI‑Konversationsmodelle vorgestellt: Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking. Beide Systeme ermöglichen einen kontinuierlichen Sprach-zu-Sprach‑Dialog und bieten ein Erlebnis, das der GPT‑Live‑Familie von OpenAI ähnelt. Um die Modelle zu testen, hat der Autor ein fortschrittliches Sprachmodell (GPT‑6 Astra Extra High) eingesetzt, das eine einfache Web‑Schnittstelle erzeugt. Diese benötigt keine externen Abhängigkeiten und erlaubt die Auswahl des Modells, die Einstellung einer Sprachvorlage, das optional eingeben eines System‑Prompts und die Durchführung einer Echtzeit‑Konversation direkt im Browser. Die Anwendung nutzt einen WebSocket, der von der Gemini‑API bereitgestellt wird, sowie die Web Audio API zum Aufnehmen und Abspielen von Audio. Dadurch kann der Nutzer das Modell unterbrechen, während es antwortet. Der Quellcode ist auf GitHub verfügbar, und das offizielle Gemini‑Live‑Tutorial erklärt, wie man die WebSocket‑Verbindung initiiert.
Diese Entwicklung erweitert die Möglichkeiten für Entwickler und Anwender, die sprachgesteuerte KI‑Interaktionen integrieren wollen. Sie reduziert die Abhängigkeit von Drittbibliotheken und vereinfacht die Implementierung von Sprachassistenten oder Kundendienst‑Chatbots. Die Einführung eines „Extended Thinking“-Modells deutet zudem auf verbesserte Rechen- und Konsistenzfähigkeiten bei Echtzeit‑Antworten hin.
Originalartikel lesen auf Simon Willison
Diese Zusammenfassung ist eine informationelle Synthese von dataqbs.com. Alle Rechte am Originalinhalt liegen beim Autor und dem genannten Medienunternehmen. Wir handeln ausschließlich als Kuratoren von Technologie-Nachrichten und beanspruchen keine Urheberschaft.