Skip to content

Speech to Text

Alles transkribieren. Nichts verpassen.

Die Speech-to-Text-API von GreenPT transkribiert Audio zu Text in zwölf Sprachen, in Echtzeit oder als Batch. Basierend auf Deepgram Nova-2 und Nova-3, zwei der genauesten verfügbaren Transkriptionsmodelle, und vollständig auf EU-Infrastruktur betrieben, damit Ihre Daten Europa nie verlassen.

  • Deepgram Nova-2 und Nova-3
  • 12 Sprachen
  • Echtzeit und Batch
  • DSGVO-konform
  • EU-gehostet

Anwendungsfälle

Wo Menschen sprechen, brauchen Sie den Text.

Speech to Text funktioniert überall dort, wo Audio auf Arbeitsabläufe trifft. Hier setzen unsere Kunden es am häufigsten ein.

  • Besprechungsnotizen

    Einmal aufnehmen, sofort nachlesen. Verwandeln Sie jedes Gespräch in ein durchsuchbares, teilbares Transkript, ohne dass jemand mitschreiben muss.

  • Kundengespräche

    Transkribieren Sie Support-Gespräche in Echtzeit. Erkennen Sie wiederkehrende Probleme, schulen Sie Ihr Team und behalten Sie eine vollständig durchsuchbare Aufzeichnung jeder Interaktion.

  • Interviews und Podcasts

    Aus stundenlangem Audio werden in Sekunden seitenweise Text. Zitate, vollständige Transkripte und Kapitelzusammenfassungen, bereit zur Veröffentlichung oder Analyse.

  • Barrierefreiheit

    Machen Sie jedes Audio- und Videoformat lesbar. Präzise Untertitel und Transkripte, die Ihnen helfen, gesetzliche Anforderungen an die Barrierefreiheit zu erfüllen.

  • Forschung und Analyse

    Gewinnen Sie Erkenntnisse aus Fokusgruppen, Nutzerinterviews und Feldaufnahmen, ohne stundenlange manuelle Transkriptionsarbeit.

  • Diktieren statt tippen

    Sprechen Sie, anstatt zu tippen. Verwandeln Sie gesprochene Notizen in ausgefeilte E-Mails, Dokumente und Berichte, so schnell wie Sie denken.

Angetrieben von Deepgram

Die genauesten Transkriptionsmodelle. Jetzt auf europäischer Infrastruktur.

Wir haben uns für Deepgram entschieden, weil es bei Genauigkeit, Geschwindigkeit und Sprachabdeckung branchenführend ist. Green S setzt Nova-2 ein und deckt zwölf Sprachen ab. Green S Pro setzt Nova-3 ein, Deepgrams neuestes Modell, für die höchstmögliche Genauigkeit in fünf Kernsprachen sowie mehrsprachiges Mischen. Beide laufen auf unseren eigenen EU-gehosteten Servern: Ihr Audio wird nach europäischem Recht verarbeitet und niemals an einen US-Anbieter weitergegeben.

API-Dokumentation lesen
Modelle
Nova-2 / 3
Sprachen
12
Live-Latenz
<1 s
Datenhoheit
Nur EU

Die Deepgram-Partnerschaft

Amerikanische Technologie, europäische Kontrolle.

Deepgram entwickelt die Transkriptionsmodelle. Wir lizenzieren diese Modelle und betreiben sie selbst, auf GreenPTs eigenen Servern in Europa. Es ist eine Zusammenarbeit, keine Datenweitergabe: Deepgram ist unser Technologielieferant, niemals ein Verarbeiter Ihrer Daten. Die Engine ist also amerikanisch, doch Ihr Audio wird ausschließlich von Infrastruktur verarbeitet, die wir selbst betreiben, nach europäischem Recht. Genau das bedeutet das für Sie.

Unseren vollständigen Datenschutzansatz lesen
  • Ihr Audio verlässt die EU nie. Jede Datei und jeder Live-Stream wird auf unseren europäischen Servern verarbeitet und gespeichert. Nichts wird in die USA gesendet.
  • Wir betreiben die Modelle selbst. Die Modelle laufen auf GreenPTs eigener Infrastruktur. Es gibt keinen API-Aufruf an Deepgram und keinen Umweg über ein US-Rechenzentrum.
  • Deepgram hat keinen Zugriff. Deepgram kann weder auf unsere Server noch auf Ihr Audio oder Ihre Transkripte zugreifen. Sie liefern die Technologie; Ihre Daten berühren sie nie.
  • Niemals für Training verwendet. Ihr Audio und Ihre Transkripte werden niemals zum Trainieren oder Verbessern eines Modells verwendet, weder unseres noch das eines Dritten.
  • Außerhalb der Reichweite des US CLOUD Act. Weil die Daten und die Infrastruktur vollständig europäisch sind und Deepgram keinen Zugriff hat, liegen Ihre Daten außerhalb der Reichweite von US-Regierungsanfragen.
  • Kein Nach-Hause-Telefonieren. Die Modelle laufen in unserer Umgebung, ohne Telemetrie zurück an Deepgram. Was in unserer Infrastruktur passiert, bleibt in unserer Infrastruktur.

Verfügbare Modelle

Wählen Sie das Modell, das zu Ihrer Arbeitslast passt.

  • Deepgram Nova-2

    Green S

    Batch 0,12 €/Std. · Live 0,16 €/Std.

    Sommerangebot · 50 % Rabatt bis 31. Aug. 2026

    Breite Sprachabdeckung für den Alltag. Zwölf Sprachen, Echtzeit und Batch, intelligente Formatierung und Sprechererkennung, zum niedrigsten Preis pro Minute.

    • 12 Sprachen: EN, DE, ES, FR, IT, NL, PT, RO, BG, CA, DA, FI
    • Echtzeit und Batch
    • Interpunktion und intelligente Formatierung
    • Sprechererkennung mit Diarization V2
    • Stimmung, Themen und Absichten
  • Deepgram Nova-3

    Green S Pro

    Batch ab 0,12 €/Std. · Live ab 0,16 €/Std.

    Sommerangebot · 50 % Rabatt bis 31. Aug. 2026

    Die höchste verfügbare Genauigkeit. Entwickelt für anspruchsvolle Anwendungsfälle: medizinische, juristische und Contact-Center-Aufnahmen. Es nutzt außerdem ein echtes mehrsprachiges Modell, sodass ein einzelnes Gespräch, das die Sprache wechselt, korrekt transkribiert wird, selbst wenn Sprecher mitten im Satz die Sprache wechseln.

    • 5 Kernsprachen: EN, DE, NL, SV, TR
    • Automatische Spracherkennung
    • Mehrsprachiges Modell: ein Gespräch, bis zu 10 Sprachen gleichzeitig
    • Diarization V2 (3,3-mal genauer)
    • Zusammenfassung (Batch, Englisch)

Was Sie bekommen

Alles, was Ihre Transkriptions-Pipeline braucht.

  • 12 Sprachen

    Green S deckt zwölf Sprachen in West-, Nord- und Osteuropa ab, darunter Englisch, Deutsch, Spanisch, Französisch, Italienisch, Niederländisch, Portugiesisch und mehr.

  • Echtzeit-Transkription

    Latenz unter einer Sekunde für Live-Anwendungen. Partielle Zwischenergebnisse ermöglichen reaktionsschnelle Sprach-UIs: Live-Untertitel, Gesprächsüberwachung, Sprachassistenten.

  • Jedes Audioformat

    WAV, MP3, FLAC und alle gängigen Audioformate werden unterstützt. Laden Sie Dateien direkt hoch oder verweisen Sie auf eine URL oder einen Cloud-Speicher. Batch-Verarbeitung in jedem Umfang.

  • Sprechererkennung

    Wissen Sie, wer was gesagt hat. Angetrieben von Deepgram Diarization V2 über alle Modelle hinweg: 3,3-mal genauer als das Vorgängermodell bei der Frage, wer wann gesprochen hat.

  • Stimmung, Themen und Absichten

    Gehen Sie über das Transkript hinaus. Erkennen Sie den emotionalen Ton jedes Satzes, identifizieren Sie zentrale Themen und finden Sie heraus, was Sprecher erreichen wollten, ganz ohne zusätzlichen Code.

  • Zusammenfassung

    Erhalten Sie neben dem vollständigen Transkript eine automatische Zusammenfassung langer Aufnahmen. Ideal für Besprechungsprotokolle, Interviewnotizen und Forschung. Verfügbar für die Batch-Transkription.

  • OpenAI-kompatible API

    Fügt sich in jede bestehende Integration ein, die den OpenAI-Transkriptions-Endpunkt nutzt. Keine Codeänderungen, kein Lock-in. SDKs für Node.js und Python verfügbar.

  • EU-gehostet, DSGVO-konform

    Ihr Audio wird auf unseren europäischen Servern verarbeitet und gespeichert. Es wird niemals an einen US-Anbieter übermittelt und niemals zum Training von Modellen verwendet.

  • Nachhaltige Infrastruktur

    Jede Transkription läuft auf EU-Servern mit Ökostrom. Wir messen und veröffentlichen den Energie- und CO2-Fußabdruck jedes API-Aufrufs.

Neu

3,3×

genauere Sprechererkennung

Deepgram Diarization V2

Der bisher größte Sprung in der Sprechererkennung.

Batch Diarization V2 nutzt eine neue Speaker-Embedding-Architektur und verbesserte Clustering-Algorithmen, die die Fehlerrate bei Voice-Agent-Gesprächen, Contact-Center-Aufnahmen und medizinischen Transkriptionen senken. In direkten Vergleichen entschieden sich die Prüfer mehr als 3,3-mal so häufig für V2 statt für das Vorgängermodell. Es funktioniert mit allen Nova-Modellen, unterstützt mehrsprachiges Audio und erfordert keine Änderungen an Ihrer bestehenden Integration.

Die Deepgram-Ankündigung lesen

Energiebewusst

Jede Stunde Audio hinterlässt einen Fußabdruck. Wir messen unseren.

Die meisten Transkriptionen laufen auf energiehungrigen Rechenzentren am anderen Ende der Welt. GreenPT führt jeden Auftrag auf europäischen Servern mit 100 % Ökostrom aus, und wir messen den Energie- und CO2-Aufwand für jede Stunde Audio, die Sie verarbeiten. Die grünste Transkription ist die, über die Sie tatsächlich Rechenschaft ablegen können.

Betrieben mit
100 % Ökostrom
Fußabdruck
Pro Stunde gemessen
Daten
Nur EU

Preise

Zahlen Sie für das Audio, das Sie transkribieren.

Speech to Text wird pro Stunde verarbeitetem Audio abgerechnet, ohne Mindestabnahme und ohne Gebühren pro Nutzer. Die Batch-Transkription ist günstiger; das Live-Streaming trägt einen kleinen Aufschlag für die Echtzeit-Zustellung. Jedes neue Konto startet mit einer 14-tägigen kostenlosen Testphase und vollem Zugang zu beiden Modellen.

Sommerangebot Jeder Tarif ist bis zum 31. August 2026 zum halben Preis. Der Rabatt ist in den Preisen unten bereits berücksichtigt, kein Code nötig.
Konto erstellen
Modell Batch (pro Stunde) Live (pro Stunde)
Green S Nova-2 · 12 Sprachen 0,23 € 0,12 € 0,31 € 0,16 €
Green S Pro Nova-3 · eine Sprache 0,23 € 0,12 € 0,31 € 0,16 €
Green S Pro Nova-3 · mehrsprachig 0,28 € 0,14 € 0,37 € 0,19 €

Durchgestrichene Beträge sind die regulären Tarife; das Sommerangebot halbiert bis zum 31. August 2026 jeden Tarif, danach gelten die regulären Tarife. Preise verstehen sich zzgl. MwSt. Sprechererkennung, intelligente Formatierung, Stimmung, Themen und Zusammenfassung sind ohne Aufpreis enthalten. Der API-Zugang erfordert ein aktives Pro-, Teams- oder API-Abonnement.

Speech to Text, kurz erklärt

Welche Speech-to-Text-Modelle verwendet GreenPT?

GreenPT setzt Deepgram Nova-2 und Nova-3 ein. Nova-3 führt bei Genauigkeit und mehrsprachiger Echtzeit-Transkription; Nova-2 bietet die breiteste Abdeckung an Sprachen und Modi. Sie wählen Modell und Modus pro Anfrage auf einem einzigen Endpunkt.

Wo wird mein Audio verarbeitet?

Ausschließlich auf europäischer Infrastruktur mit Ökostrom. Es gibt keinen US-Fallback und keine globale Pipeline. Audio wird verarbeitet, nicht gespeichert, und niemals zum Training von Modellen verwendet.

Unterstützen Sie Echtzeit und Batch?

Ja. Streamen Sie Audio über WebSocket für die Live-Transkription oder senden Sie vorab aufgezeichnete Dateien für die Batch-Verarbeitung. Beides läuft über dieselbe API, sodass Sie nur einmal integrieren müssen.

Welche Sprachen kann es transkribieren?

Mehr als 40 Sprachen über Nova-2 und Nova-3 hinweg, darunter Niederländisch, Deutsch, Französisch, Spanisch, Italienisch und Englisch. Nova-3 transkribiert zehn Kernsprachen in Echtzeit und wechselt mitten im Satz zwischen ihnen.

Wie erhalte ich Zugang?

Erstellen Sie ein Konto, um einen API-Schlüssel zu erhalten, und richten Sie Ihr Audio dann auf den Endpunkt. Die Dokumentation behandelt Streaming, Batch, Diarisierung, die Modellmodi und die Modellunterstützung pro Sprache.

14 Tage kostenlos

Starten Sie heute mit dem Transkribieren.

Voller Zugang zu jeder Sprache und jeder Funktion, 14 Tage kostenlos. Keine Kreditkarte erforderlich. Ihr Audio bleibt von der ersten Sekunde an in der EU.

Jederzeit kündbar.

  • 100 % Ökostrom
  • EU-gehostet
  • DSGVO-konform