Entwickler & API

Schweizerdeutsch Speech API: Text-to-Speech & STT in Echtzeit für Entwickler

10. September 2026 · 7 Min. Lesezeit

Bisher scheiterten Voicebots und KI-Telefonie im Schweizer Markt an der grössten Hürde: Mundart. Mit der neuen Suisse Line Speech API stehen Entwicklern und Unternehmen jetzt native Text-to-Speech (TTS) und Speech-to-Text (STT) Modelle für alle Schweizer Dialekte über moderne REST- und WebSocket-Schnittstellen zur Verfügung – sekundengenau abgerechnet und 100% in Zürich gehostet.

Die Mundart-Herausforderung für Sprach-KI

In der Schweiz sprechen über 5 Millionen Menschen täglich Schweizerdeutsch. Doch für traditionelle KI-Modelle wie Siri, Alexa oder generische Cloud-APIs aus den USA stellt Mundart ein fast unüberwindbares Hindernis dar:

  • Keine Schriftsprache: Es existiert keine standardisierte Grammatik oder Rechtschreibung – jedes Wort wird nach Gehör geschrieben und kantonal völlig unterschiedlich artikuliert.
  • Starke phonetische Varianzen: Ein Satz wie «Ich gehe heute Nachmittag einkaufen» variiert von Züritüütsch («Ich gang hüt Namitag go poschte») über Bärndütsch («I ga hütt Nami ga poschte») bis hin zu Baseldytsch und Walliserdeutsch.
  • Hohe Latenz bei kaskadierten Systemen: Bisherige Notlösungen kombinierten Übersetzer und Hochdeutsch-Synthese – mit Latenzen von über 2 Sekunden, die flüssige Telefongespräche unmöglich machten.

Die Suisse Line Speech API löst dieses Problem durch von Grund auf auf Schweizer Dialekte trainierte akustische Modelle und Transformer-Architekturen.

🚀 Sofort testen mit 20 CHF Startguthaben

Erstellen Sie einen kostenlosen Entwickler-Account und testen Sie unsere WebSocket- und REST-Endpunkte direkt in der Swagger UI oder mit Ihrem Python-/Node-Projekt.

Zur Speech API Dokumentation →

Zwei Kernmodule: Text-to-Speech (TTS) & Speech-to-Text (STT)

Die API deckt beide Richtungen der Sprachverarbeitung modular ab:

1. Speech-to-Text (STT): Echtzeit-Transkription & Batch

Verwandeln Sie gesprochenes Schweizerdeutsch direkt in sauberen Text. Die API bietet zwei Ausgabemodi:

  • Phonetische Umschrift (Mundart): Perfekt für exakte Sentiment-Analysen und LLM-Prompting in natürlicher Schweizer Konversationssprache.
  • Normalisiertes Standarddeutsch: Ideal für nachgelagerte CRM-Systeme, Ticket-Erstellung und juristische Archivierung.

Über den Vollduplex-WebSocket-Stream (/v1/speech/stream) liefert die STT-Engine Transkripte mit einer Time-to-First-Audio (TTFA) von unter 500 Millisekunden – unabdingbar für interaktive Voice-Agenten.

2. Text-to-Speech (TTS): Authentische Schweizer Mundart-Stimmen

Standard-Cloud-APIs klingen bei Schweizerdeutsch hölzern oder verfallen in gefärbtes Hochdeutsch. Die Suisse Line TTS synthetisiert flüssige, warm modulierte Mundart-Stimmen mit natürlicher Satzmelodie, korrekter Betonung von Ortsnamen (z.B. Chuchichäschtli, Oerlikon, Chuchichäschtli, Schwyz) und dialektalen Redewendungen.

Technische Architektur & Code-Integration

Die API folgt den OpenAPI 3.0 Standards und lässt sich in jeder Programmiersprache in wenigen Minuten anbinden:

Schnellstart mit Python (Real-Time WebSocket Stream)

import asyncio
import websockets
import json

API_KEY = "sl_live_YOUR_KEY_HERE"
WS_URL = "wss://api.suisse-line.ch/v1/speech/stream"

async def stream_audio():
    headers = {"Authorization": f"Bearer {API_KEY}"}
    async with websockets.connect(WS_URL, extra_headers=headers) as ws:
        # 1. Konfiguration senden
        config = {
            "action": "start",
            "sample_rate": 16000,
            "language": "de-CH",
            "dialect": "auto",  # Erkennt Züridütsch, Bärndütsch etc.
            "normalize_to_standard_german": True
        }
        await ws.send(json.dumps(config))
        print("Verbunden! Audio-Pakete an API senden...")

        # 2. Transkripte empfangen
        while True:
            response = await ws.recv()
            data = json.loads(response)
            if data.get("type") == "transcript":
                print(f"[{data['dialect']}] {data['text']}")

asyncio.run(stream_audio())

Batch Transkription via cURL (REST API)

curl -X POST https://api.suisse-line.ch/v1/speech/transcribe \
  -H "Authorization: Bearer sl_live_YOUR_KEY_HERE" \
  -F "file=@audio_aufnahme.wav" \
  -F "language=de-CH" \
  -F "speaker_diarization=true"

Sicherheit & Schweizer Datenschutz: 100% Swiss Hosting

Für Schweizer Banken, Versicherungen, Spitäler und Anwaltskanzleien ist Datensouveränität nicht verhandelbar. Suisse Line erfüllt höchste Sicherheitsanforderungen:

Sicherheitsstandard Suisse Line Spezifikation
Rechenzentrum 100% Zürich (Interxion / Equinix Tier IV)
Zertifizierung ISO/IEC 27001 zertifiziertes ISMS
Datenschutz Revidiertes Schweizer DSG (revDSG) & EU-DSGVO
Kein KI-Datentraining Kundendaten werden niemals für Modelltraining genutzt

Transparente Abrechnung ohne Mindestgebühr

Entwickler zahlen nur das, was tatsächlich verarbeitet wird – sekundengenau ohne monatliche Grundgebühren:

  • Speech-to-Text: CHF 0.035 pro Audiominute (sekundengenau)
  • Text-to-Speech: CHF 0.015 pro 1'000 Zeichen
  • Sandbox-Modus: Kostenlose synthetische Testumgebung für CI/CD-Pipelines
Jetzt Speech API Dokumentation öffnen & testen →