> ## Documentation Index
> Fetch the complete documentation index at: https://docs.itellico.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# KI-Pipeline-Leitfaden

> Verstehe, wie Transkribierer, KI-Modell, Stimme, Timing und Aussprache als eine Pipeline zusammenarbeiten

Deine Anrufenden erleben Transkribierer, Stimme, Modell und Timing nicht getrennt.

Sie erleben ein einziges Gespräch.

Dieser Guide hilft dir dabei, die AI-Pipeline als ein System zu betrachten, damit du vor dem Launch bessere Entscheidungen triffst.

## Warum das wichtig ist

Die meisten Probleme mit der Sprachqualität werden nicht von einer einzigen schlechten Einstellung verursacht.

Sie entstehen meist aus dem Zusammenspiel von:

* wie genau die Eingabe der Anrufenden transkribiert wird
* wie schnell das Modell entscheidet, was es sagen soll
* wie natürlich die gewählte Stimme klingt
* wie das System Pausen, Unterbrechungen und Aussprache handhabt

Wenn du nur eine Ebene optimierst, kann sich das Gespräch trotzdem langsam, roboterhaft oder fehleranfällig anfühlen.

## Die fünf Teile der AI-Pipeline

| Teil               | Was er steuert                                                      | Hauptdoku                                                                                                                   |
| ------------------ | ------------------------------------------------------------------- | --------------------------------------------------------------------------------------------------------------------------- |
| **Transkribierer** | Wie aus Anruf-Audio Text wird                                       | [Transkribierer](/de/build/voice-speech/transcriber)                                                                        |
| **KI-Modell**      | Wie der Agent denkt und antwortet                                   | [KI-Modell auswählen](/de/build/voice-speech/choose-ai-model)                                                               |
| **Stimme**         | Wie die Antwort für Anrufende klingt                                | [Stimme auswählen](/de/build/voice-speech/select-voice)                                                                     |
| **Sprechen**       | Geschwindigkeit, Stabilität, Stil und Aussprache                    | [Spracheinstellungen](/de/build/voice-speech/voice-settings) und [Aussprache](/de/build/voice-speech/custom-pronunciations) |
| **Timing**         | Unterbrechungen, Pausen, Stille und das Gefühl beim Sprecherwechsel | [Sprecherwechsel und Timing](/de/build/advanced/turn-taking-and-timing)                                                     |

## Starte mit dem gewünschten Ergebnis

Wähle die Pipeline-Konfiguration anhand des tatsächlichen Gesprächs, das du bereitstellst.

<AccordionGroup>
  <Accordion title="Schneller Telefon-Support oder Triage" defaultOpen>
    Priorisiere niedrige Latenz, klare Aussprache und gutes Unterbrechungsverhalten.

    Starte mit:

    * einem schnellen [Transkribierer](/de/build/voice-speech/transcriber)
    * einer klaren, neutralen Stimme
    * konservativem [Sprecherwechsel](/de/build/advanced/turn-taking-and-timing)
    * minimalen Ambient-Effekten
  </Accordion>

  <Accordion title="Markensensible Concierge- oder Sales-Erfahrung">
    Priorisiere Wärme, Markenfit und gleichmäßiges Tempo.

    Starte mit:

    * einer Stimme, die zu Tonfall und Zielgruppe passt
    * stärkerem Fokus auf den [Prompt-Leitfaden](/de/build/conversation/prompt-engineering-guide)
    * Aussprache-Regeln für Produkt- und Firmennamen
    * Test-Calls mit realistischen Einwänden und Unterbrechungen
  </Accordion>

  <Accordion title="Mehrsprachiger oder regionaler Rollout">
    Priorisiere Sprachabdeckung und lokale Genauigkeit.

    Starte mit:

    * Sprachunterstützung im [Transkribierer](/de/build/voice-speech/transcriber)
    * lokal passenden Stimmen in [Stimme auswählen](/de/build/voice-speech/select-voice)
    * Testskripten für jede Zielsprache
    * expliziten Prompt-Anweisungen, wenn Tonfall oder Formulierungen je Region anders sind
  </Accordion>

  <Accordion title="Compliance- oder privacy-sensible Workflows">
    Priorisiere Klarheit, Einwilligung und vorhersehbares Verhalten.

    Starte mit:

    * kurzen, direkten Stimmen mit wenig Verzierung
    * klaren [Ansage vor dem Anruf](/de/build/advanced/announcements)
    * expliziten [Datenschutz-Steuerungen für Gespräche](/de/build/advanced/conversation-privacy-controls)
    * konservativen Timing-Einstellungen, damit Anrufende leicht unterbrechen können
  </Accordion>
</AccordionGroup>

## Konfigurationsreihenfolge

Arbeite die Pipeline in dieser Reihenfolge durch. Jede Ebene hängt von der vorherigen ab.

| Schritt               | Was du konfigurierst                                         | Warum zuerst                                                                     |
| --------------------- | ------------------------------------------------------------ | -------------------------------------------------------------------------------- |
| **1. Transkribierer** | Sprache, Anbieter, Modell                                    | Wenn die Anrufenden falsch verstanden werden, kann nichts danach das ausgleichen |
| **2. Stimme**         | Anbieter, Stimme, Stimmenklonen                              | Wähle, was Anrufende hören, sobald die Transkription stimmt                      |
| **3. Feintuning**     | Einstellungen, Aussprache, Hintergrundgeräusche, Denk-Sounds | Feintuning erst nach der Wahl der Kernstimme                                     |
| **4. Timing**         | Turn-Taking, Stille, Unterbrechungen                         | Zuletzt abstimmen - Timing-Regler können tiefere Probleme verdecken              |

<Tip>
  Starte nicht mit Timing. Wenn Transkribierer, Stimme oder Prompt bereits Reibung erzeugen, verdeckt Timing-Tuning das eigentliche Problem statt es zu lösen.
</Tip>

**Wohin du für jeden Schritt gehst:**

* [Transkribierer](/de/build/voice-speech/transcriber) - Anbieter- und Sprachübersicht
* [Stimme auswählen](/de/build/voice-speech/select-voice) - Katalog und Anbieter-Hinweise
* [Spracheinstellungen](/de/build/voice-speech/voice-settings), [Aussprache](/de/build/voice-speech/custom-pronunciations), [Hintergrundgeräusche](/de/build/voice-speech/ambient-sound), [Denk-Sounds](/de/build/voice-speech/thinking-sounds)
* [Sprecherwechsel und Timing](/de/build/advanced/turn-taking-and-timing)

## Häufige Symptome und wo du zuerst hinschauen solltest

| Symptom                                                                             | Erster Blick                                                            | Danach prüfen                                                       |
| ----------------------------------------------------------------------------------- | ----------------------------------------------------------------------- | ------------------------------------------------------------------- |
| Agent versteht Namen, Adressen oder Zahlen falsch                                   | [Transkribierer](/de/build/voice-speech/transcriber)                    | [Aussprache](/de/build/voice-speech/custom-pronunciations)          |
| Stimme passt nicht zur Marke                                                        | [Stimme auswählen](/de/build/voice-speech/select-voice)                 | [Prompt-Leitfaden](/de/build/conversation/prompt-engineering-guide) |
| Sprache klingt roboterhaft oder ungleichmäßig                                       | [Spracheinstellungen](/de/build/voice-speech/voice-settings)            | [Stimme auswählen](/de/build/voice-speech/select-voice)             |
| Agent fällt Anrufenden ins Wort                                                     | [Sprecherwechsel und Timing](/de/build/advanced/turn-taking-and-timing) | [Transkribierer](/de/build/voice-speech/transcriber)                |
| Agent fühlt sich langsam an, nachdem die anrufende Person aufgehört hat zu sprechen | [Sprecherwechsel und Timing](/de/build/advanced/turn-taking-and-timing) | [KI-Modell auswählen](/de/build/voice-speech/choose-ai-model)       |
| Produkt- oder Firmennamen werden schlecht ausgesprochen                             | [Aussprache](/de/build/voice-speech/custom-pronunciations)              | [Prompt-Leitfaden](/de/build/conversation/prompt-engineering-guide) |
| Geklonte Stimme klingt inkonsistent                                                 | [Stimmen klonen](/de/build/voice-speech/voice-cloning)                  | [Spracheinstellungen](/de/build/voice-speech/voice-settings)        |

## Praktische Rollout-Reihenfolge

<Steps>
  <Step title="Logik zuerst im Chat belegen">
    Bestätige Prompt, Tools und Knowledge, bevor du Zeit in Voice-Tuning steckst.
  </Step>

  <Step title="Stimme im Browser bewerten">
    Achte im Browser auf Tempo, Aussprache und das Unterbrechungsgefühl.
  </Step>

  <Step title="Den vollständigen Call am Telefon validieren">
    Führe mindestens einen echten Telefon-Call durch. Telefon-Audio und Netzwerkverhalten verändern das Ergebnis oft.
  </Step>

  <Step title="Gesprächsdetails prüfen">
    Schau dir Transcript, Timing, Tool-Ausführung und jede Post-Call-Automation vor dem Launch an.
  </Step>
</Steps>

## Häufige Fehler

<AccordionGroup>
  <Accordion title="Die schönste Stimme wählen, bevor die Transkription geprüft ist" icon="microphone">
    Eine schöne Stimme hilft nicht, wenn die Anrufenden ungenau transkribiert werden. Starte mit der Erkennungsqualität und optimiere dann den Stil.
  </Accordion>

  <Accordion title="Langsame Antworten mit Hintergrundgeräuschen lösen wollen" icon="music">
    Hintergrundgeräusche können das Gefühl verbessern, lösen aber keine langsamen Modellantworten, langsamen Tools oder eine Transkription mit hoher Latenz.
  </Accordion>

  <Accordion title="Nur mit der eigenen Stimme und dem eigenen Akzent testen" icon="users">
    Teste immer mit den Anrufenden, die du tatsächlich erwartest: unterschiedliche Akzente, Sprechgeschwindigkeiten, Geräuschpegel und Unterbrechungsmuster.
  </Accordion>

  <Accordion title="Mehrere Ebenen gleichzeitig ändern" icon="sliders">
    Wenn du Transkribierer, Stimme, Prompt und Timing zusammen änderst, weißt du nicht, was das Gespräch wirklich verbessert oder verschlechtert hat.
  </Accordion>
</AccordionGroup>

## Nächste Schritte

<CardGroup cols={2}>
  <Card title="Stimme auswählen" icon="microphone" href="/de/build/voice-speech/select-voice">
    Die Stimme durchsuchen, vorhören und auswählen, die Anrufende hören
  </Card>

  <Card title="Transkribierer" icon="ear" href="/de/build/voice-speech/transcriber">
    Die Speech-to-Text-Ebene passend zu Sprache und Latenz auswählen
  </Card>

  <Card title="Stimmen klonen" icon="wand-magic-sparkles" href="/de/build/voice-speech/voice-cloning">
    Eigene gebrandete Stimmen erstellen und bewerten
  </Card>

  <Card title="Sprecherwechsel und Timing" icon="wave-square" href="/de/build/advanced/turn-taking-and-timing">
    Pausen, Unterbrechungen und Stille feinjustieren
  </Card>
</CardGroup>
