> ## Documentation Index
> Fetch the complete documentation index at: https://docs.famulor.io/llms.txt
> Use this file to discover all available pages before exploring further.

# Transkriptionseinstellungen

> Optimiere Turn-Taking und Reaktionszeit über Endpunkttyp, Empfindlichkeiten und VAD für flüssigere Gespräche.

In den **Transkriptionseinstellungen** legst du fest, wann die KI erkennt, dass der User fertig gesprochen hat. Genau hier kannst du oft spürbar **Latenz reduzieren**.

<div style={{ position: "relative", paddingBottom: "56.25%", height: 0 }}>
  <iframe style={{ position: "absolute", top: 0, left: 0, width: "100%", height: "100%", border: 0 }} src="https://www.tella.tv/video/vid_cmn32610u019n07mnh5j86ldx/embed?b=0&title=0&a=1&loop=0&t=0&muted=0&wt=0&o=1" allowFullScreen allowTransparency />
</div>

## 1. Endpunkttyp

Beim **Endpunkttyp** wählst du, wie das Ende einer Nutzeraussage erkannt wird:

* **Spracherkennung** (Standard): in der Regel schneller, gut für geringe Latenz.
* **KI-Erkennung**: oft besser bei längeren Erzählungen und Denkpausen.

Empfehlung für viele Setups: mit **Spracherkennung** starten und nur bei Bedarf auf KI-Erkennung wechseln.

## 2. Endpunktempfindlichkeit

Die **Endpunktempfindlichkeit** bestimmt, wie lange die KI wartet, bevor sie davon ausgeht, dass der User fertig ist.

* **Schneller eingestellt**: weniger Wartezeit, oft bessere Reaktionsgeschwindigkeit.
* **Höher eingestellt**: mehr Sprechspielraum für langsamere Sprecher.

Wenn deine Zielgruppe eher langsam spricht (z. B. ältere Kundschaft), solltest du den Wert etwas anheben.

## 3. Unterbrechungsempfindlichkeit

Die **Unterbrechungsempfindlichkeit** steuert, wie leicht die KI beim Sprechen unterbrochen werden kann.

* Ein häufiger Ausgangswert ist **0,50**.
* **Outbound**: meist schneller unterbrechbar sinnvoll.
* **Rezeption / Empfang**: oft etwas mehr Stabilität sinnvoll.

## 4. VAD-Empfindlichkeit (bei Speech-to-Speech)

Bei **Sprache-zu-Sprache-Modellen** gibt es zusätzlich die **VAD-Empfindlichkeit**.

Wenn aktiviert, hilft eine weitere Logik dabei, Sprachpausen und Sprecherwechsel besser zu erkennen - ähnlich zum Verhalten aus modernen Voice-Modi.

## Empfohlene Vorgehensweise

1. Mit Standardwerten starten (Spracherkennung, moderate Regler).
2. Auf echten Testdialogen prüfen.
3. Immer nur einen Regler pro Test ändern.
4. Dann schrittweise auf deinen Use Case optimieren.

<Tip>
  Jeder Assistent reagiert etwas anders. Die besten Einstellungen findest du durch kurze, iterative Tests mit realistischen Gesprächsszenarien.

  Siehe auch: [Engine-Typen](/de/platform/engine-typen), [Fehlerbehebung zur Anrufqualität](/de/troubleshooting/call-quality) und [Transcriber-Provider-API](/de/api-reference/assistants/transcriber-providers).
</Tip>
