> ## Documentation Index
> Fetch the complete documentation index at: https://docs.famulor.io/llms.txt
> Use this file to discover all available pages before exploring further.

# Modelle & Stimmen

> Modelle auswählen, Stimmen vorhören, eigene klonen und zuverlässige Fallbacks einrichten

Die Modelle eines Assistenten entscheiden, wie gut er den Anrufer versteht und wie er klingt. Im Assistenten-Editor wählst du sie aus, feintunst den Sprechstil, klonst eine eigene Stimme und aktivierst Fallbacks, die einen Anruf am Laufen halten, falls ein Modell mitten im Gespräch ausfällt.

## Modellkatalog

Der Assistenten-Editor zeigt einen kuratierten Katalog der für deinen Workspace verfügbaren Modelle:

| Typ             | Zweck                                                             |
| --------------- | ----------------------------------------------------------------- |
| Sprachmodell    | Versteht das Gespräch und entscheidet, was gesagt oder getan wird |
| Spracherkennung | Wandelt die Sprache des Anrufers in Text um                       |
| Sprachausgabe   | Erzeugt die gesprochene Stimme des Assistenten                    |
| Realtime        | Hört und spricht in einem einzigen latenzarmen Modell             |

Die Verfügbarkeit hängt von deinem Workspace und dem gewählten [Engine-Modus](/de/assistants/engine-modes) ab. Mit **Recommended** markierte Modelle sind gute Startpunkte; **Low latency** kennzeichnet Optionen für reaktionsschnelle Telefongespräche.

Ist **Fallbacks & Guardrails** enthalten, kannst du Modelle für Pipeline-, Realtime- und Half-Cascade-Assistenten getrennt wählen. Andernfalls verwendet der Assistent die empfohlene automatische Auswahl.

## Temperature

Im Pipeline-Modus steuert **Temperature**, wie eng sich das Sprachmodell an deinen Prompt hält oder wie sehr es in der Formulierung variiert. Der Regler reicht von 0 – deterministisch und texttreu – bis zu kreativeren, improvisierten Antworten. Für Telefongespräche liegt ein typischer Bereich bei **0,5–0,8**.

Betrachte ihn als letzten Feinschliff, nicht als Ersatz für einen gut geschriebenen Prompt:

1. Schreib zuerst den Prompt fertig – Rolle, Ziele, Grenzen, Tonfall.
2. Starte niedrig.
3. Erhöhe den Wert in kleinen Schritten, erst wenn die Basis gut klingt.
4. Teste und vergleiche nach jeder Änderung.

Erhöhe ihn, wenn Antworten steif oder floskelhaft klingen und der Anwendungsfall etwas Improvisation verträgt. Halte ihn niedrig, wenn Konsistenz, Compliance oder präzise Formulierungen wichtiger sind als natürliche Variation.

## Stimmenbibliothek

Nutze den Stimmen-Picker, um nach Sprache und Stimmeigenschaften zu filtern, und höre dir vor dem Speichern ein Beispiel an.

* **Assistant voice** – die Standardstimme des Assistenten.
* **Voice per flow agent** – weise einzelnen [Flow](/de/flow-builder/nodes)-Agenten unterschiedliche Stimmen zu.
* **Voice per language** – die Stimme wechselt zusammen mit der [automatischen Sprachumschaltung](/de/assistants/languages).
* **Cloned voices** – wenn im Plan enthalten, füge eine private eigene Stimme hinzu und nutze sie wie eine Bibliotheksstimme.

Nimm für ein zu klonendes Beispiel klares, hochwertiges Audio mit gleichmäßigem, natürlichem Sprechtempo und ohne Hintergrundgeräusche auf – und klone nur eine Stimme, für die du eine Erlaubnis hast (siehe [Einwilligung zum Stimmenklonen](/de/assistants/voice-cloning-consent)).

Das Klonen steht auch als `POST /api/v1/voices/clone` zur Verfügung (Multipart-Upload, Scope `voices:write`) sowie als MCP-Tool `clone_voice`. Sowohl der Picker im Dashboard als auch der API-Aufruf laufen über denselben Klon-Pfad, abgesichert durch dasselbe Add-on **Clone your own voice** und dieselbe Plan-Kapazität – die API kann keine geklonte Stimme erzeugen, die das Dashboard nicht ebenfalls erlauben würde.

## Sprechstil

Die verfügbaren Regler passen sich dem gewählten Modell an. Je nach Stimme stehen dir zur Verfügung:

* Sprechgeschwindigkeit und Ausgabelautstärke;
* Stabilität, Ähnlichkeit oder Ausdrucksstärke;
* freie Stil-Anweisungen als Text;
* ein Aussprachewörterbuch für Namen, Abkürzungen und Fachbegriffe;
* Filter, die verhindern, dass Markdown und Emojis vorgelesen werden.

Es werden nur kompatible Regler angezeigt und angewendet.

<Tip>
  Wähle zuerst die Stimme, stelle dann jeweils nur einen Regler ein – Stabilität, Ähnlichkeit oder Geschwindigkeit – und hör dir dazu eine realistische Formulierung aus deinem tatsächlichen Anrufablauf an, bevor du den nächsten Regler änderst.
</Tip>

Wenn die Einstellung **Dynamic emotions** (Expressive Mode) für die gewählte Stimme verfügbar ist, kann der Assistent Emotion, Tempo, Betonung, Pausen und unterstützte nonverbale Laute an das Gespräch anpassen. Das gilt für Pipeline- und Half-Cascade-Assistenten; Realtime-Sprachmodelle steuern den stimmlichen Ausdruck nativ. Die Verfügbarkeit hängt von der gewählten Stimme ab, und nicht unterstützte Ausdrucksmittel werden nicht angewendet. Transkripte bleiben sauber und enthalten keine Ausdrucks-Markierungen.

## Glossar für die Spracherkennung

Öffne **Assistant settings → Voice → Speech recognition**, um Kunden-, Produkt- und Eigennamen zu hinterlegen, die zuverlässig transkribiert werden sollen. Das Glossar wirkt sich auf das Transkript aus; nutze zusätzlich das Aussprachewörterbuch, wenn ein Begriff auch eine besondere gesprochene Form braucht.

Ist **Automatic term detection (Beta)** verfügbar und aktiviert, kann der Assistent für den aktuellen Anruf zusätzliche Begriffe erkennen. Das kann zusätzliche KI-Nutzung verursachen. Erkannte Begriffe werden nicht in dein gespeichertes Glossar übernommen.

## Fallback-Ketten

**Fallback chains** ist ein einzelner Schalter, keine Auswahl, die du konfigurierst. Schalte ihn ein, und wenn der primäre Dienst für Spracherkennung, Sprachmodell oder Stimme mitten im Anruf ein Timeout, einen Fehler oder einen Abbruch erleidet, wechselt der Assistent automatisch zu einem kompatiblen Backup, damit das Gespräch weiterläuft, statt abzubrechen. Famulor wählt und pflegt, auf welches Backup jede Kette zurückfällt – es gibt keinen Picker für die Backup-Modelle selbst.

<Note>
  Fallback-Ketten sind Teil des Add-ons **Fallbacks & Guardrails**; die Verfügbarkeit prüfst du unter **Settings → Plan**. Ein Failover selbst verursacht keine zusätzlichen Kosten – ein Anruf, der ausweicht, wird weiterhin zum normalen Preis pro Anrufminute abgerechnet.
</Note>

<Note>
  Teste wichtige Assistenten, nachdem du Modelle, Stimmen, Sprachen oder die Fallback-Reihenfolge geändert hast. Eine kurze Simulation reicht meist aus, um Unterschiede bei Aussprache und Timing zu erkennen.
</Note>
