> ## Documentation Index
> Fetch the complete documentation index at: https://docs.ryvo.so/llms.txt
> Use this file to discover all available pages before exploring further.

# Voz, oído y modelo

> Los tres selectores de la cabecera del Constructor: el LLM que piensa, el STT que escucha y el TTS que habla; respaldos, latencia, perillas por proveedor y tu propio modelo.

Un turno de voz tiene tres etapas, y en el Constructor eliges el motor de cada una en los chips de la cabecera:

| Chip              | Etapa                                                  | Ejemplos                               |
| ----------------- | ------------------------------------------------------ | -------------------------------------- |
| **LLM**           | Piensa la respuesta.                                   | OpenAI GPT-4o mini, Claude Haiku 4.5   |
| **STT**           | Convierte lo que dice el cliente en texto (el oído).   | Deepgram Nova-3, Deepgram Flux, Gladia |
| **TTS** y **Voz** | Convierte la respuesta en audio, con una voz concreta. | ElevenLabs Flash v2.5, Cartesia        |

El chat sólo usa el LLM. Para publicar un agente que hable necesitas los tres más una voz.

<Frame caption="(1) LLM. (2) TTS. (3) STT. (4) Voz. El idioma va al lado.">
  <img src="https://mintcdn.com/ryvo-3dab4d1a/9EEXAZ5i3XN2oDZq/images/portal/voz-chips.png?fit=max&auto=format&n=9EEXAZ5i3XN2oDZq&q=85&s=8f680a691fc30e0c1377e8c97d01aa74" alt="Chips de LLM, TTS, STT y Voz" width="704" height="84" data-path="images/portal/voz-chips.png" />
</Frame>

## Cómo leer las listas

* **Recomendado**: la opción por omisión de Ryvo para español de México.
* **En gris con motivo**: no se puede guardar (no la incluye tu plan o el motor no está disponible).
* **Ámbar**: se puede guardar, pero es más lenta, más cara o experimental. Los **modelos experimentales** se abren en Pro o superior.

## Lo que cambia el precio

El STT y el TTS **no** cambian la tarifa: el minuto de voz cuesta lo mismo con cualquiera. El **LLM sí**: cada modelo tiene un multiplicador (×1, ×1.5...) que se muestra al elegirlo y se aplica a la tarifa de voz y de chat. Detalle en [Créditos y cobros](/guias/facturacion/creditos-y-cobros).

## Respaldos

Cada capa tiene un respaldo: si el proveedor principal falla a mitad de una llamada, el agente cambia al respaldo sin cortar. Por eso, al elegir voz, la pantalla puede pedirte **una voz más por cada proveedor de respaldo**; sin ella el agente se quedaría mudo justo cuando más importa.

## Voces y muestras

**Voz** abre la biblioteca del proveedor de TTS elegido, filtrable por idioma y género. Escuchar una muestra **no gasta créditos**. Si un proveedor no tiene voces en tu idioma, la pantalla lo dice.

## Perillas por proveedor

Según el motor elegido aparecen ajustes propios en **Ajustes de voz**:

| Proveedor           | Ajustes                                                                                                                                   |
| ------------------- | ----------------------------------------------------------------------------------------------------------------------------------------- |
| ElevenLabs (TTS)    | Estabilidad, similitud, estilo, realce de hablante, velocidad (0.7 a 1.2) y normalización de texto (leer números y fechas como palabras). |
| Cartesia (TTS)      | Diccionario de pronunciación.                                                                                                             |
| Deepgram Nova (STT) | Términos clave (hasta 100 palabras que debe reconocer bien: marcas, productos) y formato inteligente.                                     |
| Deepgram Flux (STT) | Umbrales de fin de turno (cuándo considera que el cliente terminó de hablar), confianza mínima y pistas de idioma.                        |
| Gladia (STT)        | Endpointing, duración máxima sin corte, cambio de idioma dentro de la llamada y región.                                                   |

Si no sabes qué mover, no muevas nada: los valores por omisión están medidos para conversaciones telefónicas en español.

## Tu propio modelo (BYOK)

En Scale y Enterprise el selector de LLM ofrece **Tu propio modelo**: un endpoint compatible con la API de OpenAI (`https://.../v1`), tu llave y el nombre del modelo. Al publicar, el agente enruta todos los turnos (chat y voz) a tu endpoint.

* La llave se cifra al guardar y **no se vuelve a mostrar**, ni siquiera sus últimos caracteres. Si la olvidas, guarda otra.
* El consumo del modelo lo pagas a tu proveedor; Ryvo cobra la tarifa de plataforma con multiplicador ×1.
* Aplica sólo al LLM. STT y TTS siguen siendo de Ryvo.
* Si tu endpoint falla, el agente no contesta con tu modelo; Ryvo **no** lo cambia en silencio a un modelo propio para no generarte consumo que no pediste; revisa tu endpoint o vuelve a un modelo de la lista.
