>_ HERMES CONSOLE

 > voz --guia

Habla con Hermes a tu manera.

Dictar, leer una respuesta y mantener una conversación son funciones independientes. Empieza con la ruta local recomendada y cambia solo lo que necesites. Hermes Console no incluye activación por palabra clave ni escucha en reposo.

recomendador rápido

¿Dónde quieres procesar la voz?

El modo conversación funciona con cualquiera. Elige la combinación de dictado y lectura que mejor encaje contigo.

combinación recomendada

Dictado: Dictado en directo → En este móvil.
Lectura: Voz sin conexión; o Voz de Android si ya tienes un motor instalado.

En mi móvil →

01 > voice --entender

Tres funciones que puedes combinar

  • Dictado (STT) convierte tu voz en texto para el cuadro del chat.
  • Leer en voz alta (TTS) reproduce una respuesta desde el botón de altavoz de su burbuja. También puedes activar la lectura automática.
  • Modo conversación añade el orbe, escucha por turnos y reproduce las respuestas sin tener que tocar el cuadro de texto.

El modo conversación tiene su propio interruptor. Si lo desactivas, el micrófono de dictado y el altavoz de cada mensaje siguen funcionando.

No necesitas instalar un servidor de voz para la ruta local recomendada. Si tu Dashboard de Hermes ofrece voz, también puedes elegir Servidor Hermes: la app usa su proveedor, modelo y voz sin copiar sus claves al móvil.

02 > listen --dictado

Elige cómo te escucha la app

En Ajustes → Voz → Voz a texto, elige primero cuándo quieres ver la transcripción:

  • Dictado en directo · recomendado. El texto aparece mientras hablas. Puedes procesarlo en este móvil con Sherpa/Whisper, o usar un servidor STT propio con faster-whisper.
  • Transcribir al terminar. Whisper graba la frase y la convierte a texto al acabar. Funciona sin conexión después de descargar el modelo.

Dentro de «Otros métodos de dictado» también está el Reconocedor de Android. Depende del servicio instalado en el sistema y puede usar red; en GrapheneOS o en móviles sin servicios de voz quizá no esté disponible.

Para el dictado en directo local puedes escoger Whisper base, Whisper small o Parakeet v3. La app indica tamaño y consumo: descarga únicamente el modelo que vayas a utilizar.

03 > local --movil

Configuración recomendada: todo en el móvil

  1. En Voz a texto, elige «Dictado en directo» y «En este móvil».
  2. Descarga un modelo. Whisper base es el punto de partida equilibrado.
  3. En Texto a voz, elige «Voz sin conexión».
  4. Descarga y selecciona una voz; después pulsa Probar voz.
  5. Concede el permiso de micrófono cuando Android lo solicite.

El reconocimiento y la síntesis se ejecutan en el teléfono y, una vez descargados los modelos, no necesitan Google ni una API de voz. Como en cualquier mensaje, el texto final sí se envía a la instancia de Hermes que hayas elegido.

Si prefieres ahorrar espacio, usa la Voz de Android; necesita que el móvil tenga instalado un motor TTS compatible.

04 > server --servidor-hermes

Usar la voz configurada en tu servidor Hermes

  1. En Ajustes → Voz, elige Servidor Hermes.
  2. Comprueba el proveedor, modelo y voz que anuncia el Dashboard.
  3. Pulsa Probar voz del servidor antes de volver al chat.

Cuando el servidor expone /api/audio/speak-stream, Hermes Console reproduce PCM mientras se genera para empezar antes. Si no está disponible, degrada a síntesis progresiva compatible; la pantalla indica cuál de las dos rutas se observó realmente.

Los proveedores y sus claves se configuran en el servidor. La app no instala un proveedor a ciegas ni muestra como disponible algo que el Dashboard no anuncie.

05 > connect --servicios

Kokoro, OpenAI, ElevenLabs y otras APIs

Estas opciones están plegadas en Servicios externos (avanzado). No hacen falta para usar la voz local.

  • Kokoro local · configuración guiada. Escribe la dirección del equipo y el puerto —normalmente 8880—. La app completa la ruta, comprueba el servidor y carga las voces disponibles.
  • Otra API compatible con OpenAI. Para servicios que implementen POST /v1/audio/speech. Introduce la URL base terminada en /v1, voz, modelo y token si lo exige.
  • ElevenLabs. Introduce tu clave xi-api-key y el identificador de voz. El texto que se vaya a leer se envía a ElevenLabs.
  • API TTS personalizada. Admite una URL REST propia, sin clave, Bearer, x-api-key o una cabecera personalizada. Detecta audio binario y los formatos base64 JSON habituales.

En la API personalizada abre «Mi proveedor usa un formato especial» solo si su documentación exige otra plantilla JSON o una ruta de audio concreta.

Los tokens se guardan cifrados mediante Android Keystore. Una URL pública debe usar HTTPS; HTTP solo se permite en localhost, LAN o Tailscale.

06 > speak --lectura

Pausar, reanudar y leer de forma natural

En Texto a voz puedes decidir qué ocurre al volver a tocar el altavoz mientras una respuesta se está leyendo:

  • Pausar y continuar · predeterminado. Se calla al momento y el siguiente toque continúa desde la frase donde paraste.
  • Detener y reiniciar. Descarta el progreso; el siguiente toque vuelve al principio.

La pantalla conserva el mensaje original, pero la versión hablada se prepara para sonar mejor: elimina marcas de Markdown y separadores visuales; humaniza barras y fragmentos técnicos; estructura listas, citas y tablas; omite bloques de código, encabezados de fuentes, bibliografía y URLs aisladas; y añade pausas según párrafos y encabezados.

El progreso de lectura solo vive durante esa sesión y no se guarda como historial. Si el contenido del mensaje cambia, la siguiente lectura comienza con la versión nueva.

07 > talk --conversacion

Modo conversación con orbe

  1. En Ajustes → Voz, activa «Modo conversación».
  2. Entra en un chat y toca el icono de conversación para abrir el orbe.
  3. Habla cuando indique «Escuchando». Verás la transcripción y los estados del turno.
  4. Toca el orbe para pausar o continuar; termina la sesión cuando hayas acabado.

Voz y teclado comparten el mismo contexto y la misma respuesta: el modo conversación no añade una instrucción oculta de brevedad ni cambia la personalidad del agente. Markdown y bloques técnicos permanecen completos en pantalla; la proyección hablada omite marcas y código que no sonarían naturales.

Con Interrumpir hablando activado, la voz del servidor puede admitir barge-in durante generación y durante reproducción por una salida privada demostrable, como auriculares. La app exige habla sostenida, silencia la locución y solo cancela el turno tras obtener una transcripción válida. Con altavoz mantiene el control táctil para parar.

Una sesión de Voz iniciada manualmente puede seguir conversando y aceptar una orden completa como «cállate» desde el launcher o con la pantalla bloqueada cuando están activadas tanto la continuidad como «Interrumpir hablando» y existe una ruta privada confirmada. Esto no habilita escucha en reposo. Ese cierre exterior, junto con la liberación de micrófono y servicio, sigue dentro del gate final de dispositivo; con altavoz usa el control táctil para terminar.

Hermes Console no incluye activación por palabra clave, detector en reposo ni modelos asociados. El micrófono solo se abre cuando inicias Dictado o una conversación de Voz; la continuidad fuera de la app sigue siendo una elección separada.

08 > lock --bloqueo

Seguir con la pantalla bloqueada

Esta opción está desactivada por defecto. Antes del primer uso, la app explica dónde se procesará la voz y te deja elegir:

  • Solo con la app abierta. Al bloquear o salir de la app se pausan el micrófono y la voz de Hermes.
  • Seguir con pantalla bloqueada. Mantiene la sesión mediante un servicio visible de Android.

Cuando eliges continuidad, la notificación muestra el estado de Voz y ofrece acciones claras para Pausar/Continuar, Abrir y Terminar. Android mantiene además su indicador de micrófono.

Terminar, forzar el cierre de la app o reiniciar el teléfono apaga la sesión. No se restaura sola tras un reinicio y no arranca desde segundo plano.

09 > privacy --privacidad

Qué datos salen del móvil

  • STT local y TTS local: el audio se procesa en el teléfono. El texto reconocido se envía después a tu Hermes como un mensaje normal.
  • Servidor STT propio: el audio del micrófono viaja a la URL de faster-whisper que configuraste.
  • Reconocedor de Android: su proveedor puede procesar el audio online según el motor instalado.
  • TTS externo: el texto que se va a leer se envía a Kokoro, ElevenLabs o la API que configuraste.

XPeta Lab no opera un servidor de voz, no recibe conversaciones y no añade telemetría. Tú eliges los motores y puedes volver a la configuración local en cualquier momento.

10 > check --problemas

Prueba y solución rápida

  • No suena. Pulsa «Probar voz», revisa el volumen multimedia y la salida Bluetooth. Para voz local, confirma que el motor o modelo esté instalado.
  • El altavoz tarda o no se detiene. Tócalo una vez y espera a que cambie su estado. Si un motor externo no responde, prueba primero la voz en Ajustes y revisa su red; la app aplica un tiempo límite para no quedarse bloqueada.
  • GrapheneOS no ofrece voz de Android. Usa «Voz sin conexión» y «Dictado en directo → En este móvil».
  • El modelo local falla. Libera memoria y prueba Whisper base o una voz más ligera; Parakeet y algunas voces necesitan más RAM.
  • Kokoro no se detecta. Comprueba que el móvil alcanza la dirección por LAN/Tailscale y que el puerto responde. Escribe solo dirección y puerto en el asistente.
  • La API personalizada responde sin audio. Comprueba su documentación y usa las opciones avanzadas únicamente para indicar su JSON o ruta base64 real.
  • No aparece la notificación bloqueada. Activa «Seguir con pantalla bloqueada» y concede el permiso de notificaciones de Android.

Cambia una sola opción cada vez y usa «Probar voz» antes de volver al chat.

← volver al inicio