Skip to content
Descreva um processo. A DRING liga-lhe em dois minutos e qualifica a necessidade. Ligamos-lhe em dois minutos
Ligamos-lhe em 2 minutos Ver o Agent Factory
Núcleo de voz

Ouve, decide, responde.

A conversão de fala em texto em streaming, o cérebro do agente, a gestão de turnos e a conversão de texto em fala funcionam como um só processo por trás de cada chamada, testado e com componentes substituíveis sem tornar a conversa mais lenta.

Um turno, do início ao fim

O mesmo processo, em todas as chamadas

Os canais chegam pela esquerda, o núcleo de voz responde ao centro com a memória e as ferramentas ao lado, e o resultado sai pela direita. Todo o percurso é testado e monitorizado, versão após versão.

CANAIS Chamadas telefónicasPSTN · SIP WhatsAppChat empresarial E-mailConfirmações NÚCLEO SPEECH-TO-SPEECH Memória Ferramentas STTVoz de entrada LLMCérebro do agente TTSVoz de saída Áudio em tempo real Regras de segurançaRegras verificadas em direto Agent Factory Melhora a cada versão RESULTADOS Registo do resultadoCada chamada avaliada ProcessosWebhook · CRM Os seus sistemasRelatórios QUEM LIGA EQUIPA DE IA DRING Cada canal Um só cérebro Cada chamada avaliada TESTE VERSÃO MONITORIZAÇÃO

Ver como uma versão é testada antes de seguir este percurso

Dentro do núcleo

O que o núcleo de voz faz de facto

Cada turno de quem liga passa por cinco etapas, da linha até à resposta. Duas garantias mantêm-se em todas elas.

  1. A chamada é estabelecida

    SIP, PBX virtual e rotas de telefonia ligadas levam a chamada até ao núcleo, e as regras de chamadas de saída aplicam-se antes de qualquer número ser marcado.

    Ver a telefonia em detalhe
  2. A fala passa a texto

    A chamada é transcrita em tempo real e depois corrigida e normalizada antes de o agente raciocinar, para que um sotaque, uma interrupção ou uma pausa a meio da frase não distorçam o que foi dito.

  3. O agente raciocina

    Lê a intenção com memória dos turnos anteriores e de outros canais, verifica as salvaguardas e a política antes de falar ou agir, e usa as ferramentas de que precisa a meio da chamada.

  4. Os turnos soam naturais

    Um modelo dedicado gere a interrupção (barge-in), para que quem liga possa cortar a palavra a meio de uma frase, e a deteção de fim de turno, para que o agente não fale por cima de uma pausa nem fique calado quando a resposta já terminou.

  5. O texto ganha voz

    Cada marca escolhe uma voz da biblioteca selecionada, com uma persona para o ritmo, a formalidade e o tom, correção de sotaque e um dicionário de pronúncia para nomes, locais e termos de produto.

Em cada turno

Respostas rápidas, sem silêncios

Quando uma ferramenta ou um modelo demora mais, uma expressão de preenchimento curta e natural, do conjunto aprovado pela DRING, mantém o turno a andar.

  • As respostas mantêm um ritmo natural, seja qual for o fornecedor por trás
  • As expressões de preenchimento nunca aparecem num pedido de desculpa, num número ou na despedida

Encaminhamento e failover

Os modelos de fala, de linguagem e de voz são escolhidos por agente e por língua, e um processo pode passar para outro modelo sem mudar de plataforma.

  • Se um fornecedor tiver um problema, a chamada pode passar para outro que esteja a funcionar
  • Um serviço melhor só entra em produção depois de passar na bateria de regressão que toda a stack executa
Ver o benchmark de operações
Partilhado com o chat

O mesmo cérebro, a falar ou a escrever

A voz não é um sistema à parte do chat. A memória, as salvaguardas e o registo de resultados por baixo são os mesmos.

Uma só memória

Uma pessoa reconhecida numa chamada é reconhecida numa mensagem, e uma conversa que começa ao telefone pode continuar no WhatsApp sem o cliente ter de repetir tudo.

As mesmas salvaguardas

A defesa de prompts, a verificação de factos e a ocultação de dados aplicam-se a uma resposta falada exatamente como a uma resposta escrita, e não numa versão mais leve das regras.

O mesmo registo de resultados

Uma chamada fecha com o mesmo registo estruturado que um chat: um resultado, uma pontuação e os campos que a sua equipa definiu, registados no seu CRM.

Ver o motor de chat que partilha este cérebro

Perguntas frequentes

Perguntas sobre o núcleo de voz.

O núcleo de voz partilha a memória e as salvaguardas com o chat?+

Sim. Uma chamada e uma mensagem sobre o mesmo cliente partilham um único caso e uma única memória, e a defesa de prompts, a verificação de factos e a ocultação de dados funcionam da mesma forma nos dois.

O que acontece se uma resposta demorar a ser gerada?+

Uma expressão de preenchimento curta e natural, do conjunto aprovado pela DRING, mantém o turno a andar enquanto a resposta termina por trás, nunca num pedido de desculpa, num número ou na despedida.

Os modelos de fala para texto e de texto para fala podem ser trocados?+

Sim. Os fornecedores de fala para texto, de linguagem e de texto para fala podem ser trocados por agente e por língua, e um processo pode passar para outro modelo sem mudar de plataforma.

Como é que o agente sabe que quem liga acabou de falar?+

Isso fica a cargo de um modelo dedicado à gestão de turnos: a interrupção (barge-in) permite a quem liga cortar a palavra a meio de uma frase, e a deteção de fim de turno diz ao agente quando a pessoa acabou mesmo de falar, para que não fale por cima de uma pausa nem fique à espera quando a resposta já terminou.

De onde vêm as vozes?+

De uma biblioteca selecionada, escolhidas por marca e por língua, com uma persona definida para o ritmo, a formalidade e o tom, correção de sotaque aplicada à voz e um dicionário de pronúncia para nomes, locais e termos de produto.

Ver todas as perguntas frequentes

Veja o núcleo de voz nas suas chamadas

Envie o seu contexto com consentimento e a DRING liga-lhe, identifica-se e avalia consigo como o núcleo de voz trataria a sua linha mais movimentada.