Scrydon

Voix

Déclenchez des workflows par commande vocale — enregistre l'audio, transcrit avec un modèle de reconnaissance vocale et fait remonter le contexte pertinent de la base de connaissances.

Le bloc Déclencheur vocal permet aux utilisateurs de démarrer un workflow par la parole. Il enregistre l'audio depuis le navigateur, le transcrit à l'aide du fournisseur de reconnaissance vocale (STT) configuré et récupère optionnellement du contexte pertinent depuis une base de connaissances avant que le workflow ne continue.

Configuration

ChampRequisDescription
Fournisseur STTOuiL'intégration de reconnaissance vocale à utiliser pour la transcription. Doit être une intégration STT installée et active.
ModèleOuiLe modèle spécifique proposé par le fournisseur sélectionné. Les options sont chargées après le choix du fournisseur.
LangueNonForcer une langue de transcription spécifique. Par défaut, détection automatique.
Base de connaissancesNonUne base de connaissances à interroger en utilisant la transcription. Les éléments pertinents sont retournés comme contexte structuré.
Nb max. de résultats KBNonNombre maximum d'éléments de base de connaissances à faire remonter. Par défaut 5.

Sorties

Une fois la transcription et la récupération KB (optionnelle) terminées, les variables suivantes sont disponibles dans les blocs en aval :

VariableTypeDescription
<voice1.transcript>stringLe texte transcrit depuis l'enregistrement audio
<voice1.knowledgeBaseItems>Tableau JSONÉléments de base de connaissances correspondants (tableau vide si aucune KB n'est configurée)
<voice1.knowledgeBaseContext>stringÉléments KB correspondants formatés comme une chaîne de contexte unique, prête à passer à un LLM
<voice1.audioUrl>stringURL présignée pour télécharger le fichier audio original
<voice1.language>stringCode de langue détecté ou configuré (ex. en, fr)
<voice1.duration>numberDurée de l'audio en secondes
<voice1.notes>stringNotes de session prises dans le studio d'enregistrement (absentes si aucune note n'a été prise)

Remplacez voice1 par le nom que vous avez attribué au bloc.

Déploiement

Le Déclencheur vocal génère un Lien de déclenchement partageable (format : /v/{id}) une fois le workflow déployé. Partagez ce lien avec les utilisateurs — l'ouvrir dans un navigateur affiche l'interface d'enregistrement vocal et démarre une exécution du workflow lorsque l'audio est soumis.

L'enregistreur est un véritable studio conçu pour de vraies réunions : un même espace porte la préparation, la capture en direct et la relecture, avec les commandes sur une barre de console. L'enregistrement peut être mis en pause et repris, l'écran reste actif pendant la capture, et la fermeture de l'onglet en cours d'enregistrement demande une confirmation. Une transcription en direct défile à côté d'un bloc de notes de session — les notes arrivent dans le workflow via <voice1.notes> et sont enregistrées dans la base de connaissances de l'instance. Le mode focus réduit la pièce à la transcription pour l'enregistrement sur site. Après l'arrêt, vous pouvez corriger la transcription avant de l'envoyer — le texte modifié est ce que le workflow reçoit. Les enregistrements jusqu'à quatre heures sont pris en charge.

Enregistrements de Process Flow et questions semi-en direct

Lorsqu'un Déclencheur vocal est lié à une action d'enregistrement de Process Flow, l'instance du processus détermine la base de connaissances de destination ; l'enregistreur ne peut pas la choisir ni la remplacer. Pendant l'enregistrement, la plateforme enregistre des instantanés cumulatifs de la transcription dans une page de brouillon unique à une cadence limitée (pas plus d'une fois toutes les cinq secondes). La vue des connaissances et la Conversation d'action partagée restent disponibles à côté de l'enregistreur, afin que les participants autorisés puissent poser des questions semi-en direct sur le même brouillon persisté et les connaissances gouvernées de l'instance.

Seul le contenu de transcription persisté côté serveur est visible par Cortex. Un tampon de navigateur non persisté n'est jamais injecté directement dans la conversation partagée. Si l'écriture du brouillon échoue, l'enregistrement continue localement, l'interface affiche un avertissement et la plateforme réessaie.

L'arrêt de l'enregistrement vide la transcription restante, finalise la page de brouillon existante, persiste l'audio, puis exécute l'enrichissement configuré. L'action se termine uniquement après la réussite des persistances requises. Une nouvelle tentative de finalisation met à jour les mêmes artefacts de transcription et d'audio au lieu de créer des doublons.

Une intégration de reconnaissance vocale doit être installée et configurée dans votre espace de travail avant que le Déclencheur vocal puisse transcrire l'audio. Voir Intégrations pour ajouter un fournisseur STT.

Sur cette page

Sur cette page