Scrydon

Voix

Déclenchez des workflows par commande vocale — enregistre l'audio, transcrit avec un modèle de reconnaissance vocale et fait remonter le contexte pertinent de la base de connaissances.

Le bloc Déclencheur vocal permet aux utilisateurs de démarrer un workflow par la parole. Il enregistre l'audio depuis le navigateur, le transcrit à l'aide du fournisseur de reconnaissance vocale (STT) configuré et récupère optionnellement du contexte pertinent depuis une base de connaissances avant que le workflow ne continue.

Configuration

ChampRequisDescription
Fournisseur STTOuiL'intégration de reconnaissance vocale à utiliser pour la transcription. Doit être une intégration STT installée et active.
ModèleOuiLe modèle spécifique proposé par le fournisseur sélectionné. Les options sont chargées après le choix du fournisseur.
LangueNonForcer une langue de transcription spécifique. Par défaut, détection automatique.
Base de connaissancesNonUne base de connaissances à interroger en utilisant la transcription. Les éléments pertinents sont retournés comme contexte structuré.
Nb max. de résultats KBNonNombre maximum d'éléments de base de connaissances à faire remonter. Par défaut 5.

Sorties

Une fois la transcription et la récupération KB (optionnelle) terminées, les variables suivantes sont disponibles dans les blocs en aval :

VariableTypeDescription
<voice1.transcript>stringLe texte transcrit depuis l'enregistrement audio
<voice1.knowledgeBaseItems>Tableau JSONÉléments de base de connaissances correspondants (tableau vide si aucune KB n'est configurée)
<voice1.knowledgeBaseContext>stringÉléments KB correspondants formatés comme une chaîne de contexte unique, prête à passer à un LLM
<voice1.audioUrl>stringURL présignée pour télécharger le fichier audio original
<voice1.language>stringCode de langue détecté ou configuré (ex. en, fr)
<voice1.duration>numberDurée de l'audio en secondes
<voice1.notes>stringNotes de session prises dans le studio d'enregistrement (absentes si aucune note n'a été prise)

Remplacez voice1 par le nom que vous avez attribué au bloc.

Déploiement

Le Déclencheur vocal génère un Lien de déclenchement partageable (format : /v/{id}) une fois le workflow déployé. Partagez ce lien avec les utilisateurs — l'ouvrir dans un navigateur affiche l'interface d'enregistrement vocal et démarre une exécution du workflow lorsque l'audio est soumis.

L'enregistreur est un véritable studio conçu pour de vraies réunions : un même espace porte la préparation, la capture en direct et la relecture, avec les commandes sur une barre de console. L'enregistrement peut être mis en pause et repris, l'écran reste actif pendant la capture, et la fermeture de l'onglet en cours d'enregistrement demande une confirmation. La transcription en direct occupe l'espace principal. Ouvrez Notes, Intervenants, Connaissances ou Conversation depuis la barre inférieure selon vos besoins. Les détails de santé de la session sont disponibles dans Config ; un indicateur signale les avertissements. Les notes arrivent dans le workflow via <voice1.notes> et sont enregistrées dans la base de connaissances de l'instance. La vue Calme présente le compteur et les dernières paroles. La vue Travail affiche la transcription complète et le compteur dans les commandes inférieures. Après l'arrêt, vous pouvez corriger la transcription avant de l'envoyer — le texte modifié est ce que le workflow reçoit. Les enregistrements jusqu'à quatre heures sont pris en charge.

Comment la transcription en direct est produite

Deux chemins, choisis selon le modèle lié au bloc. Celui qui est actif est indiqué dans Config → Santé de la session pendant l'enregistrement.

Un modèle qui diffuse en continu maintient une session ouverte avec le fournisseur pendant toute la durée de l'enregistrement. C'est le fournisseur qui décide où chaque phrase se termine et il renvoie le texte en continu.

Un modèle qui ne diffuse pas — Whisper et la plupart des modèles de transcription par lot — est appelé une fois par phrase. Le navigateur détecte la fin de chaque phrase et envoie ce segment d'audio. Une durée maximale limite aussi les requêtes pendant une prise de parole longue. Chaque phrase transcrite porte son intervalle de temps dans l'enregistrement pour permettre son attribution à un locuteur. Les étiquettes du fournisseur par lot ne valent que pour leur requête : elles ne prouvent pas l'identité d'une voix dans une autre requête.

Le suivi des locuteurs dans le navigateur est activé par défaut et fonctionne avec tout fournisseur STT. Son registre est propre à l'enregistrement, persiste lors des pauses et reconnexions STT, puis repart de zéro au prochain enregistrement. Toute voix entendue peut recevoir une étiquette anonyme, y compris un invité extérieur à l'organisation, sans compte ni enrôlement vocal. L'organisation peut désactiver ce suivi dans ses paramètres vocaux.

Les deux chemins se comportent de la même manière sur tout ce qui vous concerne :

  • Mettre en pause ferme la session du fournisseur et conserve tout ce qui a déjà été transcrit. Reprendre la rouvre et poursuit sous ce qui est à l'écran. Si votre fournisseur facture à l'heure de session, une pause n'est pas facturée.
  • La détection vocale limite les requêtes par lot sans parole. L'enregistrement conserve son silence et sa chronologie ; les fenêtres de transcription peuvent inclure du contexte. Le comportement en diffusion continue dépend du fournisseur.
  • Un segment non transcrit est signalé, jamais masqué. Si le fournisseur limite le débit, échoue ou prend trop de retard, la transcription affiche un trait pointillé avec la raison et l'heure au lieu de paraître silencieuse. L'enregistrement lui-même n'est pas affecté — l'audio est toujours capturé et sauvegardé.
  • Une défaillance passagère n'interrompt pas la transcription en direct. Une limitation de débit ou une panne brève du fournisseur est réessayée, et la phrase suivante est transcrite normalement.

Transcription finale et attribution des locuteurs

Le traitement final transcrit l'audio indépendamment des changements de voix. Jusqu'à deux minutes restent dans une seule requête ; les enregistrements plus longs utilisent des sections limitées avec du contexte. Les horodatages des mots, ou des segments si nécessaire, attribuent chaque passage à une seule section avant de le joindre à la chronologie des locuteurs de l'enregistrement.

Sans horodatages exploitables, des requêtes supplémentaires portent sur les sections sans chevauchement. Une attribution ambiguë reste non attribuée ; l'absence de suivi des locuteurs n'empêche pas de produire le texte. Le texte provisoire peut évoluer, tandis que le brouillon persisté contient uniquement le texte stabilisé. La version finale reste distincte et doit être relue avant approbation : une requête réussie ne garantit pas l'exactitude.

Télécharger avant approbation

Après l'arrêt, choisissez Télécharger l'enregistrement à côté de la lecture pour conserver l'audio original, même si la transcription est en préparation ou a échoué. Ce téléchargement n'approuve rien et ne poursuit pas le processus. Gardez l'onglet ouvert jusqu'à la fin. Le bouton utilise l'audio encore présent dans l'onglet ; il n'est pas disponible pour un enregistrement récupéré après un rechargement. Les fichiers importés conservent leur nom ; les captures du microphone sont téléchargées sous recording.webm, sans conversion.

Estimer le coût de transcription

Un enregistrement de Process Flow utilise le STT pour les sous-titres en direct, puis pour le traitement final. Estimez séparément heures audio en direct × tarif en direct + heures audio du traitement final × tarif final + nouvelles tentatives facturées. Le fournisseur détermine les arrondis et la facturation réelle.

Le contexte des sections finales de deux minutes ajoute environ 3,3 % pour un long enregistrement : deux heures représentent environ 2,066 heures audio pour le traitement final, en plus du direct. La détection vocale peut réduire l'audio envoyé en direct ; le traitement final conserve le silence original. Les requêtes sans horodatages exploitables et les nouvelles tentatives augmentent la consommation.

Le suivi des locuteurs utilise le calcul du navigateur et n'ajoute pas d'appel de diarisation au cloud. Stockage, hébergement, réseau et appels LLM pour les questions ou synthèses approuvées sont des coûts distincts. Consultez l'exemple de coût Foundry pour MAI Transcribe 2 ; les tarifs diffèrent selon le modèle.

Enregistrements de Process Flow et questions semi-en direct

Lorsqu'un Déclencheur vocal est lié à une action d'enregistrement de Process Flow, l'instance du processus détermine la base de connaissances de destination ; l'enregistreur ne peut pas la choisir ni la remplacer. Pendant l'enregistrement, la plateforme enregistre des instantanés cumulatifs de la transcription dans une page de brouillon unique à une cadence limitée (pas plus d'une fois toutes les cinq secondes). La vue des connaissances et la Conversation d'action partagée restent disponibles à côté de l'enregistreur, afin que les participants autorisés puissent poser des questions semi-en direct sur le même brouillon persisté et les connaissances gouvernées de l'instance.

Seul le contenu de transcription persisté côté serveur est visible par Cortex. Un tampon de navigateur non persisté n'est jamais injecté directement dans la conversation partagée. Si l'écriture du brouillon échoue, l'enregistrement continue localement, l'interface affiche un avertissement et la plateforme réessaie.

L'arrêt de l'enregistrement vide uniquement le texte de transcription stabilisé, persiste l'audio et démarre une transcription durable de l'enregistrement complet pendant que l'action reste ouverte. Ce traitement utilise des références vers l'audio stocké et des fenêtres de taille limitée : les enregistrements longs ou récupérés ne doivent donc pas tenir dans une seule requête du navigateur ou du service de transcription. Une fois le traitement terminé, vous pouvez corriger la transcription et l'attribution des locuteurs avant de les confirmer.

La confirmation enregistre exactement la révision relue, puis dérive de ce texte approuvé les actions, décisions, exigences, risques et notes de la réunion. L'action ne se termine qu'après la réussite de ces écritures. Si la publication ou l'extraction échoue, l'action reste ouverte pour une nouvelle tentative ; celle-ci met à jour les mêmes éléments de transcription, d'audio et d'extraction au lieu de créer des doublons.

Une extension de reconnaissance vocale doit être installée et configurée pour transcrire l'audio. Un enregistrement de Process Flow peut tout de même préserver l'audio sans cette extension, mais son traitement de référence signalera un résultat dégradé qui devra être accepté explicitement. Voir Extensions pour ajouter un fournisseur STT.

Sur cette page

Sur cette page