OpenQCore · Multimodal Stack

Une stack.
Quatre modalités. Contrôle en production.

Multimodal Stack unifie le texte, la voix, l'image et la vidéo dans une seule architecture d'exécution avec un routage intelligent, des chaînes de repli par fournisseur et des contrats de réponse stables.

Texte + Voix + Image + VidéoRouteur de décisionMatrice de délais d'attenteChaînes de repliEn streaming / Hors streamingContrat de sortie unifié

Matrice de décision

Routage centré sur l'intention entre les modalités.

PulseDecisionRouter classifie l'intention de l'utilisateur et dirige l'exécution vers la bonne voie : chat, génération/édition/analyse d'images, génération vidéo ou appel d'outil.

Modalité

Texte

Live Route Preview

Motif de déclenchement

intention conversationnelle par défaut

Route

chat

Moteur / Fournisseur

Pulse + Chat Runtime

Durées d'attente fournisseur

Budgets de latence par type de charge de travail

Image

120s

Budget de génération rapide

Vidéo

300s

Fenêtre de rendu de longue durée

OCR

45s

Budget d'extraction de documents

Identité

90s

Budget du flux KYC

Fraude

45s

Budget d'analyse des risques

Chaînes de secours

Routage de fiabilité du fournisseur

Image

openai
replicate

Image

replicate
openai

Vidéo

ltx_video

OCR

google_vision
PrimaryFallback HopExecution Target

Parcours d'exécution

Deux modes de livraison, un noyau d'orchestration.

Chemin de streaming

  • Le moteur renvoie un générateur asynchrone pour le flux de tokens/événements
  • StreamProcessor encapsule la livraison SSE
  • Les contrôles de timeout et de verrouillage restent actifs
  • La réponse finale se termine par un nettoyage déterministe

Chemin sans streaming

  • Exécution unique avec timeout + disjoncteur
  • Assemblage de la charge utile structurée (content/images/files/videos)
  • Suivi de l'utilisation et métriques de durée
  • ResponseBuilder renvoie une réponse JSON canonique

Contrat de sortie unifié

Une enveloppe de réponse unique pour toutes les modalités.

Le runtime renvoie un contrat cohérent qui rend le rendu frontend prévisible pour des sorties mixtes de texte, fichiers, images et vidéos.

images

Artefacts d'image générés ou analysés organisés dans un tableau cohérent.

fichiers

Pièces jointes, fichiers OCR et documents générés unifiés pour le rendu côté client.

vidéos

Les sorties de génération vidéo exposées via le même modèle de charge utile de la réponse.

Lancez des produits multimodaux en toute confiance au niveau du runtime.

Construisez une fois pour le texte, la voix, l'image et la vidéo, avec des contrôles de production pour le routage, le repli, l'observabilité et des contrats de sortie stables.