OpenQCore · Realtime Runtime

Generazione I · Core di esecuzione a bassa latenza

Realtime Runtime.
Esecuzione IA a bassa latenza.

Realtime Runtime è il backbone di esecuzione di OpenQCore per sistemi di chat in produzione, combinando validazione, controllo del backpressure, deduplicazione, lock distribuiti e orchestrazione resiliente delle risposte.

Strategia di carico

Consapevole del backpressure

Modalità di esecuzione

Streaming + Non-streaming

Controlli di sicurezza

Lock + Circuit Breaker + Dedup

Persistenza dei messaggi

Salvataggio durevole di Utente e Assistente

Ciclo di vita della richiesta

Esecuzione deterministica dall'ingresso alla pulizia.

Ogni richiesta segue un ciclo di vita protetto: validazione, protezione da sovraccarico, controlli di deduplicazione, acquisizione dei lock, esecuzione del runtime, persistenza e pulizia deterministica.

Fase 01

Costruisci traccia e contesto della richiesta

Fase 02

Monitora le richieste in sospeso + valuta il carico del sistema

Fase 03

Valida payload, allegati e accesso alla sessione

Fase 04

Memorizza l'ultimo messaggio dell'utente (se la sessione esiste)

Fase 05

Controllo di deduplicazione per richieste non in streaming

Fase 06

Acquisisci un lock distribuito ed esegui il runtime

Fase 07

Salva il messaggio dell'assistente e archivia la risposta nella cache

Fase 08

Rilascia il lock e rimuovi il tracciamento delle richieste in sospeso nel blocco finally

Piano di controllo del runtime

Primitive di resilienza che mantengono l'esecuzione stabile.

Integrazione del Circuit Breaker

L'esecuzione del runtime è integrata con il Circuit Breaker per isolare i guasti a valle e proteggere la disponibilità complessiva del sistema.

Lock distribuito

Una chiave di lock con ambito impedisce l'elaborazione duplicata in corso per la stessa identità della richiesta.

Gestione del backpressure

Le richieste in sospeso vengono monitorate continuamente e gli stati di carico critici causano il rifiuto controllato con codice 503.

Percorsi di esecuzione

Percorsi di risposta diversi per obiettivi di latenza differenti.

Percorso streaming

  • Ottimizzato per la consegna immediata dei token
  • Restituisce direttamente StreamingResponse
  • Ignora il percorso di ritorno dalla cache di deduplica
  • Ancora protetto da validazione + lock + cleanup

Percorso non streaming

  • Controlla la cache di deduplica prima dell'esecuzione
  • Esegue il runtime ed estrae il contenuto/payload finale
  • Salva l'output dell'assistente per garantire la continuità della sessione
  • Archivia l'output del modello nella cache di deduplica quando possibile

Osservabilità e Sicurezza

Operazioni tracciabili con comportamento del runtime misurabile.

  • Registrazione di eventi strutturati (avvio, completamento, cleanup, errori)
  • Propagazione di Trace ID + Request ID per esecuzione
  • Contatori metrici per richieste, respingimenti e classi di errore
  • Mappatura di HTTPException con gestione controllata dello stato
  • Finalizzazione garantita per il rilascio dei lock e la pulizia delle operazioni pendenti

Esegui carichi di lavoro AI in produzione con la sicurezza del tempo reale.

Adotta un'architettura runtime progettata per bassa latenza, pulizia deterministica, flusso di controllo resiliente e affidabilità operativa.