Fusione cross-modale
Combinare segnali eterogenei da testo, visione e audio in rappresentazioni condivise e coerenti.
Area di ricerca
Ricerca su testo, immagini, audio, video e comprensione dei documenti tramite ragionamento unificato, ancoraggio contestuale e sistemi di apprendimento cross-modale progettati per applicazioni AI nel mondo reale.
Pilastri fondamentali della ricerca
Combinare segnali eterogenei da testo, visione e audio in rappresentazioni condivise e coerenti.
Consentire ai sistemi di inferire, verificare e ragionare attraverso molteplici modalità di input con coerenza contestuale.
Sviluppare modelli temporali robusti per il rilevamento di eventi, l'interpretazione delle scene e la comprensione di flussi multipli.
Integrare OCR, analisi del layout, estrazione semantica e comprensione del linguaggio per documenti aziendali.
Ancorare i risultati a fonti affidabili e a evidenze multimodali per decisioni affidabili e pronte per la produzione.
Focus attuale
Collabora con OpenQCore Research per sviluppare sistemi di IA multimodale scalabili e affidabili.