Un manuale di manutenzione in PDF contiene schemi elettrici, una tabella con soglie operative e note tecniche in linguaggio naturale. Nel frattempo, l’ERP registra ordini e disponibilità, mentre il CRM conserva lo storico del cliente. Se un tecnico chiede perché una macchina ha superato una certa tolleranza, una risposta affidabile non può arrivare da una ricerca testuale isolata. Deve leggere ogni fonte nel suo contesto.
Il RAG multimodale su documenti, immagini, tabelle e dati strutturati nasce per questo: portare l’intelligenza artificiale oltre il recupero di semplici paragrafi, collegando contenuti visivi, documentali e transazionali in una base di conoscenza interrogabile. Non è un chatbot che improvvisa una sintesi. È un’architettura che trova l’evidenza giusta, rispetta permessi e ruoli, espone le fonti e, quando serve, prepara un’azione dentro i processi aziendali.
Perché il RAG solo testuale non basta
Molti progetti RAG partono da una premessa corretta ma incompleta: caricare PDF, Word e pagine interne, dividerli in frammenti, indicizzarli e affidarli a un modello linguistico. Funziona per policy, procedure e documentazione prevalentemente testuale. In azienda, però, il significato è spesso distribuito tra formati diversi.
Una tabella non è una sequenza di parole: righe, colonne, intestazioni, unità di misura e relazioni numeriche determinano il suo valore. Un disegno tecnico comunica attraverso simboli, quote e collegamenti spaziali. Una fattura scannerizzata può richiedere OCR, classificazione e verifica di campi. I dati dell’ERP o del CRM, invece, non devono essere “letti” come un documento: vanno interrogati con filtri, relazioni e regole coerenti con il modello dati.
Forzare tutto in un unico testo appiattisce le informazioni. Il risultato è una risposta apparentemente plausibile, ma incapace di distinguere un valore previsto da uno consuntivo, una soglia da una nota, una fotografia del prodotto da un’immagine decorativa. Nei processi operativi, questa ambiguità costa tempo, genera errori e rende difficile fidarsi del sistema.
Come funziona un RAG multimodale su documenti, immagini, tabelle e dati strutturati
Un sistema efficace parte dall’ingegneria delle fonti, non dalla scelta del modello. Ogni contenuto viene acquisito, normalizzato e arricchito con metadati: origine, data, versione, reparto, commessa, cliente, classificazione di riservatezza e permessi di accesso. La conoscenza resta collegata alla sua provenienza, condizione necessaria per renderla verificabile.
Documenti e immagini: contenuto, struttura e contesto
Per documenti nativi o scannerizzati, l’estrazione del testo deve mantenere riferimenti a pagine, sezioni, titoli e allegati. Nel caso di PDF complessi, non basta l’OCR: occorre riconoscere il layout, separare blocchi testuali, tabelle, didascalie e immagini, evitando che elementi distanti finiscano nello stesso frammento senza relazione.
Le immagini possono essere indicizzate tramite rappresentazioni vettoriali multimodali, descrizioni generate e metadati tecnici. In un catalogo ricambi, per esempio, il sistema può recuperare una fotografia compatibile con il componente citato nel manuale, verificare il codice articolo sul gestionale e restituire entrambi i riferimenti. L’AI non deve inventare ciò che vede: deve collegare l’immagine a fonti e attributi disponibili.
Tabelle: preservare numeri, gerarchie e unità di misura
Le tabelle richiedono un trattamento dedicato. Una buona pipeline identifica le intestazioni, riconosce le celle unite, conserva la relazione tra riga e colonna e registra unità, date e valute. Quando la struttura è irregolare, serve anche una validazione che segnali estrazioni incerte invece di trasformarle silenziosamente in dati affidabili.
In fase di risposta, il sistema deve saper scegliere il comportamento corretto. A volte basta recuperare una tabella e indicare la cella rilevante; altre volte è necessario calcolare un aggregato, confrontare versioni di listino o applicare una regola di business. Il modello linguistico spiega il risultato, ma il calcolo deve essere eseguito da componenti deterministici quando precisione e auditabilità contano.
Dati strutturati: interrogazioni, non trascrizioni
ERP, CRM, WMS, database di produzione e data warehouse contengono informazioni vive. Trascriverle in un indice vettoriale può essere utile per alcune descrizioni, ma non sostituisce l’accesso governato ai dati aggiornati. Per domande come “quali ordini sono in ritardo per questo cliente?” o “quali lotti hanno registrato anomalie nell’ultimo trimestre?”, l’agente deve formulare interrogazioni sicure verso sistemi autorizzati.
Qui entra in gioco l’orchestrazione. Il sistema interpreta la richiesta, seleziona le fonti appropriate, applica filtri e permessi, esegue la query tramite connettori o API, recupera gli eventuali documenti di supporto e compone una risposta con evidenze. Se l’utente chiede anche di aprire un ticket o preparare una bozza email, l’azione deve passare da regole, conferme e log.
Retrieval ibrido: la scelta della fonte è parte della qualità
La ricerca semantica è utile quando le parole usate dall’utente non coincidono con quelle presenti nei contenuti. Ma un sistema enterprise non dovrebbe dipendere da un solo metodo di retrieval. Keyword search, filtri per metadati, ricerca vettoriale, query strutturate e ranking per autorizzazioni devono collaborare.
Si pensi a una richiesta commerciale: “Mostrami le condizioni applicate al cliente X per il prodotto Y e le eccezioni approvate”. Il contratto PDF può contenere una clausola, il CRM la trattativa, l’ERP il listino attivo e un’email l’eccezione autorizzata. Il valore non è ottenere quattro estratti scollegati. È ricostruire una risposta che distingua fonte contrattuale, dato operativo aggiornato e comunicazione informale, segnalando eventuali incoerenze.
Questo richiede una strategia di ranking progettata sul caso d’uso. Per la compliance, si privilegiano versioni approvate e fonti normative. Per l’assistenza tecnica, può prevalere la combinazione tra manuale aggiornato, storico interventi e immagini del componente. Non esiste una configurazione valida per ogni reparto: esistono obiettivi, rischi e soglie di qualità da definire prima della messa in produzione.
Sicurezza, tracciabilità e valutazione non sono accessori
Un RAG che vede tutto non è un sistema migliore. È un rischio. I permessi devono essere applicati fin dall’acquisizione e rispettati durante retrieval, interrogazione e risposta. Un responsabile acquisti, un tecnico esterno e un amministratore possono porre la stessa domanda, ma non devono necessariamente ricevere le stesse informazioni.
Servono quindi integrazione con identità aziendali, controllo degli accessi a livello di documento o record, segregazione tra ambienti, gestione della retention e audit log. La tracciabilità deve mostrare quali fonti sono state consultate, quale query è stata eseguita, quale modello o versione di pipeline ha prodotto l’output e se un operatore ha approvato un’azione.
La qualità va misurata con un set di domande reali, non con una demo di poche richieste fortunate. Occorre valutare accuratezza del recupero, fedeltà alle fonti, correttezza numerica, rispetto delle autorizzazioni, latenza e capacità di dichiarare l’incertezza. Se una fonte manca o i dati non sono sufficienti, la risposta migliore può essere chiedere un chiarimento o inoltrare il caso alla persona competente.
Dove genera valore operativo
Nella manifattura, un copilota può mettere in relazione procedure, schemi, immagini di difetti, distinte base e dati macchina per supportare manutenzione e qualità. Nella logistica, può correlare documenti di trasporto, foto di consegna, ordini e giacenze. Nei servizi professionali, può recuperare clausole, versioni di documenti, dati di pratica e corrispondenza, mantenendo ruoli e riservatezza.
Il punto non è rispondere più velocemente a qualsiasi domanda. È ridurre il tempo necessario per trovare prove, verificare dati e portare una decisione nel workflow corretto. PurpleSoft progetta queste architetture collegando knowledge base, applicazioni aziendali, API e controlli operativi: AI che agisce, non soltanto risponde.
Il primo passo utile non è caricare indiscriminatamente tutti i file disponibili. È scegliere un processo ad alta intensità informativa, definire quali fonti costituiscono la verità operativa, misurare il costo degli errori e costruire attorno a quel perimetro un sistema controllabile. Quando documenti, immagini e dati iniziano a parlare la stessa lingua, l’AI smette di essere una demo e diventa infrastruttura di lavoro.
Hai un progetto software o un'idea da sviluppare?
Raccontaci in due righe cosa ti serve — software su misura, app, integrazioni o soluzioni AI. Ti rispondiamo entro un giorno lavorativo, senza impegno.