Home Lifestyle Ho testato 3 modelli di IA di punta su un documento di...

Ho testato 3 modelli di IA di punta su un documento di 200 pagine per capire quale fosse in grado di comprendere testi lunghi

31
0

Mia cugina studia Economia all’università e mi ha chiesto se, viste le attuali capacità dei modelli di IA, dovesse prendere in considerazione l’idea di fare un dottorato di ricerca.

Sebbene non abbia studiato la materia all’università e conosca solo i concetti di base, le ho esposto le mie riflessioni, precisandole che si trattava esclusivamente della mia opinione. Le ho anche consigliato di chiedere il parere di persone che stanno attualmente conseguendo un dottorato di ricerca.

Non appena la nostra conversazione si è conclusa, mi sono chiesto fino a che punto i modelli di IA odierni siano in grado di affrontare l’economia.

Ho deciso di scoprirlo. Ho scelto il lungo documento della Relazione annuale della Reserve Bank of India (RBI) e l’ho caricato sui tre principali modelli di IA.

Non stavo cercando di capire se un modello di IA potesse rendere obsoleto o meno rilevante un dottorato in economia. Volevo invece verificare in che misura questi modelli fossero in grado di comprendere un documento di economia lungo e ricco di informazioni.

Ho testato tre modelli di IA di punta su un documento di 200 pagine e ho scoperto quale di essi fosse effettivamente in grado di comprendere testi che richiederebbero ore di lavoro a un essere umano.

Ho testato GPT-5.6 Luna, il Sonetto 5 di Claude e Gemini 3.6 Flash

Ho potuto scegliere facilmente il vincitore

Uno degli elementi chiave del Rapporto annuale della RBI è la valutazione dei risultati economici e finanziari dell’India. L’inflazione è la cosa che mi preoccupa di più, quindi di solito leggo attentamente quella parte ogni anno.

Le mie domande vertevano sull’inflazione. Ho posto la stessa domanda a tutti i modelli per confrontare le loro risposte in modo equo.

Inizierei con quella che mi è sembrata la risposta peggiore. Proveniva da Gemini 3.6 Flash. Tra i tre, la sua risposta mi è sembrata la più meccanica, come se avessi ricevuto una risposta da un robot.

Sebbene mi sia piaciuta la risposta concisa di Gemini, era formattata in un modo tale che, nonostante la brevità, risultava comunque difficile da leggere.

Il lato positivo è che ha analizzato bene il documento e non ha dato risposte assurde nel rispondere alle domande. Ha anche fornito un buon riassunto dell’importanza verso la fine, ma chi arriverebbe a quel punto se il resto della risposta risulta così difficile da leggere?

Gemini 3.6 Flash si è dimostrato migliore di GPT-5.6 Luna e Sonnet 5. È stato difficile per me scegliere uno dei due come vincitore, ma alla fine ho optato per Sonnet 5 perché mi è sembrato più umano rispetto a GPT-5.6 Luna.

Nella sua breve introduzione, Sonnet 5 evidenzia la sezione che ha analizzato per fornirti la risposta, in modo che tu possa verificarne rapidamente la veridicità. Questo approccio è coerente con tutte le sue risposte, e lo apprezzo moltissimo.

ChatGPT va dritto al punto, il che non è male, ma mi è sembrato leggermente più meccanico rispetto alla risposta di Claude. Tuttavia, devo dare la preferenza a GPT-5.6 Luna per la risposta più strutturata che utilizza una tabella.

Ho anche impostato una premessa errata e posto una domanda per vedere come questi modelli reagiscono a un dato sbagliato. Tutti hanno individuato che avevo invertito la premessa ed evidenziato i dati pubblicati dalla RBI nella sua Relazione annuale. Ancora una volta, ho apprezzato di più l’impostazione della risposta fornita da Sonnet 5.

Tutti si sono dimostrati bravi anche nell’interpretare i dati forniti nel documento, ma ho mantenuto Sonnet 5 in testa grazie alla sua risposta di facile lettura.

Ho posto molte altre domande e ho osservato la stessa tendenza per tutta la durata della sessione, il che mi è bastato per scegliere Sonnet 5 come vincitore.

Gemini 3.6 Flash e GPT-5.6 Luna non sono male

Semplicemente non sono adatti ai miei gusti

ChatGPT mi ha chiesto se fosse bravo ad aiutare a focalizzare le argomentazioni

Su Reddit ho sentito lamentele secondo cui Gemini analizza solo la prima e l’ultima pagina di un PDF lungo e produce molte informazioni errate. Questa non è stata la mia esperienza con il modello di IA di Google. Al contrario, ho riscontrato che ha risposto correttamente a tutte le mie domande.

Sebbene sembri più meccanico, il riassunto conciso verso la fine è utile se non si vuole leggere la sua noiosa risposta. In base alla mia esperienza, ritengo che il modello di IA Gemini sia addirittura migliore nel riassumere.

Se Gemini 3.6 Flash e Sonnet 5 rappresentano i due estremi, allora GPT-5.6 Luna si colloca esattamente nel mezzo. I miei test suggeriscono che possieda qualità di entrambi e che, inoltre, offra una formattazione strutturata dei dati nelle sue risposte più spesso rispetto agli altri.

Quando voglio leggere qualcosa di importante, preferisco una risposta che mi fornisca tutto ciò che devo sapere in modo facile da capire. Non mi dispiacerebbe l’assenza di una tabella nella risposta, purché il testo sia di facile lettura.

Questo test ha confermato un aspetto importante sui modelli di IA

GPT-5.6 Luna ha una finestra di contesto di 1.050.000 token, mentre Sonnet 5 ne ha 1.000.000. Con 1.048.576 token, Gemini 3.6 Flash ne ha leggermente di più rispetto a Sonnet 5.

Se mi baso esclusivamente sui numeri, Sonnet 5 è il meno performante. Tuttavia, i risultati dipingono un quadro completamente diverso. Una finestra di contesto più ampia significa solo che può contenere più dati e non garantisce che elaborerà le informazioni in modo più accurato.

Inoltre, un contesto più lungo può portare a una qualità di ragionamento inferiore. Sebbene un contesto più ampio sia certamente d’aiuto, un eccesso di contesto può rendere più difficile per il modelli linguistici di grandi dimensioni (LLM) a rispondere con precisione.

L’obiettivo dovrebbe sempre essere quello di trovare il giusto equilibrio tra fornire all’IA un contesto sufficiente ed evitarne un eccesso.

LEAVE A REPLY

Please enter your comment!
Please enter your name here