Vai al contenuto

Che cos'è una finestra di contesto? Cosa dovrebbe sapere ogni utente di LLM

Scritto da
Jack Limebear
Pubblicato
Ultimo aggiornamento

AscoltaAscolta questo articolo

Una finestra di contesto è la quantità di informazioni che un modello linguistico di grandi dimensioni (LLM) può elaborare in una singola richiesta. Misurata in token, può includere il prompt, la cronologia della conversazione, le istruzioni di sistema, i documenti recuperati, i risultati degli strumenti e la risposta generata dal modello.

Una finestra di contesto più ampia permette a un modello di lavorare con più informazioni in una singola richiesta. Per esempio, un agente di coding che indaga su un bug può lavorare contemporaneamente con file sorgente pertinenti, documentazione, risultati dei test e modifiche recenti al codice, anziché analizzare ogni elemento separatamente e perdere contesto utile tra una richiesta e l'altra.

Tuttavia, una finestra di contesto più ampia non equivale a una memoria perfetta. I prompt più lunghi richiedono più calcolo, consumano più token e possono rendere più difficile per un modello identificare i dettagli davvero importanti. La ricerca sui modelli a contesto lungo, incluso lo studio Lost in the Middle e il benchmark RULER di NVIDIA, ha ripetutamente rilevato che, con l'aumentare del contesto, i modelli sfruttano una porzione minore delle informazioni disponibili, soprattutto quando quelle pertinenti sono sepolte tra materiali meno utili.

Questo articolo spiega come funzionano le finestre di contesto, come vengono misurate, cosa accade quando si riempiono e come gli sviluppatori possono gestirle in modo efficace.

what is a context window by the numbers

In sintesi

  • Una finestra di contesto è il budget totale di token a cui un LLM attinge per una singola richiesta. Include il prompt dell'utente, la cronologia della conversazione, i contenuti recuperati e l'output.
  • Finestre di contesto più ampie consentono documenti, codebase e conversazioni più lunghi, ma non garantiscono che il modello ne utilizzi bene ogni parte.
  • I modelli recuperano le informazioni in modo meno affidabile dal centro dei prompt lunghi, un pattern documentato nello studio Lost in the Middle e nel benchmark RULER.
  • Una gestione efficace del contesto (retrieval, riepilogo, caching) di solito è più utile del semplice aumento del numero di token inviati.
  • La migliore strategia di contesto è quella adatta al tuo carico di lavoro reale, non quella che usa la finestra di contesto pubblicizzata più grande.

Cos'è una finestra di contesto in un modello IA?

Una finestra di contesto è lo spazio di lavoro attivo di un modello, in cui confluisce tutto ciò che è rilevante per la richiesta corrente prima che il modello generi una risposta.

Pensa a un agente IA che riassume una conversazione di assistenza clienti e raccomanda una soluzione. Per farlo bene, il modello deve elaborare:

Tutto questo compete per lo spazio nella stessa finestra di contesto, indipendentemente dalle sue dimensioni.

Le finestre di contesto non includono i dati di addestramento. L'addestramento incorpora stabilmente le informazioni nei parametri di un modello, modellando ciò che in generale “sa”. Una finestra di contesto, invece, contiene soltanto le informazioni fornite per l'attività corrente.

Questa distinzione è importante nella pratica: se un'applicazione deve far ragionare un modello su una policy specifica, un record cliente o un documento tecnico, tali informazioni non sono disponibili solo perché il modello è stato addestrato su materiale simile. In genere devono entrare direttamente nel contesto di lavoro del modello tramite il prompt o un sistema di retrieval o tool; altrimenti il modello ragionerà in base alla conoscenza generale invece che sul documento effettivamente davanti a sé.

Diagram shows six inputs sharing one context window; supplied content isn’t training data.

Tokenizzazione e finestre di contesto: come vengono elaborati i dati

Prima che un LLM elabori il testo, un tokenizer lo suddivide in unità più piccole chiamate token. Un token può rappresentare un'intera parola, una parte di parola, un segno di punteggiatura o un altro breve frammento di testo.

Per l'inglese, una regola pratica utile è che un token rappresenti circa quattro caratteri, ovvero circa tre quarti di parola. In base a questa stima, 100 token corrispondono approssimativamente a 75 parole. Si tratta però soltanto di un'approssimazione. Considera la frase “Le finestre di contesto influenzano le prestazioni dell'applicazione”. Un tokenizer non la rappresenta necessariamente come cinque parole complete; a seconda del tokenizer, una o più parole possono essere divise in più token di sottoparole.

La tokenizzazione varia notevolmente anche tra le lingue. Due frasi con significati e lunghezze visibili simili possono consumare numeri di token molto diversi in base alla lingua e al tokenizer. La ricerca sull'equità dei tokenizer ha rilevato che alcune coppie di lingue differiscono fino a 15 volte nella lunghezza tokenizzata di testi equivalenti, anche con tokenizer progettati per il supporto multilingue. Gli sviluppatori che creano applicazioni multilingue dovrebbero misurare l'uso dei token con il tokenizer effettivo del proprio modello, anziché stimarlo in base al conteggio delle parole.

Una finestra di contesto da 200.000 token può sembrare enorme, ma un'applicazione che aggiunge continuamente cronologia della conversazione, documentazione recuperata, risposte dei tool e istruzioni di sistema può avvicinarsi a quel limite più rapidamente del previsto. Per questo, le applicazioni in produzione spesso monitorano l'uso dei token e usano tecniche come il riepilogo, la potatura della cronologia, il filtraggio del retrieval e la compressione dei prompt per mantenere le informazioni più pertinenti nel contesto attivo.

Come funziona una finestra di contesto nei modelli linguistici?

Una finestra di contesto funziona tramite il meccanismo di attenzione dell'architettura transformer, che calcola come ogni token in un input sia correlato a ogni altro token prima che il modello produca una risposta.

Considera la frase "Il cliente ha restituito il laptop perché aveva smesso di caricarsi." Per interpretarla correttamente, il modello deve capire come cliente, laptop, restituito e caricarsi siano correlati tra loro. Man mano che una sequenza si allunga, il numero di queste relazioni cresce rapidamente.

Nella self-attention standard, il calcolo richiesto cresce approssimativamente con il quadrato della lunghezza della sequenza. Per esempio, un prompt da 10.000 token richiede circa 100 milioni di confronti a coppie, mentre un prompt da 100.000 token ne richiede circa 10 miliardi. I modelli moderni usano diverse ottimizzazioni architetturali e dell'infrastruttura per ridurre questo costo nella pratica, ma il problema di scalabilità sottostante non scompare.

Le conversazioni lunghe aggiungono un secondo vincolo: la cache key-value, o KV. Durante la generazione, i modelli conservano le rappresentazioni intermedie dei token precedenti invece di ricalcolarle per ogni nuovo token, accelerando notevolmente l'inferenza. Tuttavia, anche la cache occupa memoria e cresce con l'allungarsi della sequenza.

Context windows face quadratic attention costs, while KV-cache memory grows with sequence length.

Lunghezza massima del contesto nei modelli IA e perché è importante

La lunghezza massima del contesto di un modello definisce quante informazioni può accettare ed elaborare in una singola richiesta. Tuttavia, stabilire se il modello utilizzi in modo efficace una finestra di contesto ampia è una questione distinta.

Le finestre di contesto più lunghe consentono casi d'uso che erano difficili o poco pratici con gli LLM precedenti. Gli sviluppatori possono fornire a un modello un intero repository di codice, un lungo documento legale, un articolo di ricerca, la trascrizione di una riunione o una cronologia di conversazione consistente senza dover prima ridurre il materiale a poche migliaia di token.

Questo è importante perché preservare una quota maggiore del contesto originale può migliorare la capacità del modello di rispondere accuratamente alle domande, identificare relazioni tra elementi di informazione distanti e svolgere attività che dipendono dal documento nel suo insieme. Per esempio, un assistente per il coding potrebbe dover esaminare diversi file per capire come viene chiamata una funzione, mentre un assistente per documenti legali potrebbe dover confrontare le definizioni in una sezione con obblighi descritti molto più avanti nel documento.

Tuttavia, una finestra di contesto più ampia non produce automaticamente risultati migliori. Input molto lunghi possono aumentare costi e latenza, e i modelli potrebbero prestare meno attenzione alle informazioni nascoste al centro di un contesto ampio. Gli sviluppatori dovrebbero quindi includere selettivamente le informazioni pertinenti, organizzare chiaramente gli input lunghi e usare, quando opportuno, tecniche come retrieval, riepilogo e potatura del contesto.

Confronto delle dimensioni delle finestre di contesto per modello

Le finestre di contesto variano notevolmente tra le principali famiglie di modelli odierne, da alcune centinaia di migliaia di token fino a 10 milioni. Ecco come si confrontano gli attuali modelli di punta:

Modello

Finestra di contesto

Note

Llama 4 Scout

10 milioni di token

Modello di Meta a pesi aperti; la finestra più grande disponibile pubblicamente al momento della stesura

GPT-5.6 Sol

1,05 milioni di token

L'attuale modello di punta di OpenAI per il coding e il ragionamento agentico

Gemini 3.1 Pro

1 milione di token

L'attuale modello di Google di livello Pro per l'analisi di documenti lunghi e file multipli

Claude Sonnet 5

1 milione di token

L'attuale modello di Anthropic di livello Sonnet; la finestra si applica per impostazione predefinita nell'API Claude

I limiti dichiarati cambiano rapidamente quando i provider rilasciano nuovi modelli e innalzano le soglie, quindi considera una tabella come questa un'istantanea, non una classifica permanente. La dimensione del contesto è inoltre soltanto un fattore nella scelta di un modello. Da sola non dice nulla sulla qualità del ragionamento, sui limiti dell'output, sulla latenza o sui costi.

Implicazioni di una finestra di contesto piccola rispetto a una grande

Una finestra di contesto piccola costringe gli sviluppatori a essere selettivi. I documenti lunghi vengono suddivisi in blocchi, la cronologia meno recente delle conversazioni viene riassunta e la conoscenza esterna viene recuperata soltanto quando serve davvero.

Una finestra di contesto grande rimuove alcuni di questi vincoli. Puoi fornire più esempi, preservare più cronologia della conversazione o analizzare un insieme più ampio di documenti senza dover prima dividere tutto.

Tuttavia, una finestra più ampia introduce un problema diverso: la diluizione dell'attenzione. Quando un prompt contiene una grande quantità di informazioni, il modello può faticare a identificare i dettagli più pertinenti alla richiesta corrente. Istruzioni o prove importanti possono finire sepolte tra contenuti meno rilevanti, aumentando il rischio di risposte incomplete, incoerenti o meno precise.

Perché i modelli si perdono nel mezzo

I modelli tendono a recuperare le informazioni al meglio quando sono vicine all'inizio o alla fine di un prompt lungo, e peggio quando sono sepolte nel mezzo. L'influente studio Lost in the Middle ha testato direttamente questo aspetto, inserendo la risposta a una domanda in posizioni diverse all'interno di un prompt lungo e misurando con quale frequenza i modelli la trovavano. L'accuratezza era costantemente massima all'inizio e alla fine del contesto, e minima nel mezzo.

Ciò significa che un modello può tecnicamente accettare un documento senza usarne in modo affidabile ogni parte. Invia a un LLM 100 documenti di assistenza perché uno contiene la risposta alla domanda di un cliente, e una finestra di contesto più ampia potrebbe consentire di includerli tutti e 100. Ma il modello deve comunque individuare un passaggio pertinente tra 99 irrilevanti, e una finestra più lunga non garantisce che ci riesca.

Vale quindi la pena distinguere tra la finestra di contesto pubblicizzata di un modello e la sua finestra di contesto effettiva per un determinato carico di lavoro. Benchmark come RULER e LongBench cercano di misurare questo divario. RULER ha rilevato che i modelli con punteggi quasi perfetti nei semplici test di retrieval peggioravano comunque con l'aumentare della lunghezza del contesto e della complessità dell'attività. LongBench valuta attività più ampie, tra cui domande e risposte sui documenti, ragionamento su più documenti, riepilogo, apprendimento few-shot e completamento del codice.

Il contesto lungo offre comunque un valore concreto. Capacità e comprensione sono semplicemente proprietà diverse, ed entrambe sono importanti quando si sceglie un modello per un'attività specifica.

Retrieval accuracy is high at the prompt’s start and end but drops sharply in the middle.

Gestire i limiti di contesto: best practice per sviluppatori

Gestire bene il contesto significa controllare ciò che raggiunge il modello: fornire le informazioni pertinenti all'attività nel momento in cui sono pertinenti, anziché cercare di massimizzare il numero di token in ogni richiesta. Le seguenti pratiche possono aiutare gli sviluppatori a ridurre il contesto non necessario, migliorare la qualità delle risposte e controllare costi e latenza.

1. Recupera le informazioni pertinenti anziché caricare tutto

La retrieval-augmented generation, o RAG, consente a un'applicazione di cercare in una knowledge base esterna e inserire nel contesto del modello soltanto i passaggi pertinenti. Invece di inserire un intero manuale di 500 pagine in ogni richiesta di assistenza, l'applicazione recupera i pochi passaggi più vicini alla domanda effettiva del cliente.

Questo riduce l'uso di token e dà al modello un segnale molto più chiaro su ciò che conta. Anche la qualità del retrieval conta: i sistemi RAG in produzione migliorano in genere i risultati suddividendo attentamente i documenti in blocchi, recuperando diversi passaggi candidati, riordinandoli e filtrando tutto ciò che non è pertinente prima di creare il prompt finale. Per esempio, ElevenLabs ha ricostruito la sua pipeline RAG per aggiungere la riscrittura delle query e chiamate parallele ai modelli, dimezzando la latenza mediana del retrieval.

2. Gestisci intenzionalmente la cronologia della conversazione

Le applicazioni conversazionali accumulano contesto rapidamente. Aggiungere indefinitamente ogni messaggio precedente spreca token e può introdurre dettagli irrilevanti nei turni successivi.

Le applicazioni gestiscono questo aspetto mantenendo i turni più recenti, riassumendo gli scambi meno recenti, estraendo fatti persistenti in una memoria strutturata e recuperando i dettagli precedenti soltanto quando diventano di nuovo pertinenti. Questo crea una distinzione utile tra il contesto conversazionale a breve termine, di cui il modello ha bisogno immediatamente, e la memoria applicativa a più lungo termine, che può essere recuperata in seguito.

3. Usa il caching quando il contesto si ripete

Molte applicazioni inviano ripetutamente le stesse istruzioni estese o rispondono a domande semanticamente simili a quelle già gestite. Il caching riduce questo sovraccarico.

Il caching dei prompt o del contesto consente di riutilizzare più efficientemente gli input ripetuti, e il caching semantico fa un ulteriore passo avanti riconoscendo quando una nuova domanda ha più o meno lo stesso significato di una a cui il sistema ha già risposto. "Qual è la vostra politica di reso?" e "Entro quanto tempo posso restituire un articolo?" sono stringhe diverse che una cache semantica può trattare come la stessa domanda, evitando una chiamata di generazione completa e riducendo sia la latenza sia i costi dei token.

4. Misura le prestazioni con lunghezze di contesto realistiche

Non scegliere una strategia di contesto basandoti soltanto sul limite di token pubblicizzato dal provider del modello. Testa carichi di lavoro di produzione rappresentativi e misura qualità delle risposte, accuratezza del retrieval, latenza, uso dei token, costi e tassi di errore man mano che aumenta la lunghezza del contesto.

Confronta strategie come fornire più contesto, recuperare meno passaggi, riassumere la cronologia della conversazione o combinare retrieval e riepilogo. Un modello con una finestra di contesto di un milione di token può supportare tecnicamente la tua applicazione, mentre un prompt più piccolo e recuperato con attenzione può produrre risultati più rapidi e accurati a un costo inferiore.

Four ways to manage context limits: retrieve, summarize, cache, and measure; relevance matters.

Inizia a usare ElevenAgents per soluzioni linguistiche scalabili

La gestione del contesto è particolarmente importante negli agenti conversazionali, che devono combinare l'enunciato corrente con i turni precedenti, le istruzioni aziendali, le informazioni sui clienti, i contenuti della knowledge base e i risultati dei tool, rispondendo al tempo stesso abbastanza rapidamente da rendere naturale la conversazione.

ElevenAgents riunisce questi elementi in un'unica piattaforma per creare e distribuire agenti vocali IA. Il suo motore di orchestrazione coordina il riconoscimento vocale, un LLM e Text to Speech, mentre gli sviluppatori configurano prompt, knowledge base, tool, workflow e il modello linguistico sottostante. La resa espressiva, incluso il modo in cui un agente trasmette il contesto emotivo nel parlato, dipende dallo stesso contesto che innanzitutto determina ciò che l'agente dice.

Per la gestione della conoscenza in particolare, ElevenAgents supporta sia documenti a contesto completo sia RAG, configurabile direttamente sulla piattaforma. I documenti piccoli entrano direttamente nel prompt di un agente, così il loro contenuto resta disponibile per tutta la conversazione. Le knowledge base più grandi vengono invece indicizzate: il RAG recupera i passaggi pertinenti per ogni query anziché caricare tutto nella finestra di contesto in una sola volta.

Inizia registrandoti a ElevenAgents oggi oppure parla con il nostro team per scoprire le opzioni di deployment disponibili.

Crea con ElevenAgents oggi

Cerchi qualcos'altro? Visita il nostro Centro assistenza

FAQ: cos'è una finestra di contesto

Articoli simili

Crea con l'audio IA della massima qualità