Token AI: come contarli, stimare i costi e gestire il contesto
I token misurano ciò che un modello AI riceve e genera. Ecco come contarli, stimare i costi delle API e gestire documenti, chat e context window.
Definizioni semplici dei termini essenziali dell’intelligenza artificiale.
I token misurano ciò che un modello AI riceve e genera. Ecco come contarli, stimare i costi delle API e gestire documenti, chat e context window.
Un LLM è un modello di intelligenza artificiale addestrato a elaborare e generare linguaggio. Impara regolarità statistiche da grandi raccolte di testi e produce l’output prevedendo, passo dopo passo, i token più coerenti con il contesto. Spiegazione pratica con funzionamento, esempi, limiti, confro
Definizione semplice di token AI: che cosa rappresenta, come viene creato dal tokenizer e perché non coincide sempre con una parola.
Il prompt è l’insieme di istruzioni, domande, dati ed esempi forniti a un sistema AI per orientarne il risultato. Non è una formula magica: è il modo con cui si descrivono obiettivo, contesto e criteri di qualità. Spiegazione pratica con funzionamento, esempi, limiti, confronti e FAQ.
Un embedding è una rappresentazione numerica, generalmente un vettore, che colloca contenuti semanticamente simili in regioni vicine di uno spazio matematico. Può rappresentare testo, immagini, audio, utenti o prodotti. Spiegazione pratica con funzionamento, esempi, limiti, confronti e FAQ.
La RAG è un’architettura che recupera informazioni da fonti esterne e le inserisce nel contesto di un modello generativo prima della risposta. L’obiettivo è collegare l’output a documenti pertinenti, aggiornabili e controllabili. Spiegazione pratica con funzionamento, esempi, limiti, confronti e FAQ
Il fine-tuning è un addestramento aggiuntivo applicato a un modello già pre-addestrato per adattarne il comportamento a un compito, un dominio, uno stile o un formato di output. Spiegazione pratica con funzionamento, esempi, limiti, confronti e FAQ.
Il Transformer è un’architettura di rete neurale progettata per elaborare sequenze usando soprattutto il meccanismo di attenzione. È alla base di gran parte dei moderni modelli linguistici e di molti sistemi multimodali. Spiegazione pratica con funzionamento, esempi, limiti, confronti e FAQ.
Un’allucinazione è un output generato con sicurezza apparente ma non supportato da fatti, fonti o dati disponibili. Può riguardare nomi, numeri, citazioni, eventi, codice o relazioni causali. Spiegazione pratica con funzionamento, esempi, limiti, confronti e FAQ.
La context window stabilisce quante informazioni un modello AI può elaborare insieme. Scopri come influisce su qualità, costi, VRAM, RAG e Ollama.
La quantizzazione riduce memoria e requisiti dei modelli AI. Guida pratica a Q4, Q5, Q8, GGUF, RAM, VRAM, qualità e scelta per Ollama.
Cos’è l’inference AI e come misurare TTFT, token al secondo, latenza, throughput, RAM e VRAM su Ollama e sistemi locali.