Token AI: come contarli, stimare i costi e gestire il contesto
I token misurano ciò che un modello AI riceve e genera. Ecco come contarli, stimare i costi delle API e gestire documenti, chat e context window.
Guide per eseguire modelli AI su computer, workstation e server controllati dall’utente.
I token misurano ciò che un modello AI riceve e genera. Ecco come contarli, stimare i costi delle API e gestire documenti, chat e context window.
Guida completa per installare Ollama su Windows, macOS e Linux, eseguire un modello locale, verificare GPU e API e proteggere la configurazione.
Una checklist pratica per progettare l’AI locale: casi d’uso, dati, modelli, RAM, VRAM, RAG, rete, sicurezza, test e criteri di produzione.
Guida completa al RAG: documenti, chunk, embedding, retrieval, citazioni, sicurezza, AI locale, valutazione ed errori da evitare.
Guida pratica a Open WebUI con Ollama: installazione Docker, collegamento, primi test, documenti RAG, sicurezza e problemi frequenti.
Open weights non significa automaticamente open source. Guida pratica a licenze, privacy, hardware, sicurezza e scelta dei modelli AI locali.
Guida a Ollama: modelli locali, comandi, API, Modelfile, memoria, sicurezza e integrazioni per professionisti e PMI.
La context window stabilisce quante informazioni un modello AI può elaborare insieme. Scopri come influisce su qualità, costi, VRAM, RAG e Ollama.
La quantizzazione riduce memoria e requisiti dei modelli AI. Guida pratica a Q4, Q5, Q8, GGUF, RAM, VRAM, qualità e scelta per Ollama.
Cos’è l’inference AI e come misurare TTFT, token al secondo, latenza, throughput, RAM e VRAM su Ollama e sistemi locali.
LoRA permette di specializzare un modello addestrando piccoli adapter. Guida pratica a QLoRA, dataset, parametri, valutazione e uso con Ollama.
Come funziona la temperature nei modelli AI, quali valori usare, differenze da top-p e seed e come testarla con ChatGPT, Claude, Gemini e Ollama.