Anima: leggero, veloce, un po’ ribelle
Argomento: Modelli
Di Chris Green
Pubblicato il 2026-09-26
Informazioni aggiornate
Questa guida è un'istantanea. La fonte qui sotto è tenuta aggiornata dai suoi autori; consultala per i dettagli più recenti.
Diffusion Doodles, Chris Green's Substack
Panoramica
Anima
è un modello text-to-image realizzato da
ComfyUI
insieme a CircleStone Labs, una start-up di IA. È comparso con alcune versioni preview e un modello base v1 senza troppo clamore. La notizia è che non è un modello fotorealistico: le note di rilascio dicono che è stato addestrato su diversi milioni di immagini anime e circa 800 mila immagini artistiche non anime, senza dati sintetici, e che i dati anime si fermano a settembre 2025.
Il risultato è un modello open source, compatto, da 2 miliardi di parametri, costruito da zero per anime, manga, illustrazione e concept art, un campo dominato da
SDXL
e dai suoi fine-tune come
Illustrious
e Pony. Nato per questo, produce linee più pulite, migliore anatomia anime, personaggi più coerenti e meno realismo accidentale.
Rispetto a SDXL: SDXL è un vecchio UNet con encoder di testo CLIP; Anima è un transformer leggero su una versione snellita dell’architettura Cosmos di NVIDIA. Anima legge i prompt tramite un adattatore linguistico
Qwen
, quindi capisce il linguaggio naturale e segue bene i prompt, continuando a supportare i tag Danbooru. Il suo VAE a 16 canali (SDXL ne ha 4) migliora illuminazione, composizione e dettagli di sfondo. Essendo un modello flow matching è più lento dei
checkpoint
SDXL molto ottimizzati su GPU consumer, ma resta molto veloce accanto ai modelli fotorealistici pesanti come Qwen e
Flux
. SDXL ha l’enorme ecosistema di fine-tune e
LoRA
, e i LoRA SDXL non sono compatibili, anche se nuovi LoRA per Anima compaiono di continuo. La licenza base di SDXL è permissiva per l’uso commerciale; quella di Anima è più restrittiva e pensata per progetti personali.
Nell’uso: la resa del testo è debole per gli standard attuali, meglio limitarla a una o due parole. L’aderenza al prompt è buona ma non ai livelli di
Qwen Image
o
Flux.2
; Anima quasi si ribella ai prompt troppo restrittivi e lavora molto meglio con una guida larga e spazio per creare. È più forte nell’anime, ma con il prompt e i tag giusti fa anche acquerello, schizzi, 3D, olio e risultati piuttosto astratti, e i LoRA lo portano oltre. Aspettatevi di variare prompt, seed e
sampler
per qualche generazione prima di centrare quella giusta. Con il modello base uscito da poche settimane, fine-tune e LoRA dovrebbero moltiplicarsi nei prossimi mesi.
Riferimento
Nome | Tipo | Cos'è |
|---|---|---|
Modello | file | Il modello base v1 (e le preview precedenti) su Hugging Face, solo 4 GB. |
Encoder di testo | file | L’encoder di testo Qwen3 da 0,6B parametri (1,2 GB), dalla stessa pagina Hugging Face. |
VAE | file | Il VAE di Qwen Image su Hugging Face; lo avete già se usate i modelli Qwen Image. |
hardware | Ufficialmente 8 GB; gli utenti riferiscono che 6 GB bastano. Su una scheda da 16 GB ne usa in genere solo la metà. | |
Risoluzione | impostazione | La documentazione ufficiale suggerisce 1-2 megapixel. 1:1, 3:4, 4:5 e 16:9 funzionano tutti; fino a 1536x1536 gira senza problemi, ma la qualità è leggermente migliore e più costante un po’ più in basso. |
Passi | impostazione | 30-50 suggeriti per il modello base; 40 o più dà la qualità migliore, 30 può bastare a seconda del sampler. Un primo LoRA Turbo scende a 8-12 passi, con arti stranamente accorciati in alcuni casi. |
impostazione | 4-5. Anima dà risultati più puliti con guidance bassa; sopra circa 10 i colori saturano con contorni duri e alte luci bruciate. | |
Sampler / scheduler | impostazione | er_sde con simple è un buon default (linea nitida, colore anime piatto, costante). Euler A: linee più morbide, più pittorico, leggermente 2.5D, buono per personaggi e copertine. DPM++ 2M SDE GPU: più variazione e composizioni più ricche, imprevedibile con prompt complessi. Il KSampler standard; il sampler ClownShark finora non ha dato buoni risultati. |
Prompt negativo | prompt | Supportato. Usatelo per allontanare stili come "photorealistic" e per i soliti tag: blurry, low resolution, oversaturated, watermark, messy typography, distorted anatomy, overexposed highlights, bad hands, malformed hands. |
Tag di sicurezza | prompt | Anima è poco censurato e può produrre contenuti indesiderati da prompt brevi o vaghi. Mettete safe, sensitive, nsfw o explicit nel prompt positivo o negativo a seconda del caso, soprattutto riutilizzando prompt brevi in stile Danbooru. |
@artist | prompt | I tag di riferimento agli artisti vanno preceduti dal simbolo @ e stanno meglio all’inizio del prompt. L’Anima Style Explorer elenca circa 60.000 stili di artisti presenti nel set di addestramento. |
AD

Nessuna installazione: esegui i modelli IA nel cloud
BitVector Prism è il modo più semplice per iniziare: scegli un modello, scrivi un prompt e genera in una web app pulita, senza configurare nulla. BitVector è disponibile anche su Discord e sul web (SpyGlass).
Passo dopo passo
- Caricate i tre file in ComfyUI: il modello base Anima, l’encoder di testo Qwen3 0.6B e il VAE di Qwen Image. Anima è supportato nativamente e l’ultima versione di ComfyUI include template di esempio; il workflow standard è molto semplice.
- Partite dal template standard: KSampler, sampler er_sde, scheduler simple, 30-40 passi, CFG 4-5, una tela da 1-2 megapixel.
- Scrivete il prompt in linguaggio semplice, al massimo due o tre paragrafi brevi. Prompt molto brevi lasciano molto spazio creativo; prompt molto lunghi peggiorano l’aderenza e a volte la qualità.
- Mescolate tag Danbooru dove aiutano, con riferimenti di stile o @artist all’inizio. Restate puliti e concisi: Anima è sensibile al sovraccarico di tag ripetitivi.
- Aggiungete un prompt negativo con gli stili che non volete (per esempio photorealistic) e i soliti tag di qualità, più un tag di sicurezza se il prompt positivo è breve o vago.
- Generate e considerate il risultato una bozza. Se manca il dettaglio voluto, allentate la formulazione invece di stringerla, poi variate seed, tag e sampler per qualche generazione.
- Per un look diverso cambiate prima il sampler (Euler A per il pittorico, er_sde per l’anime nitido e piatto, DPM++ 2M SDE GPU per la varietà), poi provate un LoRA; un LoRA aggiunge solo un paio di secondi.
Esempi
Un prompt in stile Danbooru
1girl, solo, looking at viewer, masterpiece, detailed eyes
Il solito prompt negativo
photorealistic, blurry, low resolution, oversaturated, watermark, messy typography, distorted anatomy, overexposed highlights, bad hands, malformed hands
Impostazioni di riferimento
RTX 4060 Ti 16 GB, standard workflow, er_sde / simple, 30 steps: about 1.8 s per step, a finished image in under a minute, VRAM at roughly 50%.
Consigli
- I tag Danbooru sono efficienti in token e lasciano al modello spazio per creare; il linguaggio naturale dà più controllo. Gli utenti riferiscono che il prompting ibrido offre il miglior equilibrio tra comprensione del prompt ed estetica anime.
- I tag Danbooru vengono da Danbooru, un imageboard anime nato nel 2005 il cui sistema di tag ricercabili è diventato una delle tassonomie di immagini più complete di Internet; molti modelli anime sono stati addestrati su immagini taggate Danbooru, per questo il prompting a tag funziona.
- Prompt strutturati semplici in JSON o YAML funzionano perché l’encoder Qwen li interpreta, ma crollano in fretta quando diventano complessi e nulla indica che producano immagini migliori del linguaggio naturale o dei tag.
- Cambiare sampler o scheduler modifica appena il tempo di generazione, ma con Anima può cambiare molto il risultato; lo stesso prompt e seed con euler, euler-a, er-sde e dpmpp-sde-gpu dà quattro immagini nettamente diverse.
- CFG più basso che su altri modelli anime. Ad alcuni piace un CFG molto alto; ad Anima no.
- Se volete controllo preciso, usate un modello come Flux.2. Anima è un modello per anime, illustrazione e arte più libero, che prende un’idea approssimativa e la interpreta in molti modi.
- Il punto forte è l’anime, poi acquerello, schizzi, 3D e stili a olio. Un prompt ad acquerello più un LoRA come Vector Paintings di Daalis spinge lo stile oltre.
- La scheda del modello su Hugging Face dice di più su ordine dei tag, sintassi e approccio in linguaggio naturale.
Risoluzione dei problemi
L’immagine ignora i dettagli di un prompt lungo
Perché succede
Prompt molto lunghi o molto restrittivi peggiorano l’aderenza di Anima e a volte la qualità; il modello lavora meglio con una guida larga.
Come risolverlo
Tagliate il prompt a due o tre paragrafi brevi, tenete la direzione generale, togliete i dettagli fini e provate qualche seed.
Colori saturi, contorni duri, alte luci bruciate
Perché succede
CFG troppo alto; sopra circa 10 Anima brucia.
Come risolverlo
Riportate il CFG a 4-5.
Contenuti per adulti indesiderati da un prompt breve
Perché succede
Anima è poco censurato e completa da solo prompt vaghi o brevi, soprattutto i Danbooru riutilizzati.
Come risolverlo
Aggiungete safe o sensitive al prompt positivo, oppure nsfw ed explicit al negativo, e date più dettagli al prompt.
Gli arti escono accorciati con il LoRA Turbo
Perché succede
Il primo LoRA Turbo (8-12 passi) a volte accorcia gli arti.
Come risolverlo
Usate il modello base a 30-40 passi per quelle immagini, o tenete Turbo solo per le bozze rapide.
Il testo nell’immagine è illeggibile
Perché succede
La resa del testo è debole per gli standard attuali.
Come risolverlo
Limitate il testo nell’immagine a una o due parole o aggiungetelo in post-produzione.
AD

Nessuna installazione: esegui i modelli IA nel cloud
PirateDiffusion è solo su Telegram ed è pensato per i professionisti: migliaia di modelli, LoRA e workflow tramite comandi in chat, con generazione illimitata a prezzo fisso.
Domande
I LoRA SDXL funzionano con Anima?
No. Anima usa un’architettura diversa, quindi i LoRA SDXL non sono compatibili nativamente. Nuovi LoRA addestrati per Anima compaiono di continuo.
Anima supporta il prompting JSON?
Non nativamente, per quanto si sa. Prompt JSON o YAML semplici funzionano perché l’encoder di testo Qwen li interpreta, ma crollano in fretta quando diventano complessi e non danno immagini migliori del linguaggio naturale o dei tag.
Quanto è veloce?
Su una RTX 4060 Ti 16 GB con workflow standard, er_sde / simple e 30 passi, circa 1,8 secondi per passo e un’immagine finita in meno di un minuto, usando metà della
VRAM
. Un LoRA aggiunge un paio di secondi.
Posso usarlo commercialmente?
La licenza di Anima è più restrittiva della licenza base di SDXL e pensata per progetti personali. Leggete la licenza prima di un uso commerciale.
È solo per anime?
L’anime è il suo punto forte, ma con il prompt e i tag giusti produce anche acquerello, schizzi, 3D, olio e risultati piuttosto astratti, e i LoRA lo portano verso altri stili.
Link e fonti
- Anima: light, fast, slightly unruly, by Chris Green on Medium
- Diffusion Doodles, Chris Green's Substack (original publication)
Modelli di questa guida
Scritto da
Chris Green
Guide correlate
ComfyUI
Nodi di ComfyUI: documentazione e risoluzione dei problemi
Documentazione in linguaggio semplice per i nodi di ComfyUI più usati: cosa fa ogni nodo, tutti gli input e output, come collegarli, le impostazioni importanti e gli errori che dà con la soluzione per ognuno.
Di Captain
2026-06-02
Modelli video
Prompt video MiniMax H3: la struttura ufficiale
Come MiniMax vuole che sia scritto un prompt H3: la linea di allineamento per video ancorati all’immagine, i tre campi principali, inquadrature e tagli, movimenti di camera, ID degli speaker e tag di dialogo, paesaggio sonoro e musica. Riassunto dalla guida ufficiale alla scrittura dei prompt.
Di Captain
2026-09-14
Altre guide
Servizi cloud
Tariffa fissa vs token: perché i piani illimitati come Graydient.ai sono il miglior valore per i creatori AI nel 2026
Un confronto dei costi classificato, con prezzi aggiornati all'8 ottobre 2026, tra piani illimitati a tariffa fissa come Graydient.ai e prezzi a token e credito di Midjourney, Leonardo, fal.ai, Replicate, Runway e Kling: quanto costano davvero 1.000 immagini e 1.000 video al mese su ciascuno, e perché una tariffa fissa per immagini, video, audio, chat Grok LLM e app web illimitate è il miglior valore per i creatori che fanno iterazioni.
Di Captain
2026-10-08
Modelli
FLUX.1 Dev: come usarlo, impostazioni migliori e idee creative
Una guida pratica a FLUX.1 Dev di Black Forest Labs: come scrivere i prompt in linguaggio naturale, impostazioni di guida e passi, stacking di LoRA, rendering del testo e idee per prompt che sfruttano i suoi punti di forza.
Di Captain
2026-09-30
Modelli
Stable Diffusion XL 1.0: prompt, impostazioni e cosa fa ancora meglio
Come ottenere il massimo dal modello base ufficiale SDXL 1.0: risoluzioni native, impostazioni di CFG e sampler, il refiner, prompt negativi e idee per stili in cui SDXL brilla ancora.
Di Captain
2026-10-01
Modelli
Stable Diffusion 1.5: il modello classico, usato nel modo giusto
Stable Diffusion 1.5 vale ancora la pena conoscerlo: la risoluzione giusta, CFG e sampler, come usare la sua enorme libreria di LoRA e embedding, e idee creative per prompt adatte a un modello a 512 pixel.
Di Captain
2026-10-02
Modelli
FLUX.2 Dev: come usare il modello più recente di Black Forest Labs
FLUX.2 Dev supporta prompt più lunghi, testo migliore, realismo più forte e modifica con riferimenti multipli. Questa guida spiega il flusso turbo, le impostazioni di guida e risoluzione, la struttura del prompt e idee che sfruttano le sue nuove potenzialità.
Di Captain
2026-10-03
Modelli
Qwen-Image: prompt lunghi, testo perfetto e poster bilingue
Qwen-Image è il modello da usare quando le parole nell'immagine contano. Scopri come scrivere prompt descrittivi lunghi, riprodurre testo in inglese e cinese con precisione, impostare CFG e passi, e esplorare idee creative con layout complessi.
Di Captain
2026-09-29

Model
Trends
.ai
© ModelTrends.ai
|
© 2026
|
Tutti i diritti riservati