Model
Trends
.ai
Model
Trends
.ai
model AI sumber terbuka terbaik

ControlNet diterangkan: pose, kedalaman, tepi dan imej rujukan untuk SD 1.5, SDXL dan Flux

Topik: Prompting
Oleh Captain
Diterbitkan 2026-02-18
Share

Gambaran keseluruhan

Prompt beritahu apa nak dilukis; ControlNet beritahu di mana. Ia rangkaian sampingan, dilatih ikut keluarga, yang baca imej kawalan (pose figura kayu, peta kedalaman, lukisan tepi, coretan, peta segmentasi) dan arahkan denoiser supaya hasilnya ikut struktur itu. Prompt masih tentukan subjek, gaya dan cahaya; imej kawalan betulkan komposisi. Ini cara orang dapat pose sama untuk sepuluh watak, tukar render 3D jadi foto, atau kekalkan bentuk produk tepat.
Dua langkah sentiasa berlaku. Mula-mula prapemproses tukar foto sumber jadi imej kawalan (OpenPose lukis rangka, MiDaS atau Depth Anything anggarkan kedalaman, Canny cari tepi, Lineart jejak garisan). Lepas tu model ControlNet untuk keluarga kamu guna imej itu masa penjanaan. Guna foto mentah terus bukan peta prapemproses adalah kesilapan nombor satu pemula; nombor dua guna ControlNet
SD 1.5
pada
checkpoint
SDXL
.
Flux
dan model 2025 ubah landskap: Black Forest Labs hantar Flux Depth dan Flux Canny sebagai model penuh dan
LoRA
, Union ControlNets tutup beberapa jenis dalam satu fail untuk SDXL dan Flux, dan editor arahan (
Qwen Image
Edit, Kontext) urus banyak kerja "kekalkan ini, ubah itu" tanpa imej kawalan. Katalog di laman ini tag ControlNet bawah "lain" ikut keluarga; halaman model namakan jenis kawalan.

Rujukan

Nama
Jenis
Apakah ia
OpenPose
control type
Titik utama badan, tangan dan muka sebagai figura kayu. Pemindahan pose, koreografi, watak konsisten. Lemah pada tangan kecuali model tangan dihidupkan.
Depth (MiDaS, Zoe, Depth Anything)
control type
Peta kedalaman kelabu. Kekalkan susun atur ruang dan kamera sambil bagi kebebasan ubah gaya. Kawalan paling mudah untuk foto ke ilustrasi.
Canny / Lineart / SoftEdge (HED)
control type
Lukisan tepi. Canny ketat dan tajam, Lineart untuk lukisan, SoftEdge longgar. Bentuk produk, seni bina, logo.
Scribble
control type
Coretan kasar yang kamu lukis sendiri jadi komposisi. Kekuatan rendah (0.5-0.7) atau hasil nampak macam coretan.
Tile
control type
Panduan untuk naik taraf atau laluan detail supaya setia pada input resolusi rendah. Enjin di belakang kebanyakan aliran kerja "naik taraf terbaik".
IP-Adapter / Redux / reference
image conditioning
Bukan ControlNet: sediakan gaya atau muka imej bukan strukturnya. Gabungkan dengan ControlNet untuk dapat kedua-duanya.
Strength / weight
0.4-1.0
Betapa kuat struktur dikuatkuasakan. 0.8 untuk pose dan kedalaman, 0.5-0.7 untuk tepi dan coretan.
Start / end percent
0.0-1.0
Bahagian denoising yang kawalan guna. Tamat pada 0.6-0.8 bagi model selesaikan detail bebas dan hilangkan rupa "jejak".
Family files
SD 1.5
: lllyasviel control_v11 |
SDXL
: diffusers / xinsir Union |
Flux
:
Flux
Depth/Canny, Shakker Union, InstantX
Setiap keluarga perlukan ControlNet sendiri; saiz 0.7-2.5 GB. Fail Union gabungkan beberapa jenis.
AD
Kawalan pose dan kedalaman dalam pelayar
BitVector Prism termasuk kawalan pose dan kedalaman untuk model SDXL dan Flux: muat naik rujukan, pilih kawalan, taip prompt. Tiada prapemproses nak pasang.

Langkah demi langkah

  1. Pilih jenis kawalan ikut kerja: pose untuk orang, kedalaman untuk pemandangan dan ubah gaya, Canny atau Lineart untuk bentuk keras, coretan untuk idea, tile untuk naik taraf.
  2. Muat turun ControlNet untuk keluarga checkpoint kamu ke models/controlnet (
    ComfyUI
    ) atau models/ControlNet (A1111,
    Forge
    ). Fail Union jimat ruang cakera kalau guna beberapa jenis.
  3. Muatkan imej sumber dan jalankan prapemproses yang sepadan (ComfyUI: nod controlnet_aux; A1111: sambungan ControlNet buat terus). Pratonton imej kawalan; betulkan kalau rangka hilang anggota.
  4. ComfyUI: Guna ControlNet (Advanced) antara CLIP Text Encode dan KSampler, sambungkan imej kawalan dan model ControlNet, kekuatan 0.8, mula 0, tamat 0.8.
  5. A1111 / Forge: aktifkan unit ControlNet 0, pilih prapemproses dan model jenis sama, berat 0.8, tamat langkah kawalan 0.8, pixel perfect hidupkan.
  6. Tulis prompt untuk apa kamu nak tengok, bukan untuk pose (pose diurus). Jana empat seed.
  7. Turunkan kekuatan atau peratus tamat kalau imej nampak jejak atau rata; naikkan kalau struktur lari. Tambah unit kedua (pose + kedalaman) untuk komposisi degil.
  8. Di awan,
    PirateDiffusion
    guna ControlNet bila kamu balas imej sumber dengan /render dan bendera kawalan;
    BitVector
    ada pose dan kedalaman dalam alat imejnya.

Contoh

Pemindahan pose dalam ComfyUI (SDXL)

Load Image (reference photo) -> DWPose Estimator (body + hands) -> Apply ControlNet Advanced (xinsir controlnet-union-sdxl, type openpose, strength 0.8, end 0.75) -> KSampler
Prompt: a knight in weathered plate armour standing on a cliff at dawn, cinematic, 35mm

Foto ke cat air dengan kedalaman (A1111 / Forge)

ControlNet unit 0: preprocessor depth_anything, model control_sdxl_depth, weight 0.7, end 0.7, pixel perfect
Prompt: loose watercolour illustration of a harbour town, paper texture, soft morning light

Flux Canny LoRA

Load Diffusion Model (flux1-dev-fp8) -> LoraLoaderModelOnly (flux1-canny-dev-lora, 0.85) -> InstructPixToPixConditioning (canny image) -> KSampler (guidance 30)

Petua

  • Kedalaman lebih baik dari Canny untuk foto ke ilustrasi sebab biar tekstur bebas; Canny lebih baik dari kedalaman untuk logo dan produk sebab kekalkan tepi tepat.
  • Peratus tamat adalah tetapan yang ramai orang tak sentuh dan yang betulkan rupa plastik, jejak.
  • Ubah saiz imej kawalan ikut saiz penjanaan dengan nisbah aspek sama; bentuk tak sepadan potong rangka.
  • OpenPose dari foto diri sendiri cara paling cepat dapat perpustakaan pose konsisten untuk watak.
  • Untuk Flux, LoRA Depth dan Canny dari Black Forest Labs lebih ringan dari model kawalan penuh dan cukup baik untuk kebanyakan kerja.
  • Editor arahan (Qwen Image Edit, Kontext) sering ganti laluan ControlNet untuk suntingan "adegan sama, subjek lain"; lihat panduan Qwen Image Edit.

Penyelesaian masalah

ControlNet tak buat apa-apa

Mengapa ia berlaku
Keluarga tak sepadan (ControlNet SD 1.5 pada SDXL), atau foto mentah diberi bukan peta prapemproses.

Cara membaikinya
Padankan keluarga; jalankan prapemproses dan pratonton outputnya.

Hasil nampak jejak dan rata

Mengapa ia berlaku
Kekuatan 1.0 dengan peratus tamat 1.0.

Cara membaikinya
Kekuatan 0.7, tamat 0.7; biar model selesaikan sendiri.

Rangka hilang tangan atau anggota

Mengapa ia berlaku
Prapemproses kesan kurang tepat pada foto yang sibuk.

Cara membaikinya
Guna DWPose dengan tangan dihidupkan, potong sumber, atau sunting rangka dalam nod editor OpenPose.

Habis memori dengan dua unit

Mengapa ia berlaku
Setiap ControlNet sehingga 2.5 GB.

Cara membaikinya
Guna model Union untuk kedua-dua jenis, atau ControlNet fp8; lihat panduan
VRAM
.

ControlNet Flux hasilkan hingar

Mengapa ia berlaku
Nod penyediaan salah atau
CFG
lebih 1 pada model panduan-distilasi.

Cara membaikinya
Guna nod yang halaman model nyatakan dan CFG 1 ikut panduan halaman.

AD
PirateDiffusion
ControlNet dengan balas foto
Di PirateDiffusion kamu balas mana-mana imej dalam Telegram dengan /render dan bendera kawalan dan ControlNet betul untuk model digunakan di server. Render tanpa had dengan harga tetap.

Soalan

Adakah ControlNet LoRA?

Tidak. Ia rangkaian berasingan yang baca imej; LoRA ubah berat model dari teks. "LoRA" Depth dan Canny Flux adalah pengecualian: model kawalan dihantar dalam bentuk LoRA.

Bolehkah saya guna ControlNet dengan video?

Boleh:
Wan
VACE dan Wan Fun ControlNets ambil urutan pose atau kedalaman; panduan video di laman ini terangkan.

Perlukah saya pasang model prapemproses?

Ya, ia muat turun masa guna pertama (controlnet_aux dalam ComfyUI, sambungan dalam A1111). Saiz kecil.

Mana lebih baik, IP-Adapter atau ControlNet?

Kerja berbeza: IP-Adapter salin rupa atau identiti dari imej, ControlNet salin struktur. Banyak aliran kerja guna kedua-duanya.

Adakah ini berfungsi di awan?

PirateDiffusion dan BitVector ada ControlNet untuk model mereka; kamu beri imej sumber dan jenis kawalan.

Pautan dan sumber

Model dalam panduan ini

Ditulis oleh
Captain

Panduan berkaitan

Model
Checkpoint vs LoRA vs embedding vs ControlNet: fail mana buat apa
Enam jenis fail model yang akan kamu jumpa, apa yang setiap satu ubah, saiznya berapa, letak di mana dan bila guna: checkpoints dan fine-tunes, LoRAs dan saudara LyCORIS mereka, embedding textual inversion, ControlNets dan IP-Adapters, VAEs dan upscalers.
Oleh Quartermaster
2025-10-08
Prompting
asas img2img, inpainting dan outpainting: membaiki tangan, menukar objek dan meluaskan gambar
Tiga cara untuk menjana dari gambar sedia ada dan bukan dari bunyi bising: img2img untuk menukar gaya dengan nilai denoise, inpainting untuk mengecat semula hanya kawasan bertopeng (cara biasa membaiki tangan dan muka), dan outpainting untuk meluaskan kanvas; dengan pilihan denoise, padding dan model untuk SD 1.5, SDXL, Flux Fill dan Qwen Image Edit.
Oleh Captain
2025-12-03
Prompting
Panduan Qwen-Image-Edit: arahan prompt, penyuntingan multi-gambar dan LoRA yang menjadikannya lebih baik
Cara dapatkan suntingan bersih dari Qwen-Image-Edit: tulis arahan bukan deskripsi, kekalkan identiti dan susun atur, input multi-gambar, penggantian teks, kawalan pose dan kedalaman, LoRA lightning untuk suntingan 4 langkah dan LoRA anything-to-real serta slider yang trending dalam keluarga Qwen2.
Oleh Captain
2026-05-26
ComfyUI
Apa itu ComfyUI? Panduan pemula untuk nod, aliran kerja dan graf pertama
ComfyUI diterangkan untuk orang yang datang dari Automatic1111, Fooocus atau aplikasi web: kenapa ia adalah graf, tujuh nod dalam aliran kerja lalai dan apa fungsi setiap satu, cara memuat aliran kerja dari imej, di mana model disimpan, Pengurus untuk nod yang hilang, dan bila alat yang lebih mudah atau awan adalah pilihan yang lebih baik.
Oleh Lookout
2025-12-17
Model
Meningkatkan imej AI: model ESRGAN, hires-fix, penyebaran bertiles dan bila setiap satu sesuai
Tiga keluarga peningkatan dan kegunaannya: penambah piksel pantas (4x-UltraSharp, Real-ESRGAN, SwinIR, DAT) untuk pembesaran bersih, hires-fix untuk menambah butiran semasa penjanaan, dan penyebaran bertiles (Ultimate SD Upscale, SUPIR, berasaskan Flux) untuk menukar render 1024 menjadi cetakan 4K yang terperinci; dengan nilai denoise, saiz tile dan model yang patut dimuat turun.
Oleh Quartermaster
2026-03-04

Lagi panduan

Perkhidmatan awan
Bayaran tetap vs token: kenapa pelan tanpa had seperti Graydient.ai adalah nilai terbaik untuk pencipta AI pada 2026
Perbandingan kos berperingkat, dengan harga diperiksa pada 8 Oktober 2026, pelan tanpa had bayaran tetap seperti Graydient.ai berbanding harga token dan kredit dari Midjourney, Leonardo, fal.ai, Replicate, Runway dan Kling: berapa kos sebenar 1,000 imej dan 1,000 video sebulan pada setiap satu, dan kenapa satu bayaran tetap untuk imej, video, audio, sembang Grok LLM dan aplikasi web tanpa had adalah nilai terbaik untuk pencipta yang membuat iterasi.
Oleh Captain
2026-10-08
Model
FLUX.1 Dev: cara memberi arahan, tetapan terbaik dan idea kreatif
Panduan praktikal untuk FLUX.1 Dev oleh Black Forest Labs: cara memberi arahan dalam bahasa biasa, tetapan panduan dan langkah, penumpukan LoRA, rendering teks dan idea arahan yang memanfaatkan kekuatannya.
Oleh Captain
2026-09-30
Model
Stable Diffusion XL 1.0: prompt, tetapan dan apa yang masih terbaik
Cara untuk dapatkan hasil terbaik dari model asas rasmi SDXL 1.0: resolusi asli, tetapan CFG dan sampler, refiner, prompt negatif dan idea gaya di mana SDXL masih menonjol.
Oleh Captain
2026-10-01
Model
Stable Diffusion 1.5: model klasik, dipandu dengan betul
Stable Diffusion 1.5 masih patut diketahui: resolusi yang betul, CFG dan sampler, cara guna perpustakaan besar LoRA dan embeddingnya, serta idea prompt kreatif yang sesuai untuk model 512-piksel.
Oleh Captain
2026-10-02
Model
FLUX.2 Dev: memicu model terbaru Black Forest Labs
FLUX.2 Dev membawa prompt yang lebih panjang, teks yang lebih baik, realisme yang lebih kuat dan penyuntingan multi-rujukan. Panduan ini merangkumi aliran kerja turbo, tetapan panduan dan resolusi, struktur prompt dan idea yang menggunakan kekuatan barunya.
Oleh Captain
2026-10-03
Model
Qwen-Image: arahan panjang, teks sempurna dan poster dwibahasa
Qwen-Image adalah model yang sesuai bila perkataan dalam gambar penting. Pelajari cara menulis arahan panjang yang terperinci, hasilkan teks Inggeris dan Cina dengan tepat, tetapkan CFG dan langkah, serta terokai idea kreatif yang berat pada susun atur.
Oleh Captain
2026-09-29