Wan 2.6
AI Image & Video Model
Alibaba's multimodal generation model from the Wan AI suite, supporting text-to-video, image-to-video, reference-to-video with audio, and text-to-image, in both Chinese and English
What Wan 2.6 is good at
Rankings based on human votes in the Lumenfall Arena, where real users pick their favorite without knowing which model made which image. Excels at #1 Prompt Adherence (Text-to-Video), #1 Human Fidelity (Text-to-Video), #2 Adding & Editing Objects (Image Editing), #2 People & Poses (Image Editing), #2 Aesthetics (Image Editing), #2 Backgrounds & Scenes (Image Editing), #7 3D Imaging & Modeling (Text-to-Image), #2 Physics & Realism (Text-to-Video), #2 Motion Quality (Text-to-Video), #6 Photorealism (Image Editing), #8 Lighting, Shadows & Materials (Image Editing), #10 Preservation (Image Editing), #22 Photorealism (Text-to-Image), and #24 Aesthetics (Text-to-Image) , placing in the top 38% of all competing models.
Wan 2.6 Strengths
Wan 2.6 outperforms most competing models here
Prompt Adherence
Text-to-VideoHuman Fidelity
Text-to-VideoAdding & Editing Objects
Image EditingPeople & Poses
Image EditingAesthetics
Image EditingBackgrounds & Scenes
Image Editing3D Imaging & Modeling
Text-to-ImagePhysics & Realism
Text-to-VideoMotion Quality
Text-to-VideoPhotorealism
Image EditingLighting, Shadows & Materials
Image EditingPreservation
Image EditingPhotorealism
Text-to-ImageAesthetics
Text-to-ImageOther categories
Wan 2.6 competes but doesn't rank as highly