Pony Diffusion
Pony Diffusion is a community-driven text-to-image diffusion model built on Stable Diffusion, known for high-quality stylized and non-photorealistic image generation.
Pony Diffusion V6 XL trains on ~2.6 million images with score-tag prompting (score_9 / score_8_up quality tags) and broad Danbooru/CLIP caption support, enabling strong character recognition and style diversity.
V7 expands the training dataset to ~10 million images, adds style grouping, better SFW coverage, and prepares video data for future text-to-video tasks.
Free to try online via embedded Hugging Face Spaces playgrounds; no sign-up required.




