Skip to main content
Kandinsky 5.0Kandinsky Lab이 개발한 비디오 및 이미지 생성용 확산 모델 제품군입니다. Kandinsky 5.0 T2V Lite는 오픈소스 비디오 생성 모델 중 최상위권에 드는 경량 2B 파라미터 모델로, 최대 10초 길이의 비디오를 생성할 수 있습니다.
ComfyUI가 최신 버전으로 업데이트되었는지 확인하세요.이 가이드의 워크플로는 워크플로 템플릿에서 확인할 수 있습니다. 템플릿에서 찾을 수 없다면, 귀하의 ComfyUI가 오래된 버전일 수 있습니다.워크플로를 로드할 때 노드가 누락되는 경우, 가능한 원인:
  1. 최신 ComfyUI 버전(최신 테스트 버전(nightly))을 사용하고 있지 않음
  2. 일부 노드가 시작 시 가져오기에 실패함

개요

Kandinsky 5.0은 Flow Matching이 적용된 잠재 확산 파이프라인을 사용하며 다음과 같은 특징이 있습니다:
  • Diffusion Transformer (DiT): 텍스트 임베딩에 대한 크로스 어텐션을 갖춘 주요 생성 백본
  • Qwen2.5-VL 및 CLIP: 고품질 텍스트 임베딩 제공
  • HunyuanVideo 3D VAE: 비디오를 잠재 공간으로 인코딩 및 디코딩
이 모델 제품군에는 다양한 사용 사례에 최적화된 여러 변형이 포함되어 있습니다:
  • SFT 모델: 최고의 생성 품질
  • CFG-distilled: 2배 빠른 추론
  • Diffusion-distilled: 최소한의 품질 손실로 6배 빠름 (16스텝)
  • Pretrain 모델: 파인튜닝용으로 설계
모든 모델은 5초 및 10초 비디오 생성 버전으로 제공됩니다.

모델 변형

텍스트 기반 비디오 생성 워크플로우

Kandinsky 5.0 Video Lite 텍스트 기반 비디오 생성

영어와 러시아어 프롬프트로 높은 시각적 품질의 비디오를 생성하는 경량 2B 모델입니다. Kandinsky 5.0 Video Lite Text to Video workflow preview

Comfy Cloud에서 실행

Comfy Cloud에서 열기

워크플로우 다운로드

JSON을 다운로드하거나 템플릿 라이브러리에서 “Kandinsky 5.0 Video Lite Text to Video” 검색

2. 모델 수동 다운로드

텍스트 인코더

Text Encoder: qwen_2.5_vl_7b_fp8_scaled.safetensors

Qwen2.5-VL 7B 텍스트 인코더 (FP8). ComfyUI/models/text_encoders/에 배치

Text Encoder: clip_l.safetensors

CLIP-L 텍스트 인코더. ComfyUI/models/text_encoders/에 배치
Diffusion Model

Diffusion Model: kandinsky5lite_t2v_sft_5s.safetensors

Kandinsky 5.0 T2V Lite SFT diffusion 모델 (5s). ComfyUI/models/diffusion_models/에 배치
VAE

VAE: hunyuan_video_vae_bf16.safetensors

HunyuanVideo 3D VAE. ComfyUI/models/vae/에 배치

이미지 기반 비디오 생성 워크플로우

Kandinsky 5.0 Video Lite 이미지 기반 비디오 생성

영어와 러시아어 프롬프트로 높은 시각적 품질의 비디오를 생성하는 경량 2B 모델입니다. Kandinsky 5.0 Video Lite Image to Video workflow preview

Comfy Cloud에서 실행

Comfy Cloud에서 열기

워크플로우 다운로드

JSON을 다운로드하거나 템플릿 라이브러리에서 “Kandinsky 5.0 Video Lite Image to Video” 검색
입력 자료 이 파일을 해당 LoadImage 노드에 업로드하세요:

crystal_flower.png

LoadImage 노드 11 · crystal_flower.png
crystal_flower.png

2. 모델 수동 다운로드

텍스트 인코더

Text Encoder: qwen_2.5_vl_7b_fp8_scaled.safetensors

Qwen2.5-VL 7B 텍스트 인코더 (FP8). ComfyUI/models/text_encoders/에 배치

Text Encoder: clip_l.safetensors

CLIP-L 텍스트 인코더. ComfyUI/models/text_encoders/에 배치
Diffusion Model

Diffusion Model: kandinsky5lite_i2v_5s.safetensors

Kandinsky 5.0 I2V Lite diffusion 모델 (5s). ComfyUI/models/diffusion_models/에 배치
VAE

VAE: hunyuan_video_vae_bf16.safetensors

HunyuanVideo 3D VAE. ComfyUI/models/vae/에 배치

리소스