Stable Diffusion

Stable Diffusion

스테이블 디퓨전

AI 이미지High모켓지수 기준OSS 표준

소개

Stability AI가 2022년 8월 공개한 오픈소스 이미지 생성 모델로, 코드와 가중치가 전부 공개되어 로컬 PC에서 직접 실행할 수 있습니다. 초기 버전(SD 1.x~XL)은 VAE·U-Net·CLIP 구조를, SD 3.0부터는 MMDiT(Multimodal Diffusion Transformer)와 Rectified Flow 기반으로 전환해 품질과 프롬프트 충실도가 향상되었습니다. txt2img, img2img, 인페인팅, 아웃페인팅, ControlNet 기반 제어 등 다양한 작업을 지원하며, AUTOMATIC1111·ComfyUI 등 서드파티 UI와 수천 개의 LoRA·Checkpoint 커뮤니티 생태계가 방대합니다. 연매출 100만 달러 미만 조직은 Community License로 비상업·상업 용도 모두 무료로 사용할 수 있습니다.

Stable Diffusion 사용법

1

환경 준비·WebUI 설치

Python 3.10.6과 Git를 깔고 NVIDIA GPU(VRAM 6GB+) 환경에서 AUTOMATIC1111 stable-diffusion-webui를 clone합니다.

2

실행·모델 로드

webui-user.bat를 실행하면 로컬 WebUI가 뜹니다. txt2img 탭 상단 체크포인트로 사용할 모델(입문자는 v1.5)을 선택합니다.

3

txt2img로 이미지 생성

Prompt에 장면을 영어로 묘사하고 해상도를 맞춘 뒤(v1은 512px 기준) batch size를 올려 여러 장 Generate해 비교합니다.

장점

  • 코드와 가중치가 공개된 오픈소스라 로컬 실행 시 API 비용 없이 무제한 생성
  • 연매출 100만 달러 미만 조직은 Community License로 상업적 사용까지 무료
  • LoRA·Checkpoint·ControlNet 등 수천 개의 커뮤니티 확장으로 스타일과 제어 자유도 최상
  • 최적화 버전은 VRAM 2.4GB GPU에서도 실행 가능해 하드웨어 진입 문턱이 낮음
  • 이미지가 외부 서버로 전송되지 않아 프라이버시·보안에 유리

단점

  • LAION-5B 영어 캡션 위주로 학습돼 한국어 프롬프트 정확도와 한국 문화 재현이 떨어짐
  • 로컬 실행 시 Python·CUDA 등 환경 설정이 필요해 비개발자 진입 장벽이 존재
  • 연매출 100만 달러를 넘는 조직은 Enterprise License로 별도 계약이 필요

핵심 기능

오픈소스 모델 공개

코드와 가중치를 GitHub에 전부 공개해 로컬 PC에서 직접 실행할 수 있습니다.

Latent Diffusion / MMDiT 아키텍처

SD 1.x~XL은 VAE·U-Net·CLIP 구조, SD 3.0부터는 Multimodal Diffusion Transformer(MMDiT)와 Rectified Flow로 전환되어 품질이 향상되었습니다.

img2img·인페인팅·아웃페인팅

기존 이미지의 일부 또는 경계를 확장하거나 부분 수정하는 편집 기능을 지원합니다.

ControlNet 지원

깊이 맵, 엣지, 포즈 스켈레톤 등 조건 이미지로 구도와 형태를 정밀하게 제어합니다.

커뮤니티 모델·UI 생태계

LoRA·Checkpoint·Textual Inversion 등 수천 개의 커스텀 모델과 AUTOMATIC1111·ComfyUI·Fooocus 등 서드파티 UI로 자유롭게 활용할 수 있습니다.

낮은 하드웨어 요구사항

최적화 버전은 VRAM 2.4GB GPU에서도 동작하며 10GB 이상을 권장합니다.

세대별 모델 제공

SD 1.5, 2.0, SDXL(3.5B), SD 3.0/3.5(2024-10)까지 용도별로 선택할 수 있습니다.

Brand Studio (엔터프라이즈)

기업 마케팅팀 대상 별도 유료 플랫폼으로, 브랜드 전용 모델 학습·캠페인 자동화·여러 모델 자동 라우팅을 제공한다(오픈소스 SD와 별개 상품).

공식 사이트 2026-08-01 검증

요금제

2026-08-01 기준

Trial

Free

Core

$50​/​month

Enterprise

Custom

Stable Diffusion와 함께 쓰는 AI 콤보

여러 AI 도구를 묶어서 만든 검증된 워크플로우

자주 묻는 질문

스테이블 디퓨전은 무료로 쓸 수 있나요?

연매출 100만 달러 미만 조직이라면 Community License에 따라 비상업·상업 용도 모두 무료로 사용할 수 있습니다. 그 이상은 Enterprise License 계약이 필요합니다.

한국어 프롬프트가 잘 동작하나요?

모델이 LAION-5B의 영어 캡션 위주로 학습되어 한국어 프롬프트는 정확도가 낮고 한국 문화 표현도 제한적입니다. 영어 프롬프트 또는 한국어 파인튜닝 모델 사용을 권장합니다.

실행에 어떤 GPU가 필요한가요?

최적화된 경량 버전은 VRAM 2.4GB부터 동작하지만, SDXL·SD 3.5 같은 최신 모델을 원활히 쓰려면 VRAM 10GB 이상을 권장합니다.

생성한 이미지를 상업적으로 써도 되나요?

Community License 범위 안에서는 생성 이미지에 대한 상업적 사용 권리를 사용자가 보유합니다. 조직 연매출이 100만 달러를 넘으면 Enterprise License로 전환해야 합니다.

Midjourney, GPT Image와 무엇이 다른가요?

Midjourney·GPT Image는 호스팅형 폐쇄 서비스인 반면, 스테이블 디퓨전은 오픈소스 모델이라 로컬 실행·파인튜닝·커스텀 LoRA가 자유롭습니다.

어떤 버전을 선택해야 하나요?

최신 공식 버전은 2024년 10월 공개된 SD 3.5이며, 커뮤니티 확장(LoRA, ControlNet 등)은 여전히 SDXL과 SD 1.5 기반이 풍부합니다. 목적에 따라 병행 사용합니다.

학습 데이터는 무엇인가요?

대규모 오픈 이미지-텍스트 데이터셋인 LAION-5B를 기반으로 학습되었으며, 영어권·서구 문화 이미지 비중이 높습니다.

사용자 리뷰

불러오는 중...