본문 바로가기
IT잡식/주저리주저리

Google 의 새로운 "무료" 생성형 이미지 AI 툴 Whisk(위스크)

by _NONAME_ 2025. 2. 17.

Whisk ?

출처 : Google 공식 블로그

며칠 전 Google 에서 새로운 생성형 이미지 AI 툴을 공개했습니다.

심지어 "무료" 인데요!

Google 에서 홍보 영상도 공개했는데 먼저 보고 오시죠!

https://youtu.be/fyFDztZxlEc

 

보신 것과 같이 "이미지" 기반으로 새로운 이미지를 생성하는 툴입니다.

기존 다른 생성형 이미지 AI 툴들은 기본적으로 prompt 를 기반으로 동작하게끔 되어 있는데요 (물론 이미지 기반도 가능합니다ㅎ)

아무래도 Google 은 멀티모달 생성형 AI 에 집중을 하고 있다보니 자연스러운 현상 같네요ㅎ

 

사용 방법

원리는 둘째치고 일단 사용을 해보는게 중요하겠죠?ㅎ

https://labs.google/fx/ko/tools/whisk

 

Whisk - labs.google/fx

 

labs.google

여기에 접속하시고 Google 로그인만 하면 끝! 입니다.

그 이후로는 위 동영상 또는 페이지 내 가이드에 맞춰 진행하시면 됩니다ㅎ

제가 테스트했던 2월 13일 기준으로는 세부 보정 목적의 prompt 는 영어만 지원했었는데... 이젠 한글도 되는 것 같습니다ㅎ

 

저는 "노을 지는 파리 에펠탑 앞"이라는 장면 요청과 "픽사 느낌의 3D 애니메이션" 스타일로 테스트를 해봤는데요,

결과는 이렇게 나왔습니다!

 

기본적인 포즈부터 의상 스타일, 헤어스타일까지 찰떡이고 원하는 장면까지!!

원하는 이미지가 생성된 것을 확인할 수 있었습니다!

 

원리?

Google 에서 밝힌 내용은 아래와 같습니다.

위스크의 작용 원리에는 ‘제미나이’‘이마젠 3’ 가 활용됩니다.
Whisk에 이용자가 원하는 이미지를 입력하면
제미나이(Gemini)’는 자동으로 이미지에 대한 상세 캡션을 작성합니다. 이렇게 생성된 캡션은 구글의 최신 이미지 생성 모델인 ‘이마젠 3(Imagen 3)
에 입력되는데, 이 과정에서 원본을 그대로 복제하는 것이 아닌 입력된 이미지의 본질을 담아내게 됩니다. 이로 인해 이용자는 주제, 장면, 스타일을 창의적이면서도 새로운 방식으로 손쉽게 재생성할 수 있습니다.

 

확실히 "멀티모달" 에 특화된 Gemini 를 사용해서 이미지를 분석하고,

또다른 생성형 AI 인 Imagen 3 를 이용하여 text to image 를 수행한 것을 확인할 수 있습니다.

 

각 생성형 AI 의 기능은 아래 링크에서 자세하게 확인할 수 있습니다

 

- Gemini : https://deepmind.google/technologies/gemini/?_gl=1*b6ijqf*_up*MQ..*_ga*MTY5NzA4OTA4Ny4xNzM5NzkyMDU2*_ga_LS8HVHCNQ0*MTczOTc5MjA1NS4xLjAuMTczOTc5MjA1NS4wLjAuMA..

 

Gemini

Gemini 2.0 our most capable AI model yet, built for the agentic era.

deepmind.google

- Imagen 3 : https://deepmind.google/technologies/imagen-3/

 

Imagen 3

Imagen 3 is our highest quality text-to-image model, capable of generating images with even better detail, richer lighting and fewer distracting artifacts than our previous models.

deepmind.google

 

AI의 강자 OpenAI 의 ChatGPT 부터 시작해서 최근 딥시크, Grok 등 다양한 생성형 AI 툴이 많이 쏟아지고 있는데요, 대부분 Prompt 를 기반으로 하고 있는게 특징입니다.

Google 은 Prompt 기반이 아닌 "멀티모달" 에 집중을 하고 있는데요,

과연 그 결과는 어떻게 될지 궁금해지네요ㅎ