같은 prompt(AI에 주는 지시문)를 Google Gemini의 Nano Banana 2.1, ChatGPT, Meta의 Muse에 넣고 썸네일, 홍보 전단, 캠페인 비주얼, 카드뉴스를 차례로 만들게 하면 결과는 과제마다 달라집니다. Nano Banana 2.1은 10초 안팎으로 가장 빠르고 글자를 정확히 쓰지만 실제 인물의 얼굴을 바꿔 놓았고, ChatGPT는 1분 넘게 걸리는 대신 얼굴을 가장 비슷하게 살렸습니다. Muse는 종이 질감과 정돈된 배치가 필요한 디자인에서 앞섰습니다. 어느 하나가 모든 과제를 이기지는 않았다는 점이 이번 비교의 핵심으로 보입니다.
Nano Banana 2.1, 무엇이 나아졌나
Google은 Nano Banana 2.1을 이미지 생성·편집 모델로 내놓으며 시각 디자인, 마스크 기반 편집(이미지의 지정한 부분만 고치는 기능), 같은 인물을 일관되게 그리는 능력이 좋아졌다고 밝혔습니다. 공개된 비교 사례들을 보면 개선 폭은 과제에 따라 다르게 나타났습니다.
| 비교 과제 | 관찰된 결과 |
|---|---|
| 같은 JSON prompt로 만든 여성 인물 사진 | Nano Banana 2.1의 피부 질감이 ChatGPT Image 2.5보다 실제 사람에 가깝고, ChatGPT 쪽은 지나치게 매끈함 |
| 이전 판 Nano Banana 2와의 인물 일관성 | 정면은 둘 다 정확하지만 옆모습과 해변 장면에서 2.1이 얼굴을 더 잘 유지 |
| 직원, 오두막, 메뉴판 등 참고 이미지 여러 장을 합친 해변 매점 장면 | 2.0은 크기와 조명이 어긋나고 메뉴 글자가 깨짐, Nano Banana Pro는 배치는 맞지만 조명이 인공적, 2.1은 그림자와 배치가 가장 자연스러움 |
| 렌즈 24mm, 노면 위 30cm 높이를 지정한 밤 주유소 장면 | 낮은 각도는 살렸지만 주유기가 흐릿하게 번지고 우산과 종이컵을 든 손이 지시와 반대로 바뀜 |
다만 정면 인물 사진만 놓고 보면 2.0과 2.1의 차이가 눈에 잘 띄지 않는다는 평가도 있었습니다. 2.1이 확실히 나아진 쪽은 여러 요소를 한 장면에 합치는 복잡한 구성이고, 정면 인물 사진만으로 업그레이드 폭을 판단하기는 어려워 보입니다. 해변 매점 장면에서도 계산대 소품의 크기와 점원 얼굴이 참고 사진에서 조금씩 벗어나는 한계는 남았습니다.

▲ 여러 참고 이미지의 합성
같은 지시로 겨룬 네 Ghazi 과제
실제 게시용 콘텐츠에 가까운 과제 네 Ghazi를 같은 조건에서 시험했습니다. 첫 과제에는 표정을 고정해 막 찍은 실제 인물 사진을 참고 이미지로 넣었고, 결과를 고친 뒤 판단하지 않도록 한 번의 지시로 나온 결과만 비교했습니다.
| 과제 | Nano Banana 2.1(Gemini) | ChatGPT | Muse |
|---|---|---|---|
| 16:9 썸네일 | 8~9초, 모자 로고·배경·문구 정확, 얼굴은 지치고 달라 보임 | 약 1분 3초, 얼굴이 가장 비슷, 모자 로고 누락 | 약 1분 2초, 배경은 무난, 눈이 만화처럼 어색 |
| 4:5 홍보 전단 | 15초 이내, 철자 정확, 대비가 강해 눈에 띔 | 약 1분 44초, 화려하고 완성도 높음, 작은 본문 글자가 일부 어긋남 | 약 1분, 철자 정확, 디자인은 밋밋 |
| 캠페인 비주얼 | 평범하고 입체감이 부족 | 어두운 대비와 떠 있는 카드 구성 | 엠보싱 폴더와 종이 질감으로 가장 세련됨 |
| 2장짜리 카드뉴스 | 둘째 장 한 장만 만들어 과제 실패 | 첫 장을 만든 뒤 그 장을 참고해 둘째 장을 일관되게 만듦 | 두 장을 한 번에 깔끔하게 만듦 |
썸네일: 속도와 얼굴 재현의 맞교환
첫 과제는 노란색과 짙은 회색으로 나뉜 배경에 ’WHICH ONE WINS?’라는 큰 문구를 넣고 인물을 가슴 위로 가운데 두는 YouTube 썸네일이었습니다. prompt에는 얼굴 구조, 피부색, 머리, 나이를 그대로 지키고 다른 사람처럼 미화하지 말라는 지시가 들어갔습니다.
Nano Banana 2.1은 8~9초 만에 끝냈고 배경, 문구, 모자에 수놓인 사자 로고까지 정확히 살렸습니다. 그러나 얼굴은 피곤해 보이고 비율이 달라져 실제 인물과 닮지 않았습니다. ChatGPT는 1분이 넘게 걸렸고 모자 로고를 빼먹었지만 얼굴, 표정, 고개 기울기가 실제와 가장 가까웠습니다. Muse는 배경 구성은 무난했지만 눈이 밝고 만화처럼 보이는 어색함이 있었습니다. 썸네일에서는 작은 로고보다 얼굴이 실제 인물처럼 보이는 것이 더 중요하다는 판단에 따라 이 과제의 선호는 ChatGPT로 기울었습니다.
전단: 글자는 셋 다 정확, 차이는 디자인
둘째 과제는 크림색 배경, 짙은 회색 글자, 형광 라임색 강조를 지정하고 제목과 여러 줄의 문구를 담은 세로형 홍보 전단이었습니다. 세 도구 모두 철자를 정확히 썼고, 이전 세대 이미지 생성 도구보다 글자 표현이 크게 나아졌다는 평가가 나왔습니다. Nano Banana 2.1은 15초도 걸리지 않으면서 대비가 강한 결과를 냈고, ChatGPT는 가장 오래 걸렸지만 입체적인 구체와 현대적인 배치로 시각적 힘이 돋보였습니다. Muse는 지시는 다 지켰지만 디자인이 눈에 덜 띄었습니다.
캠페인 비주얼과 카드뉴스: Muse의 강점
셋째 과제는 ’ONE IDEA, MANY MOVES’라는 문구 아래 큰 색인 카드 뒤로 영상 프레임, 팟캐스트 파형, 소셜 게시물, 카드뉴스 묶음, 뉴스레터가 부채꼴로 펼쳐지는 추상적인 캠페인 이미지였습니다. 이 과제에서는 엠보싱 폴더와 종이 질감, 절제된 배치를 보여 준 Muse가 앞섰습니다. Gemini는 앞서 넣은 인물 사진이 대화 맥락에 남아 있는 상태에서 작업했고, 결과도 밋밋했습니다.
넷째 과제는 표지와 본문 두 장으로 된 Instagram 카드뉴스였습니다. 둘째 장이 표지와 같은 색과 글꼴을 써야 하는 연속성 과제에서 Gemini는 둘째 장 하나만 만들어 지시를 이해하지 못했습니다. ChatGPT는 표지를 먼저 만들고 그 표지를 참고해 둘째 장을 이어 만들었고, Muse는 두 장을 한 번에 깔끔한 여백과 글꼴로 내놓았습니다.

▲ 카드뉴스 연속성 비교
결과를 좌우한 prompt 작성법
이번 비교에 쓰인 prompt에는 도구를 가리지 않고 결과를 안정시키는 요소가 공통으로 들어 있었습니다.
- 미화 금지를 직접 적기: 실제 인물 사진을 넣을 때 ’다른 사람처럼 미화하지 말 것’을 명시하면 지나친 보정을 줄일 수 있습니다.
- 배치를 구체적으로 지정: ‘가슴 위로 가운데’, ’얼굴을 크게 가리지 않게’처럼 쓰면 인물이 배경 속으로 작아지는 일을 막을 수 있습니다.
- 색 구획과 비율 명시: ‘왼쪽은 진한 노랑, 오른쪽은 짙은 회색’, 4:5나 16:9 같은 비율을 적어야 도구 사이 비교도 공정해집니다.
- 문구는 따옴표 안에 그대로: 대소문자와 문장 부호까지 따옴표 안에 적으면 철자 정확도를 확인하기 쉽습니다.
- 카메라 수치 활용: 렌즈 초점 거리, 카메라 높이, 기울기 각도를 적으면 영화 같은 시점을 얻기 쉽습니다. 잘 만든 prompt를 AI에 보여 주고 구조를 분석하게 해 자신만의 틀을 만드는 방법도 있습니다.
- 연작은 첫 장을 기준으로: 카드뉴스처럼 여러 장이 필요하면 첫 장을 글꼴, 색, 배치의 기준으로 삼으라고 지시합니다.
- 짧고 나눠 쓸 수 있게: 지시가 지나치게 길고 복잡하면 어느 손에 무엇을 들었는지 같은 세부가 뒤섞일 수 있습니다. 상세하되 간결하게 써서 음성이나 텍스트로 다시 쓰기 쉽게 만드는 편이 낫습니다.
과제별로 도구를 고르는 법
이번 결과를 정리하면 하나의 도구에 모든 작업을 맡기기보다 과제에 맞춰 나눠 쓰는 편이 합리적으로 보입니다. 빠르게 시안을 여러 장 뽑거나 정확한 글자와 작은 로고를 살려야 하면 Nano Banana 2.1, 실제 인물 얼굴이 들어가는 썸네일이나 여러 장이 이어지는 카드뉴스라면 ChatGPT, 종이 질감과 정돈된 배치가 중요한 캠페인 이미지라면 Muse가 맞을 수 있습니다. 전반적인 쓰임새로는 ChatGPT가 가장 믿을 만한 일상 도구라는 판단이 유지됐습니다.
직접 비교해 보려면 다음 순서를 권합니다.
- 자신이 자주 만드는 콘텐츠 하나를 골라 같은 prompt와 같은 참고 사진을 준비합니다.
- 고치지 않은 첫 결과만으로 비교하고, 생성 시간을 함께 적어 둡니다.
- 결과를 크게 확대해 눈과 얼굴 세부, 작은 글자를 확인합니다. 작은 색 변화 하나가 썸네일의 신뢰도를 떨어뜨릴 수 있습니다.
- 정면 인물 사진 한 장이 아니라 여러 각도, 여러 요소를 합친 장면으로도 시험해 업그레이드 폭을 판단합니다.