오픈AI 'ChatGPT Images 2.0' 공개… 생각하고 그리는 이미지 모델 시대로



ChatGPT Images 2.0으로 생성한 이미지들



나노바나나, 노트북LM으로 생성한 이미지
오픈AI가 4월 21일(현지 시각) 차세대 이미지 생성 모델 ChatGPT Images 2.0(API 모델명 gpt-image-2)을 공개했습니다. 지난 몇 주간 LM Arena에 'duct tape(덕트 테이프)'라는 코드명으로 먼저 풀려 긴 텍스트 블록, UI 스크린샷, 도면까지 뽑아내며 사용자들을 놀라게 했던 그 모델이 정식 이름표를 달고 돌아온 겁니다.
가장 큰 변화는 추론(thinking)이 이미지 생성 파이프라인 안으로 들어왔다는 점입니다. 오픈AI 최초로 네이티브 리즈닝 기능이 내장된 이미지 모델이며, 2K 해상도, 3:1~1:3 화면비, 한 프롬프트로 최대 8장까지 캐릭터·오브젝트 일관성을 유지한 이미지를 뽑아냅니다. 생성 과정에서 웹 검색으로 실시간 정보를 끌어오고, 결과물을 스스로 한 번 더 검증(double-check)하는 것도 특징입니다.
기존 이미지 모델의 고질병이던 디테일도 손을 봤습니다. "작은 텍스트, 아이콘, UI 요소, 빽빽한 구도, 미묘한 스타일 지시"처럼 이미지 모델이 흔히 망가뜨리던 요소들을 최대 2K 해상도에서 정확히 묘사한다는 것이 오픈AI의 설명입니다. GPT Image 1.5에서 뚜렷했던 따뜻한 색감 편향(warm color cast)도 사라져 전 장면에서 중립적인 색 재현이 가능해졌다고 합니다.
한국어 랜더링 향상은 국내 사용자 입장에서 가장 반가운 대목입니다. 오픈AI는 일본어·한국어·중국어·힌디어·벵골어에서 유의미한 개선이 있었다고 명시했고, 리뷰어들의 테스트 결과 이전 이미지 모델들이 뱉어내던 알 수 없는 글자 덩어리가 아닌 네이티브 텍스트에 가까운 결과물이 나왔다고 합니다. 혼합 스크립트 처리도 가능해서 라틴 알파벳과 한자가 섞인 포스터, 영어 제목 위에 중국어 자막이 얹힌 레이아웃처럼 그간 모든 상용 이미지 모델이 깨뜨리던 조합도 소화해낸다고 합니다.
벤치마크 성적도 좋습니다. 출시 12시간 만에 Image Arena 리더보드 전 카테고리에서 +242점 격차로 1위에 올랐는데, 해당 리더보드 기준 역대 최대 격차 기록이라고 합니다.
이 모델의 제공 방식은 2단계 구조입니다. 인스턴트(Instant) 모드는 무료 티어 포함 전 ChatGPT 사용자에게 열려 있고, 웹 검색·최대 8장 배치 생성·출력 자체 검증을 지원하는 씽킹(Thinking) 모드는 Plus(월 20달러), Pro(월 200달러), Business, Enterprise 구독자로 제한됩니다. 환산 시 Plus는 약 2만 9,700원, Pro는 약 29만 7,000원 수준입니다(1,485원 환율 기준).
API 가격은 토큰 단위로, 텍스트 토큰 100만 개당 입력 5달러·출력 10달러, 이미지 토큰 100만 개당 입력 8달러·출력 30달러입니다. 1024×1024 고품질 기준으로 장당 약 0.21달러(약 310원)로, 이전 세대 대비 약 60% 비싸졌는데 더 큰 캔버스와 추론 단계에 드는 비용이라는 설명이고요. 반면 1024×1536 고품질은 0.165달러로 GPT Image 1.5(0.20달러)보다 오히려 저렴해졌습니다.
한 가지 더. DALL-E 2와 DALL-E 3는 2026년 5월 12일에 퇴역 예정이니, 기존 DALL-E 파이프라인을 쓰던 분들은 마이그레이션 일정을 챙겨두셔야겠습니다.
기사참고
오픈AI 블로그 https://openai.com/index/introducing-chatgpt-images-2-0/
번역: 클로드