text-to-video텍스트 투 비디오

text-to-video는 글로 입력한 장면 설명을 바탕으로 AI가 영상을 생성하는 방식이다.

기사 1편
최근 언급

text-to-video는 장면, 동작, 분위기 등을 설명하는 글을 입력받아 영상을 생성하는 AI 방식이다. 기존 이미지를 출발점으로 삼는 image-to-video(이미지를 영상으로 변환하는 방식)와 달리, 생성의 주된 입력이 텍스트다.

주로 확산 모델을 바탕으로 발전했으며, 2024년 OpenAI가 Sora를 공개한 뒤 널리 주목받았다. Google의 Veo, Runway의 Gen 계열 모델 등이 대표적이며, 광고·숏폼 영상 제작 등에 쓰인다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

캐릭터 시트 없이 text-to-video 모드로 8초씩 생성합니다.


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.