📰 AI뉴스#AI뉴스
[모델]구글, 제미나이 플래시에 '에이전틱 비디오 이해' 도입
방앗간지기09.05 1
구글이 제미나이 플래시 모델을 위한 '에이전틱 비디오 이해' 기능을 선보였습니다. 영상을 1 FPS로 전부 읽어 들이는 대신 프롬프트에 필요한 구간만 탐색해 로드하는 방식입니다. 이를 통해 비디오 처리 토큰을 최대 88%까지 줄였습니다.
전문 읽기접기
무슨 일이야
구글이 제미나이 플래시(Gemini Flash) 모델에 에이전틱 비디오 이해(Agentic Video Understanding) 방식을 적용했습니다. 기존에는 비디오를 초당 1프레임(1 FPS) 단위로 통째로 입력받아 처리하는 형태였습니다.
새로운 방식은 모델이 영상 전체를 무작정 읽는 대신, 주어진 프롬프트에 맞춰 필요한 특정 구간만 직접 탐색하고 로드합니다. 구글에 따르면 이 접근법을 통해 비디오 토큰 소모량을 최대 88%까지 절감할 수 있습니다.
왜 중요해
긴 영상을 멀티모달 모델로 분석할 때 가장 큰 걸림돌은 막대한 토큰 소모량과 그로 인한 비용 및 처리 속도였습니다. 프롬프트에 필요한 구간만 골라 읽는 에이전틱 방식을 쓰면, 영상 분석 API 비용을 크게 낮추고 응답 효율도 대폭 개선할 수 있을 것으로 보입니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.