구글은 제미나이 에이전틱 비디오로 토큰을 최대 88% 줄였다고 밝혔다
구글은 2026년 9월 1일 공식 블로그 글 'Introducing agentic video understanding with Gemini'에서 제미나이 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite 세 모델에 에이전틱 비디오 이해(agentic video understanding)를 적용했다고 발표했다. 표준 영상 분석 벤치마크 전반에서 분석 비용을 최대 66%, 토큰 소비를 최대 88% 줄이면서 정확도를 최대 7% 올렸다는 것이 구글이 제시한 수치다. 기존 방식이 초당 프레임 수를 고정해(기본 1 FPS, API로 조정 가능) 영상을 통째로 삼켰다면, 에이전틱 방식은 모델이 무엇을 어떤 속도로 어떤 양식(프레임, 오디오, 자막)으로 볼지 스스로 정해 필요한 구간만 가져온다. 글은 구글 딥마인드의 로한 도시(Rohan Doshi) 시니어 프로덕트 매니저와 마리오 루치치(Mario Lučić) 리서치 디렉터가 썼다.
고정 프레임 레이트를 버린 것이 절감의 실제 원인이다
에이전틱 비디오 이해의 핵심은 새 영상 모델이 아니라 영상을 읽는 절차의 교체다. 구글은 기존 정적 처리에서 모델이 고정된 초당 프레임 수로 영상을 받아들였고 기본값은 1 FPS이며 API로 조정할 수 있다고 밝혔다. 에이전틱 처리는 여기에 제미나이의 네이티브 영상 도구를 붙여, 모델의 추론이 시각 프레임과 오디오와 자막을 가로질러 대상 구간을 동적으로 검색하고 훑고 들여다보게 만든다.
동작 방식은 에이전트 루프다. 구글은 모델이 내부 도구를 호출해 영상 파일의 관련 부분만 불러오는 방식이라고 설명했다. 같은 글에서 구글은 개발자가 이전에도 이런 작업을 수동으로 구현할 수 있었지만, 에이전틱 비디오 이해는 그 루프를 모델 안에서 수행해 개발 부담을 크게 줄인다고 적었다.
구글이 제시한 비교 대상은 이미지 쪽 선행 기능이다. 코드 실행을 제미나이의 네이티브 이미지 이해와 결합한 에이전틱 비전과 유사한 구조이며, 영상에서는 초 단위 순간 검색과 더 정확한 이상 탐지, 정밀한 계수 같은 새 용례를 연다는 것이 구글의 설명이다.
88%, 66%, 7%는 서로 다른 축을 가리킨다
세 숫자를 하나의 성능 지표로 합쳐 읽으면 발표문이 말하지 않은 결론이 나온다. 토큰 최대 88% 감소는 모델이 삼키는 입력의 양이 줄었다는 뜻이고, 비용 최대 66% 감소는 그 입력 감소가 청구서에 반영된 결과이며, 정확도 최대 7% 향상은 덜 보고도 더 맞혔다는 뜻이다. 세 축이 같은 방향으로 움직인 것이 이 발표의 실질이다.
토큰 감소율과 비용 감소율의 간격도 그 자체로 정보다. 토큰이 최대 88% 줄었는데 비용은 최대 66% 줄었다는 것은, 절감된 입력 토큰 외에 에이전트 루프가 스스로 쓰는 몫이 존재한다는 뜻으로 읽힌다. 영상을 훑고 되감고 특정 구간을 다시 부르는 행위 자체가 연산이기 때문이다. 구글은 추가 기능 요금 없이 표준 제미나이 API 토큰 요금이 적용된다고 명시했으므로, 비용 계산의 변수는 요금표가 아니라 모델이 실제로 몇 번 되돌아보느냐가 된다.
'최대'라는 한정어도 그대로 옮겨야 한다. 구글이 쓴 표현은 모든 영상에서 88%가 줄어든다는 뜻이 아니라 표준 영상 분석 벤치마크 전반에서 관측된 상한값이다. 구글 스스로 이 효율 이득이 장편 영상에서 특히 두드러진다고 적었다는 사실이, 짧은 영상에서는 격차가 작아진다는 조건을 함께 알려준다.
짧은 영상에서는 이 기능이 별로 의미가 없다
효율 이득의 크기를 결정하는 변수는 모델이 아니라 영상 길이다. 구글은 10분짜리 하우투 가이드부터 90분 강의와 수 시간짜리 녹화까지의 장편 영상에서 이득이 특히 크다고 밝혔고, 정적 처리에서는 개발자가 높은 토큰 비용을 감수하거나 중요한 세부를 버리는 기법 가운데 하나를 골라야 했다고 적었다.
이 대목이 이번 발표에서 가장 실무적인 부분이다. 1 FPS 고정 처리에서 영상 길이는 토큰 수와 곧바로 비례한다. 2분짜리 광고를 분석할 때는 전부 보는 비용이 애초에 작아 절감할 여지도 작다. 반면 수 시간짜리 회의 녹화나 강의에서는 전부 보는 비용이 감당 불가에 가까워지고, 그래서 그동안의 해법이 프레임을 성기게 뽑거나 자막만 넣는 식의 정보 손실을 전제로 한 우회였다. 에이전틱 처리는 그 선택지를 하나 더 늘린다.
구글이 든 네 가지 용례도 전부 길이와 정밀도가 동시에 걸린 작업이다. 1 FPS에서 놓치기 쉬운 순간적 상태 변화와 컷 경계를 잡아내는 초 단위 순간 검색, 수 시간 영상에서 수백만 토큰을 쓰지 않고 복잡한 질의에 답하는 바늘찾기 검색, 관심 구간만 더 높은 FPS로 다시 샘플링해 빠른 움직임과 미세한 시각 결함을 살피는 이상 탐지, 반복 동작과 개별 객체를 시간축에서 정확히 추적하는 계수다. 네 가지 모두 전체를 균일하게 보는 방식과 상극인 문제다.
지금 쓸 수 있는 곳과 예고 단계인 곳이 다르다
사용 가능 범위는 개발자 표면부터 열렸다. 구글은 이 기능이 구글 AI 스튜디오의 제미나이 API와 제미나이 엔터프라이즈 에이전트 플랫폼에서 오늘부터 영상 업로드와 유튜브 영상 모두에 대해 사용 가능하다고 밝혔다. 적용 방법은 API 설정에서 processing 값을 agentic으로 지정하는 것이고, 추가 기능 요금 없이 표준 제미나이 API 토큰 요금이 적용된다.
소비자 표면은 예고 단계다. 구글은 제미나이 앱의 Flash와 Flash-Lite 모델 전체 사용자에게 곧 확대하겠다고 했고, 앞으로 몇 달 안에 유튜브 시청 페이지의 'Ask YouTube' 기능도 이 방식으로 구동해 화면 내용에 근거한 더 나은 답변을 제공하겠다고 밝혔다.
이 순서를 뒤집어 읽으면 구글의 계산이 보인다. 유튜브 시청 페이지의 질의응답은 사용자 한 명당 한 번 물어도 전체로는 막대한 영상 처리량이 되는 기능이다. 영상 전체를 1 FPS로 삼키는 구조로는 이 규모를 감당하기 어렵고, 필요한 구간만 골라 보는 구조라야 단가가 맞는다. 구글이 이 기능을 Flash와 Flash-Lite 계열에 먼저 얹은 것도 같은 방향의 선택이다. 최상위 모델의 품질을 끌어올리는 발표가 아니라, 대량 처리 구간의 단가를 낮추는 발표다.
품질 우위 주장은 3.7 Flash에 걸려 있다. 구글은 이득이 지원 대상 세 모델 전체에 걸치지만 에이전틱 이해를 켠 제미나이 3.7 Flash가 전반적으로 가장 좋은 품질과 함께 품질 대비 비용 효율의 최적 조합을 제공하며, 시험한 모델들 가운데 영상 이해의 정확도 대 비용 파레토 프런티어에 위치한다고 적었다.
국내 팀이 지금 확인할 것과 발표문이 답하지 않은 것
한국 팀이 이번 발표를 검증하는 가장 빠른 경로는 자사 영상 한 편을 두 설정으로 각각 돌려 보는 것이다. 같은 질의를 정적 처리와 에이전틱 처리로 나눠 실행하고 소비 토큰과 응답 정확도를 직접 비교하면, 최대 88%라는 상한값이 자기 영상에서 몇 퍼센트로 나타나는지 바로 확인된다. 회의 녹화, 교육 강의, CCTV 검토, 방송 클립 검색처럼 길고 정보 밀도가 고르지 않은 영상이 이 비교에서 가장 큰 차이를 낼 후보다.
발표문이 답하지 않은 항목도 분명하다. 구글은 장편 영상 이해 벤치마크 LongVideoBench에서 제미나이 3.7 Flash의 에이전틱 적용 전후를 비교해 보여 주겠다고 했으나, 글 본문에는 벤치마크별 점수표가 아니라 최대 88%와 최대 66%와 최대 7%라는 요약 수치만 제시됐다. 어떤 벤치마크에서 각각 몇 퍼센트였는지, 절감폭과 정확도 향상이 동시에 나타나는지 아니면 과제에 따라 갈리는지는 공개된 요약만으로는 확정할 수 없다. 지연 시간 역시 발표문에 없다. 여러 번 되감아 보는 루프는 토큰을 줄이는 대신 응답 시간을 늘릴 수 있는 구조이며, 실시간에 가까운 처리가 필요한 서비스라면 이 항목을 직접 재야 한다.
한국어 영상에 대한 조건도 공백이다. 에이전틱 처리는 프레임뿐 아니라 오디오와 자막을 골라 쓰는 구조이므로, 자막 품질과 음성 인식 정확도가 결과를 좌우한다. 한국어 자막이 자동 생성인지 사람이 단 것인지, 화자가 여럿인지에 따라 같은 기능이 다른 성능을 낼 여지가 여기에 있다. 구글이 공개한 수치는 이 변수를 구분하지 않는다.
출처: Google, 'Introducing agentic video understanding with Gemini'(2026년 9월 1일), https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/

AI·테크 이슈,
가장 깊게
단순 소식을 넘어, 맥락과 구조까지 파고듭니다
AGI Soon As Possible · asapai.co.kr