Korean (South Korea)
Korean (South Korea)

AI 비디오 분석: Gemini 에이전틱 업데이트 감사

AI 비디오 분석: Gemini 에이전틱 업데이트 감사

AI 생성 타임코드 보고서와 비교하여 심은 이벤트를 확인하는 비디오 분석가

Google은 Gemini의 새로운 에이전트 비디오 이해 기능이 하나의 고정 속도로 비디오를 샘플링하는 대신 프레임, 오디오 및 스크립트를 동적으로 검색할 수 있다고 말합니다. 이를 통해 AI 비디오 분석을 더욱 효율적으로 만들 수 있지만 공급업체 벤치마크에서는 모델이 편집에 의존하는 순간을 찾는지 여부를 알려주지 않습니다. 유용한 감사는 실측 이벤트 세트를 숨기고, 정적 모드와 에이전트 모드에서 동일한 질문을 실행하고, 토큰뿐만 아니라 가격 오류도 표시합니다.

검증된 동영상 결과를 APOB 스토리보드 요약으로 전환

Google의 2026년 9월 1일 발표에서는 지원되는 Gemini 모델에 대해 최대 88% 더 적은 토큰, 최대 66% 더 낮은 분석 비용, 최대 7% 더 높은 정확도의 벤치마크 개선이 보고되었습니다. 이는 Google의 '최대' 결과이며 APOB 결과가 아니며 영상 비용 절감이 보장되지 않습니다. 아래 프로토콜은 헤드라인을 반복하는 대신 날짜가 지정된 파일별 영수증을 생성합니다.

이를 비디오 콘텐츠 분석 회귀 테스트로 간주합니다. 하나의 제어된 파일에 대한 두 가지 처리 모드를 비교합니다. Gemini를 다른 모든 모델과 비교하거나 모든 장르에 대한 적합성을 입증하지는 않습니다.

실측 이벤트 세트 설치

나만의 20분짜리 동영상을 만들어 보세요. 귀하의 작업을 표현할 수 있을 만큼 평범해야 하며, 정확한 점수를 매길 수 있을 만큼 구조화되어 있어야 합니다. 두 실행이 모두 완료될 때까지 운영자에게 답안을 숨깁니다.

순간 검색

네 가지 간단한 상태 변화를 심습니다. 조명의 색상이 바뀌고, 라벨이 카메라를 향해 회전하고, 타이머가 0에 도달하고, 손이 두 개체를 바꿉니다. 각 이벤트의 첫 번째 프레임과 마지막 프레임을 기록합니다. 적어도 하나는 1초 미만으로 지속되어야 하므로 고정 속도 샘플링은 실질적인 문제에 직면합니다.

증거 창이 겹치지 않도록 이벤트를 충분히 멀리 배치합니다. 이를 통해 검색 정밀도에 점수를 매기고 광범위한 답변에 우연히 적절한 순간이 포함된 시기를 식별할 수 있습니다.

작업 횟수

테이블 위에 컵을 9번 놓는 것과 같이 간격을 조절하면서 눈에 보이는 동작을 반복합니다. 두 번의 빠른 반복과 완료되지 않은 한 번의 근접 동작을 포함합니다. 답안은 분석이 시작되기 전에 무엇이 중요한지 정의해야 합니다.

타임코드를 사용하여 수동 집계를 기록합니다. 작성자의 기억이 아닌 집계는 AI 비디오 분석기가 채점하는 기준 진실입니다.

오디오 전용 사실

관련 개체가 화면 밖에 있는 동안 한 가지 사실을 말하세요. The blue case belongs to order 418. 나중에 화면 내 기록 트랩에 다른 숫자를 입력하세요. 이는 시스템이 오디오, 스크립트 및 시각적 컨텍스트를 적절하게 사용하는지 여부를 테스트합니다.

이상 창

짧은 예외 사항 하나를 삽입합니다. 제품 라벨이 8개 프레임 동안 반전되거나 소품이 일치하는 컷 사이를 이동합니다. 타임코드와 시각적 경계를 기록합니다. 파일 이름에 단서를 포함하지 마십시오.

이벤트 ID

유형

정답

시작

종료

미끼/거의 실패

E01

순간

조명이 호박색에서 파란색으로 변경됩니다.

___

___

반사만

E02

개수

9개의 완료된 게재위치

___

___

1개의 불완전한 이동

E03

오디오 전용

주문 418

___

___

대본에는 나중에 481이 표시됩니다.

E04

변칙

라벨이 반전됨

___

___

일반 회전

매니페스트를 별도로 저장하고 비디오와 답변 키를 모두 해시합니다. 교환원은 영상과 쿼리시트만 받습니다.

소스 마스터, 업로드 사본, 성적표, 이벤트 시트를 안정적인 식별자로 보관하세요. 서비스가 프록시를 생성하는 경우 나중에 타임스탬프 차이가 자동으로 모델에 귀속되지 않고 올바른 파일로 추적될 수 있다는 사실에 유의하세요.

동일한 6가지 질문을 두 가지 방법으로 물어보세요

동일한 Gemini 모델, 파일, 계정, 지역, 온도, 응답 스키마 및 질문을 사용하십시오. 처리 모드만 변경합니다. Google의 에이전트 동영상 발표에서는 에이전트 처리가 무엇을 검사할지 동적으로 결정하는 것으로 설명합니다. 실행 전 확인해야 할 구성 소스는 개발자 가이드입니다.

정적 기준선

정적 처리를 통해 6개의 잠긴 질문을 실행하세요. 모델 식별자, 샘플링 구성, 파일 참조, 프롬프트, 응답, 입력/출력 토큰, 비용, 대기 시간 및 모든 경고를 기록합니다. 잘못된 대답 후에 프롬프트를 조정하지 마십시오.

질문:

  1. 빛이 처음으로 파란색으로 변하는 정확한 시간은 언제입니까?

  2. 완전한 컵 배치는 몇 번이나 발생합니까?

  3. 파란색 케이스에는 어떤 주문 번호가 적혀 있나요?

  4. 어느 기간 동안 라벨이 반전됩니까?

  5. 주문 번호 답변을 뒷받침하는 증거(영상, 오디오, 녹취록 또는 둘 이상)는 무엇입니까?

  6. 가장 확실하지 않은 대답은 무엇이며, 그 이유는 무엇입니까?

에이전트 실행

현재 API 문서에 따라 활성화된 에이전트 처리를 반복합니다. 인터페이스에 표시되는 도구 호출 또는 검사된 창을 캡처합니다. 정적 실패에서 파생된 에이전트 실행 힌트를 제공하지 마십시오.

두 모드 모두에 동일한 업로드 또는 파일 URI 수명 주기를 사용합니다. 하나의 입력을 다시 인코딩하지만 다른 입력은 다시 인코딩하지 않으면 타임스탬프가 변경되어 Gemini 비디오 이해 비교가 유효하지 않게 될 수 있습니다.

쿼리 잠금

질문 목록을 해시하고 동일한 응답 형식(답변, 타임스탬프/창, 증거 양식, 신뢰도, 뒷받침 관찰)을 사용합니다. 문구 변경으로 인해 행동이 변경될 수 있으며 비교가 두 가지 다른 작업으로 전환됩니다.

로그 실행

각 요청, 응답, 토큰, 비용, 대기 시간, 검사된 세그먼트, 오류, 재시도 및 날짜를 기록합니다. Google은 현재 Gemini 3.7 Flash, 3.6 Flash 및 3.5 Flash-Lite에서 에이전트 비디오 이해가 가능하다고 말합니다. 가족을 인용하기보다는 사용된 정확한 모델을 기록하십시오.

필드

정적

에이전트

모델/버전

___

___

구성 처리 중

___

___

쿼리 해시

___

___

입력/출력 토큰

___

___

비용

___

___

지연 시간

___

___

오류/재시도

___

___

점수 검색, 계산 및 컨텍스트

두 영수증이 모두 동결된 후에만 답안을 공개하세요. 두 명의 검토자가 독립적으로 점수를 매깁니다. 잘못된 답변과 불일치를 게시합니다. 단일 집계 정확도 수치는 어떤 편집 결정이 안전하지 않은지 숨깁니다.

구성별 오류를 해석할 때 최신 Gemini 동영상 이해 가이드를 다시 확인하세요. 새로 실행하지 않고 모드나 모델 간에 결과를 전송하지 마십시오.

타임스탬프 정밀도

반환된 타임스탬프와 실제 시작/끝 사이의 차이를 측정합니다. 점수를 매기기 전에 정확한 창, 허용 가능한 창, 누락 창을 정의하세요. 순간 편집의 경우 5초 이내의 답변은 여전히 사용하지 못할 수 있습니다.

경계와 검색 모두에 점수를 매깁니다. 응답은 정확한 편집 지점을 놓친 채 올바른 장면을 찾을 수 있습니다. 프레임 수준 결정이 필요한 편집자를 위해 이러한 구별을 유지하십시오.

카운트 정확도

액션 횟수를 비교하고 근접 액션이 포함되었는지 검사합니다. 절대오차와 설명을 기록한다. 근거가 뒷받침되지 않는 정확한 숫자는 여전히 검토가 필요합니다.

교차 모달 증거

주문 번호가 오디오, 스크립트 또는 시각적 미끼에서 나온 것인지 확인하세요. 숫자와 인용 양식이 실제 사실과 일치하는 경우에만 답변에 보상을 제공합니다. 이는 자신감 있는 성적표 트랩을 노출시킵니다.

지원되지 않는 답변

특정 기간이나 양상을 추적할 수 없는 주장에 플래그를 지정하세요. 신뢰 문구는 증거를 대체하지 않습니다. AI 비디오 분석기는 순간을 확인할 수 없다고 말할 수 있어야 합니다.

질문

정답

정적 결과

에이전트 결과

정적 점수

에이전트 점수

검토자 메모

순간

___

___

___

___

___

___

개수

9

___

___

___

___

___

오디오 사실

418

___

___

___

___

___

변칙

___

___

___

___

___

___

증거

___

___

___

___

___

___

불확실성

___

___

___

___

___

___

Google은 에이전트 처리가 1초 미만의 검색, 긴 비디오 검색, 이상 검사 및 동적 FPS 동작 분석을 수행할 수 있다고 말합니다. 이를 결과가 아닌 테스트할 기능으로 취급하십시오.

토큰뿐만 아니라 가격도 그리워요

토큰과 API 비용을 쉽게 합산할 수 있습니다. 사람이 수정하고 잘못된 다운스트림 편집을 수행하면 비용이 더 많이 들 수 있습니다. 원시 뷰와 품질 조정 뷰를 모두 구축하세요.

토큰 델타

실제 영수증으로 (static tokens - agentic tokens) / static tokens을 계산합니다. 가능한 경우 입력과 출력을 별도로 보고합니다. 결과를 Google의 최대 88% 벤치마크로 대체하지 마세요.

비용 델타

기록된 모델 및 지역에 적용되는 현재 날짜의 가격을 사용하세요. 해당되는 경우 기능 수수료를 포함합니다. Google의 발표에 따르면 현재 Agentic Understanding은 추가 기능 비용 없이 표준 Gemini API 토큰 가격을 사용한다고 나와 있습니다. 출판하기 전에 해당 진술을 확인하십시오.

교정 시간

리뷰어에게 모든 답변을 확인하고 잘못된 부분을 수정하도록 요청하세요. 이벤트를 찾고, 개요를 다시 작성하고, 불확실성을 문서화하는 데 소요된 시간을 기록하세요. 감사하는 데 시간이 오래 걸리는 저렴한 응답은 운영상 더 저렴하지 않을 수 있습니다.

편집 위험 비용

위험 등급을 지정합니다. 잘못된 요약 문장은 되돌릴 수 있습니다. 올바른 샷만 삭제하거나 규정 준수 주장을 승인하거나 안전 결정을 전달하는 것이 더 큰 영향을 미칩니다. 팀에 방어할 수 있는 비용 모델이 없다면 위험을 가짜 통화로 전환하지 마십시오. 낮음/중간/높음과 필수 검토자를 사용하세요.

측정

정적

에이전트

차이

총 토큰

___

___

___%

API 비용

___

___

___%

수정 분

___

___

___

거짓 부정

___

___

___

오탐지

___

___

___

위험도가 높은 실수

___

___

___

품질 조정 비용은 API cost + reviewer time + documented remediation으로 표현될 수 있습니다. 가격이나 직원 배치가 변경될 때 결과를 다시 계산할 수 있도록 입력 내용을 눈에 띄게 유지하세요.

안전한 작업 라우팅 및 사람의 검토

감사는 우승자 배지가 아닌 라우팅으로 종료됩니다. 각 사용 사례를 파일별 오류로 정당화되는 검토 수준에 매핑하세요.

자동화 안전

대략적인 챕터 목록, 후보 B-롤 순간 또는 첫 번째 통과 탐색 색인 등 아무도 다시 실행하지 않아도 되는 작업부터 시작하세요. 기계는 결정하는 것이 아니라 가리키고 있습니다. 제안 옆에 소스를 열어두고 놓친 이벤트로 인해 아무것도 삭제, 승인 또는 게시되지 않는지 확인하세요.

즉석 점검

심어진 테스트가 허용 오차를 통과하면 요약, 개수, 검색 결과 또는 초안 편집 메모를 즉석 확인 대기열에 허용합니다. 검토자는 인용된 타임코드를 열고 주변 초를 관찰한 후 메모를 수락하거나 거부합니다. 평범한 순간과 힘든 순간을 샘플링해 보세요. 다음 주에는 질문을 번갈아 가며 진행하세요. 그렇지 않으면 검사는 조용히 동일한 쉬운 장면을 테스트하게 됩니다.

인간이 요구하는

일부 직업은 인간으로 남아 있습니다. 법적 또는 규정 준수 해석, 신원에 민감한 결정, 안전 문제 및 되돌릴 수 없는 삭제에는 원본 영상과 책임 있는 검토자가 필요합니다. 뒷받침하는 증거 없이 도착한 답변도 마찬가지입니다. 이 워크플로우에서 Gemini 분석은 APOB 기능이 아닙니다. 그것은 브리핑에서 자리를 잡아야 하는 외부 입력입니다.

트리거 재테스트

20분짜리 이상한 테스트 비디오를 보관하세요. 모델, 처리 모드, 가격, 입력 형식, 쿼리 스키마 또는 소스 유형이 변경되면 다시 실행하세요. 새 릴리스 노트는 회귀 결과가 아닙니다. 이전 파일과 숨겨진 답안을 사용하면 오후에 변경 사항을 측정할 수 있습니다.

직업

경로

필수 증거

사람이 승인

대략적인 장 제안

통과 후 자동화 안전

후보 타임스탬프

샘플 리뷰

순간 검색

즉시 확인

정확한 창 및 프레임

편집자

작업 횟수

공차별 즉각 확인/전체 검토

카운트 정의 + 창

검토자

규정 준수 또는 ID

사람이 필요함

소스 및 전문가 리뷰

적격 소유자

되돌릴 수 없는 편집

사람이 필요함

검증된 수정 결정

편집자/제작자

결과가 확인되면 APOB AI 스토리보드의 장면 카드, APOB AI Video Editor의 소스 노트 또는 APOB AI Video Generator에 대한 요약이 될 수 있습니다. 영수증과 타임코드를 첨부하세요. 확인되지 않은 답변을 세련된 창의적 도구로 옮기는 것이 더 안전하지는 않습니다.

AI 분석이 실제 컷을 구동하기 전에 소유한 동영상 하나에 대해 다음 6가지 질문을 물어보세요. 어쩌면 에이전트 처리로 토큰이 절약될 수도 있습니다. 어쩌면 8프레임 반전을 찾을 수도 있습니다. 어쩌면 아무것도 바뀌지 않을 수도 있습니다. 영수증이 계속 표시되면 세 가지 모두 유용한 결과입니다.

출처

이 글에 가장 먼저 좋아요를 눌러보세요.

더 많은 블로그 둘러보기

더 많은 블로그 둘러보기

수직 비디오 오프너를 위한 모션 디자이너 타이밍 판독 가능 키네틱 타이포그래피
키네틱 타이포그래피: 읽기 쉬운 AI 비디오 오프너 구축
일치하는 24 30 60 및 120 FPS 모션 프레임을 검사하는 비디오 편집기
FPS 변경: Runway의 120 FPS 업데이트 테스트
5장의 카페 대화를 위해 카메라 축을 매핑하는 영화 제작진
AI 비디오의 180도 규칙: 5샷 장면 수정
비디오 이미지 및 오디오 소스로 구축된 브라우저 비디오 타임라인을 감사하는 편집자
브라우저 비디오 편집기: Firefly의 통합 작업 공간 감사
20개의 SKU를 전달하기 전에 다양한 제품 카탈로그를 검토하는 전자상거래 팀
PhotoRoom 대안: 20-SKU 핸드오프 감사
눈에 보이는 증거 순간과 비교하여 설명 스토리보드를 확인하는 동영상 제작자
설명 비디오 예: 스타일이 아닌 증거에 점수 매기기
프로듀서가 진행 큐를 확인하는 동안 한 제품을 소개하는 라이브 쇼핑 호스트
라이브 판매 스크립트: 제품 주장을 검증할 수 있는 진행표 만들기
비용, 지연 시간, 품질을 기준으로 영상 작업 경로를 정하는 크리에이티브 엔지니어
AI 라우팅: Runway의 비용·품질 전환 감사하기
세 가지 모델 출력에서 ​​동일한 AI 캐릭터를 비교하는 리뷰어
Hedra 대안: 여러 모델에서 한 캐릭터 검증하기
촬영 전 전환 스토리보드 카드 6장을 정리하는 감독
영상 전환 아이디어: 여섯 가지 리빌 모션 스토리보드 만들기
원치 않는 개체와 보호된 세부 정보에 대해 일치하는 비디오 테스트를 비교하는 편집자
네거티브 프롬프트: Veo 3.1 실패 제어 테스트
트렌드 발견을 재사용 가능한 AI 인플루언서 워크플로우와 비교하는 프로듀서
Revid AI 대안: 트렌드 탐색과 제작 분리하기
수직 비디오 오프너를 위한 모션 디자이너 타이밍 판독 가능 키네틱 타이포그래피
키네틱 타이포그래피: 읽기 쉬운 AI 비디오 오프너 구축
일치하는 24 30 60 및 120 FPS 모션 프레임을 검사하는 비디오 편집기
FPS 변경: Runway의 120 FPS 업데이트 테스트
5장의 카페 대화를 위해 카메라 축을 매핑하는 영화 제작진
AI 비디오의 180도 규칙: 5샷 장면 수정
비디오 이미지 및 오디오 소스로 구축된 브라우저 비디오 타임라인을 감사하는 편집자
브라우저 비디오 편집기: Firefly의 통합 작업 공간 감사
20개의 SKU를 전달하기 전에 다양한 제품 카탈로그를 검토하는 전자상거래 팀
PhotoRoom 대안: 20-SKU 핸드오프 감사
눈에 보이는 증거 순간과 비교하여 설명 스토리보드를 확인하는 동영상 제작자
설명 비디오 예: 스타일이 아닌 증거에 점수 매기기
프로듀서가 진행 큐를 확인하는 동안 한 제품을 소개하는 라이브 쇼핑 호스트
라이브 판매 스크립트: 제품 주장을 검증할 수 있는 진행표 만들기
비용, 지연 시간, 품질을 기준으로 영상 작업 경로를 정하는 크리에이티브 엔지니어
AI 라우팅: Runway의 비용·품질 전환 감사하기

몽환적인 비전을

APOB로 만들어보세요

몽환적인 비전을

APOB로 만들어보세요

신용카드가 필요하지 않습니다

링크

기능

도구

연락처 정보

support@apob.ai

저작권 2024 ATOMSTOBITS LABS INC. 모든 권리 보유.