
Googleによると、Geminiの新しいエージェント的ビデオ理解は、ビデオを1つの固定レートでサンプリングするのではなく、フレーム、音声、トランスクリプトを動的に検索できるという。これにより、AI ビデオ分析の効率が向上する可能性がありますが、ベンダーのベンチマークでは、編集が依存する瞬間をモデルが見つけたかどうかはわかりません。有用な監査は、グラウンドトゥルースのイベントセットを隠し、静的モードとエージェントモードで同一の質問を実行し、トークンだけでなく間違いも評価します。
検証済みの動画結果を APOB ストーリーボード概要に変換する
Google の 2026 年 9 月 1 日の発表では、サポートされている Gemini モデルについて、トークンが最大 88% 削減され、分析コストが最大 66% 削減され、精度が最大 7% 向上するというベンチマークの改善が報告されています。これらは Google の「最大」の結果であり、APOB の結果ではなく、映像の節約が保証されるものでもありません。以下のプロトコルは、見出しを繰り返す代わりに、日付付きのファイル固有の領収書を生成します。
これをビデオ コンテンツ分析の回帰テストとして扱います。 1 つの制御ファイル上の 2 つの処理モードを比較します。 Gemini を他のすべてのモデルと比較したり、あらゆるジャンルへの適合性を証明したりするものではありません。
グラウンドトゥルースイベントセットを植える
自分が所有する 20 分のビデオを作成します。自分の作品を表現するのに十分普通であり、正確にスコアを付けるのに十分な構造になっている必要があります。両方の実行が完了するまで、オペレーターに対して応答キーを非表示にします。
モーメント検索
4 つの簡単な状態変化を植え付けます。ライトの色が切り替わり、ラベルがカメラに向かって回転し、タイマーがゼロに達し、手が 2 つのオブジェクトを交換します。各イベントの最初と最後のフレームを記録します。少なくとも 1 つは 1 秒未満継続する必要があるため、固定レートのサンプリングは大きな課題に直面しています。
証拠ウィンドウが重ならないように、イベントを十分に離して配置します。これにより、検索精度をスコア化し、大まかな回答に適切な瞬間が偶然に含まれる場合を特定することが可能になります。
アクション数
テーブルの上にカップを 9 回置くなど、間隔を制御して目に見える動作を繰り返します。 2 つの素早い繰り返しと、完了しないニアアクション 1 つを含めます。回答キーは、分析を開始する前に何が重要かを定義する必要があります。
タイムコードを使用して手動集計を記録します。著者の記憶ではなく集計が、AI ビデオ アナライザーのスコア付けの根拠となる真実です。
音声のみの事実
関連するオブジェクトが画面外にあるときに 1 つの事実を話します: The blue case belongs to order 418. 後で画面上のトランスクリプト トラップに別の番号を入力します。これは、システムがオーディオ、トランスクリプト、およびビジュアルコンテキストを適切に使用しているかどうかをテストします。
異常ウィンドウ
短い異常を 1 つ挿入します。製品ラベルが 8 フレーム反転するか、一致するカット間でプロップが移動します。そのタイムコードと視覚的な境界を記録します。ファイル名に手がかりを含めないでください。
イベント ID | タイプ | 真実 | 開始 | 終了 | おとり/ニアミス |
|---|---|---|---|---|---|
E01 | モーメント | 光が琥珀色から青に変化します | ___ | ___ | リフレクションのみ |
E02 | カウント | 9 件の完了したプレースメント | ___ | ___ | 1 つの不完全な動き |
E03 | 音声のみ | オーダー 418 | ___ | ___ | トランスクリプトは 481 以降を示します |
E04 | 異常 | ラベルが反転しました | ___ | ___ | 通常の回転 |
マニフェストを個別に保存し、ビデオと応答キーの両方をハッシュします。オペレーターはビデオとクエリシートのみを受け取ります。
ソースマスター、アップロードコピー、トランスクリプト、およびイベントシートを安定した識別子の下に保管します。サービスがプロキシを作成する場合は、後のタイムスタンプの違いがモデルに自動的に起因するのではなく、正しいファイルまで追跡できることに注意してください。
同じ 6 つの質問を 2 つの方法で尋ねる
同じ Gemini モデル、ファイル、アカウント、地域、温度、応答スキーマ、および質問を使用します。処理モードのみを変更します。 Google の エージェントに関するビデオ発表 では、エージェント処理について、何を検査するかを動的に決定すると説明しています。 開発者ガイドは、実行前に確認する構成ソースです。
静的ベースライン
ロックされた 6 つの質問を静的処理で実行します。モデル識別子、サンプリング構成、ファイル参照、プロンプト、応答、入出力トークン、コスト、待ち時間、および警告を記録します。間違った回答後にプロンプトを調整しないでください。
質問:
ライトが最初に青になるのは正確に何時ですか?
完全なカップ配置は何回発生しますか?
青いケースの注文番号は何ですか?
ラベルが反転されるのはどの時間枠ですか?
注文番号の答えを裏付ける証拠は何ですか?視覚、音声、トランスクリプト、または複数ですか?
どの答えが最も確実ではありませんか?またその理由は何ですか?
エージェントの実行
現在の API ドキュメントに従って、エージェント処理を有効にして繰り返します。インターフェイスが公開するときに、ツール呼び出しまたは検査されたウィンドウをキャプチャします。静的障害から派生したエージェント実行ヒントを提供しないでください。
両方のモードで同じアップロードまたはファイル URI ライフサイクルを使用します。一方の入力を再エンコードし、もう一方の入力を再エンコードしないと、タイムスタンプが変更され、Gemini ビデオ理解比較が無効になる可能性があります。
クエリロック
質問リストをハッシュし、同じ応答形式 (回答、タイムスタンプ/ウィンドウ、証拠モダリティ、信頼度、裏付け観察) を使用します。表現を変更すると動作が変わる可能性があり、比較が 2 つの異なるタスクに変わる可能性があります。
実行ログ
各リクエスト、レスポンス、トークン、コスト、レイテンシ、検査されたセグメント、エラー、再試行、日付を記録します。 Google は現在、エージェントによるビデオ理解が Gemini 3.7 Flash、3.6 Flash、および 3.5 Flash-Lite で利用できると言っています。家族を引用するのではなく、使用された正確なモデルを記録してください。
フィールド | 静的 | エージェント |
|---|---|---|
モデル/バージョン | ___ | ___ |
構成を処理しています | ___ | ___ |
クエリ ハッシュ | ___ | ___ |
入力/出力トークン | ___ | ___ |
費用 | ___ | ___ |
レイテンシ | ___ | ___ |
エラー/再試行 | ___ | ___ |
スコアの取得、カウント、およびコンテキスト
両方のレシートが凍結された後にのみ、回答キーを公開してください。 2 人の査読者が独立して採点します。間違った回答や意見の相違を公開する。単一の集計精度数値によって、どの編集決定が安全でないのかが隠蔽されます。
構成固有のエラーを解釈する場合は、最新の Gemini ビデオ理解ガイドを再確認してください。新しい実行を行わずに、モードまたはモデル間で結果を転送しないでください。
タイムスタンプの精度
返されたタイムスタンプとグラウンドトゥルースの開始/終了との差を測定します。スコアを付ける前に、正確なウィンドウ、許容可能なウィンドウ、およびミス ウィンドウを定義します。瞬間的な編集の場合、5 秒以内の回答は依然として使用できない可能性があります。
境界と検索の両方にスコアを付けます。応答により、正確な編集点が失われているにもかかわらず、正しいシーンが見つかる可能性があります。フレームレベルの決定が必要な編集者のために、その区別を保持してください。
計数精度
アクション数を比較し、ニアアクションが含まれているかどうかを検査します。絶対的なエラーとその説明を記録します。根拠がサポートされていない正しい数値については、まだレビューが必要です。
クロスモーダル証拠
注文番号が音声、トランスクリプト、または視覚的なおとりからのものであるかどうかを確認します。数値と引用されたモダリティが真実と一致する場合にのみ、回答に報酬を与えます。これにより、信頼性の高いトランスクリプトのトラップが暴露されます。
サポートされていない回答
時間枠やモダリティを追跡できない主張にはフラグを立ててください。自信を示す言葉は証拠に代わるものではありません。 AI ビデオ アナライザーには、瞬間を検証できないと言うことが許されるべきです。
質問 | 真実 | 静的結果 | エージェントの結果 | 静的スコア | エージェント スコア | 査読者メモ |
|---|---|---|---|---|---|---|
モーメント | ___ | ___ | ___ | ___ | ___ | ___ |
カウント | 9 | ___ | ___ | ___ | ___ | ___ |
音声ファクト | 418 | ___ | ___ | ___ | ___ | ___ |
異常 | ___ | ___ | ___ | ___ | ___ | ___ |
証拠 | ___ | ___ | ___ | ___ | ___ | ___ |
不確実性 | ___ | ___ | ___ | ___ | ___ | ___ |
Googleによれば、エージェント処理は1秒未満の検索、長時間のビデオ検索、異常検査、動的なFPSアクション分析を実行できるという。これらを結果としてではなく、テストする機能として扱います。
トークンだけでなく価格のミスもある
トークンと API のコストは簡単に合計できます。人間による修正や不適切な下流編集は、コストが高くなる可能性があります。未加工のビューと品質調整されたビューの両方を構築します。
トークンデルタ
実際の領収書を使用して (static tokens - agentic tokens) / static tokens を計算します。可能な場合は、入力と出力を個別にレポートします。 Google の最大 88% のベンチマークを結果として代用しないでください。
コストデルタ
記録されたモデルと地域に適用される現在の日付の価格を使用します。機能料金がある場合はそれを含めます。 Google の発表によると、現時点では、エージェントの理解では標準の Gemini API トークン料金が使用され、追加の機能料金はかかりません。公開する前にその記述を確認してください。
修正時間
査読者にすべての回答を検証してもらい、間違いを修正してもらいます。出来事の発見、要旨の書き直し、不確実性の文書化に費やした時間を記録します。監査に時間がかかる安価な対応は、運用コストが安くならない可能性があります。
編集リスクコスト
リスククラスを割り当てます。間違った要約文は元に戻せる可能性があります。唯一の正しいショットを削除する、コンプライアンス要求を承認する、または安全に関する決定をルーティングすることは、より大きな影響を与えます。チームに防御可能なコストモデルがない場合は、リスクを偽の通貨に変換しないでください。低/中/高と必要なレビュー担当者を使用します。
対策 | 静的 | エージェント | 違い |
|---|---|---|---|
合計トークン数 | ___ | ___ | ___% |
API コスト | ___ | ___ | ___% |
訂正議事録 | ___ | ___ | ___ |
偽陰性 | ___ | ___ | ___ |
誤検知 | ___ | ___ | ___ |
高リスクのミス | ___ | ___ | ___ |
品質調整コストは、API cost + reviewer time + documented remediation として表すことができます。価格設定やスタッフ配置が変更されたときに結果を再計算できるように、入力を表示しておきます。
安全な仕事のルートと人間によるレビュー
監査は勝者のバッジではなくルーティングで終了します。ファイル固有のエラーによって正当化されるレビューのレベルに各ユースケースをマッピングします。
オートメーションセーフ
大まかな章のリスト、B ロールの瞬間の候補、最初のパスのナビゲーション インデックスなど、誰もやり直すことを気にしない作業から始めます。機械は指示しているのであって、決定しているのではありません。提案の横にあるソースを開いたままにし、1 つのイベントを見逃しても何も消去されたり、承認されたり、公開されたりしないようにしてください。
スポットチェック
植え付けられたテストが許容範囲を超えた場合は、要約、カウント、検索結果、または編集メモの下書きをスポットチェック キューに入れることができます。レビュー担当者は、引用されたタイムコードを開き、周囲の秒数を監視し、メモを受け入れるか拒否します。日常の瞬間と困難な瞬間をサンプリングしてみましょう。来週は質問をローテーションします。それ以外の場合、チェックは静かに同じ簡単なシーンのテストになります。
人間が必要とする
一部の仕事は人間のままです。法的またはコンプライアンスの解釈、個人情報に敏感な決定、安全上のイベント、および元に戻せない削除には、元の映像と責任あるレビュー担当者が必要です。裏付けとなる証拠なしに到着した回答も同様です。このワークフローでは、Gemini 分析は APOB 機能ではありません。それは要旨に記載されるべき外部からの意見である。
再テストトリガー
20 分間の奇妙なテスト ビデオを保存してください。モデル、処理モード、価格、入力形式、クエリ スキーマ、またはソース タイプが変更された場合は、再度実行してください。新しいリリース ノートは回帰結果ではありません。古いファイルと隠された応答キーにより、午後には変化が測定可能になります。
ジョブ | ルート | 必要な証拠 | 人間による承認 |
|---|---|---|---|
章の大まかな提案 | パス後のオートメーションセーフ | タイムスタンプ候補 | サンプル レビュー |
モーメントの取得 | スポットチェック | 正確なウィンドウとフレーム | 編集者 |
アクション数 | 許容度によるスポットチェック/完全なレビュー | カウント定義 + ウィンドウ | 審査員 |
コンプライアンスまたはアイデンティティ | 人間が必要とする | ソースと専門家のレビュー | 資格のある所有者 |
元に戻せない編集 | 人間が必要とする | 編集の決定を確認しました | 編集者/プロデューサー |
検出結果がチェックされると、APOB AI ストーリーボード のシーン カード、APOB AI ビデオ エディター のソース ノート、または APOB AI ビデオ ジェネレーター の概要になることがあります。レシートとタイムコードを添付してください。未検証の答えを洗練されたクリエイティブツールに移しても、それがより安全になるわけではありません。
AI 分析によって実際のカットが行われる前に、所有している 1 つのビデオについて次の 6 つの質問をしてください。おそらくエージェント処理によりトークンが節約されるでしょう。もしかしたら8コマ逆転を見つけるかも知れません。もしかしたら何も変わらないかもしれない。 3 つとも、レシートが表示されたままの場合に役立つ結果です。
情報源

最初にこれに「いいね」してください。

クレジットカードは不要です















