Analyse vidéo par IA : auditez la mise à jour agentique de Gemini

Analyse vidéo par IA : auditez la mise à jour agentique de Gemini

Un analyste vidéo vérifie les événements implantés par rapport à un rapport de timecode généré par l'IA

Google affirme que la nouvelle compréhension vidéo agentique de Gemini peut rechercher dynamiquement des images, de l'audio et des transcriptions au lieu d'échantillonner une vidéo à une fréquence fixe. Cela pourrait rendre l'analyse vidéo IA plus efficace, mais les références des fournisseurs ne vous disent pas si un modèle trouve le moment dont dépend votre montage. Un audit utile masque un ensemble d'événements de vérité sur le terrain, exécute des questions identiques en modes statique et agent, et évalue les erreurs ainsi que les jetons.

Transformez les résultats vidéo vérifiés en un résumé de storyboard APOB

L'annonce de Google du 1er septembre 2026 fait état d'améliorations de référence allant jusqu'à 88 % de jetons en moins, jusqu'à 66 % de coûts d'analyse en moins et jusqu'à 7 % de précision en plus pour les modèles Gemini pris en charge. Il s’agit des résultats « jusqu’à » de Google, et non des résultats APOB et il ne s’agit pas d’économies garanties sur vos images. Le protocole ci-dessous produit un reçu daté et spécifique au fichier au lieu de répéter le titre.

Traitez cela comme un test de régression d'analyse de contenu vidéo. Il compare deux modes de traitement sur un fichier contrôlé ; il ne compare pas Gemini à tous les autres modèles et ne prouve pas qu'il convient à tous les genres.

Planter un ensemble d'événements de vérité terrain

Créez une vidéo de 20 minutes que vous possédez. Il doit être suffisamment ordinaire pour représenter votre travail et suffisamment structuré pour marquer exactement. Cachez le corrigé à l’opérateur jusqu’à ce que les deux exécutions soient terminées.

Récupération d'instants

Plantez quatre brefs changements d'état : une lumière change de couleur, une étiquette tourne vers la caméra, une minuterie atteint zéro et une main échange deux objets. Enregistrez la première et la dernière image de chaque événement. Au moins un d'entre eux devrait durer moins d'une seconde, l'échantillonnage à taux fixe constitue donc un véritable défi.

Placez les événements suffisamment loin les uns des autres pour que leurs fenêtres de preuves ne se chevauchent pas. Cela permet d’évaluer la précision de la récupération et d’identifier quand une réponse large inclut le bon moment par accident.

Nombre d'actions

Répétez une action visible avec un espacement contrôlé, comme placer neuf fois une tasse sur une table. Incluez deux répétitions rapides et une quasi-action qui ne se termine pas. Le corrigé doit définir ce qui compte avant le début de l’analyse.

Enregistrez un décompte manuel avec des codes temporels. Le décompte, et non la mémoire de l’auteur, est la vérité terrain par rapport à laquelle l’analyseur vidéo IA est évalué.

Fait audio uniquement

Dites un fait pendant que l'objet concerné est hors écran : The blue case belongs to order 418. Mettez un numéro différent dans une trappe de transcription à l'écran plus tard. Cela teste si le système utilise le contexte audio, de transcription et visuel de manière appropriée.

Fenêtre d'anomalie

Insérez une courte anomalie : une étiquette de produit s'inverse pendant huit images ou un accessoire se déplace entre des coupes autrement correspondantes. Enregistrez son timecode et sa limite visuelle. N'incluez aucun indice dans le nom du fichier.

ID d'événement

Type

Vérité terrain

Démarrer

Fin

Leurre/quasi-accident

E01

Moment

La lumière passe de l'orange au bleu

___

___

Réflexion uniquement

E02

Nombre

9 emplacements terminés

___

___

1 mouvement incomplet

E03

Audio uniquement

Commande 418

___

___

La transcription montre 481 plus tard

E04

Anomalie

Étiquette inversée

___

___

Rotation normale

Stockez le manifeste séparément et hachez la vidéo et le corrigé. L'opérateur reçoit uniquement la vidéo et la fiche de requête.

Conservez le maître source, la copie téléchargée, la transcription et la feuille d'événement sous des identifiants stables. Si le service crée un proxy, notez ce fait afin que les différences d'horodatage ultérieures puissent être retracées au fichier correct plutôt que attribuées automatiquement au modèle.

Posez les six mêmes questions de deux manières

Utilisez le même modèle, fichier, compte, région, température, schéma de réponse et questions Gemini. Changez uniquement le mode de traitement. L'annonce vidéo agentique de Google décrit le traitement agentique comme la décision dynamique des éléments à inspecter ; le guide du développeur est la source de configuration à vérifier avant de l'exécuter.

Ligne de base statique

Exécutez les six questions verrouillées avec un traitement statique. Enregistrez l'identifiant du modèle, la configuration d'échantillonnage, la référence du fichier, l'invite, la réponse, les jetons d'entrée/sortie, le coût, la latence et tout avertissement. N'ajustez pas l'invite après une mauvaise réponse.

Questions :

  1. À quel moment précis la lumière devient-elle bleue pour la première fois ?

  2. Combien de placements complets de cupules ont lieu ?

  3. Quel numéro de commande est indiqué pour le boîtier bleu ?

  4. Pendant quelle fenêtre temporelle l’étiquette est-elle inversée ?

  5. Quelles preuves soutiennent la réponse au numéro de commande : visuelle, audio, transcription ou plusieurs ?

  6. Quelle réponse est la moins certaine, et pourquoi ?

Exécution agent

Répétez l’opération avec le traitement agent activé conformément à la documentation actuelle de l’API. Capturez les appels d’outils ou les fenêtres inspectées lorsque l’interface les expose. Ne donnez pas d'indices d'exécution agent dérivés de l'échec statique.

Utilisez le même cycle de vie d’URI de téléchargement ou de fichier pour les deux modes. Le réencodage d'une entrée mais pas de l'autre pourrait modifier les horodatages et rendre la comparaison de compréhension vidéo Gemini invalide.

Verrouillage des requêtes

Hachez la liste de questions et utilisez le même format de réponse : réponse, horodatage/fenêtre, modalité de preuve, confiance et observation à l'appui. Un changement de formulation peut modifier le comportement et transformerait la comparaison en deux tâches différentes.

Journal d'exécution

Enregistrez chaque demande, réponse, jetons, coût, latence, segments inspectés, erreurs, tentatives et date. Google indique actuellement que la compréhension vidéo agentique est disponible sur Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite ; notez le modèle exact utilisé plutôt que de citer la famille.

Champ

Statique

Agent

Modèle/version

___

___

Configuration de traitement

___

___

Hachage de requête

___

___

Jetons d'entrée/sortie

___

___

Coût

___

___

Latence

___

___

Erreurs/nouvelles tentatives

___

___

Récupération, comptage et contexte des scores

Révélez le corrigé seulement une fois les deux reçus gelés. Deux évaluateurs notent indépendamment. Publier des mauvaises réponses et des désaccords ; un seul numéro de précision global masque les décisions de révision qui sont dangereuses.

Vérifiez à nouveau le guide de compréhension vidéo Gemini actuel lors de l'interprétation des échecs spécifiques à la configuration ; ne transférez pas de résultat entre modes ou modèles sans une nouvelle exécution.

Précision de l'horodatage

Mesurez la différence entre l'horodatage renvoyé et le début/la fin de la vérité terrain. Définissez les fenêtres exactes, acceptables et manquées avant de noter. Pour une modification en une fraction de seconde, une réponse dans les cinq secondes peut toujours être inutilisable.

Marquez à la fois la limite et la récupération. Une réponse peut localiser la scène correcte tout en manquant le point de montage exact. Préservez cette distinction pour les éditeurs qui ont besoin de décisions au niveau du cadre.

Précision du comptage

Comparez le nombre d’actions et vérifiez si la quasi-action a été incluse. Enregistrez l’erreur absolue et l’explication. Un nombre correct avec un raisonnement non étayé doit encore être révisé.

Preuve multimodale

Vérifiez si le numéro de commande provient de l’audio, de la transcription ou du leurre visuel. Récompensez une réponse uniquement lorsque le nombre et la modalité citée correspondent à la vérité terrain. Cela expose des pièges de transcription confiants.

Réponse non prise en charge

Signalez toute affirmation qui ne peut être attribuée à une fenêtre temporelle ou à une modalité. La formulation de la confiance ne remplace pas la preuve. Un analyseur vidéo IA devrait être autorisé à dire qu’il ne peut pas vérifier un instant.

Question

Vérité terrain

Résultat statique

Résultat agent

Score statique

Score agent

Note du réviseur

Moment

___

___

___

___

___

___

Nombre

9

___

___

___

___

___

Fait audio

418

___

___

___

___

___

Anomalie

___

___

___

___

___

___

Preuve

___

___

___

___

___

___

Incertitude

___

___

___

___

___

___

Google affirme que le traitement agent peut effectuer une récupération en moins d'une seconde, une recherche de vidéos longues, une inspection des anomalies et une analyse des actions FPS dynamiques. Traitez-les comme des capacités à tester, et non comme votre résultat.

Le prix manque, pas seulement les jetons

Le coût des jetons et de l’API est facile à totaliser. Une correction humaine et une mauvaise modification en aval peuvent coûter plus cher. Créez à la fois une vue brute et une vue ajustée en qualité.

Delta du jeton

Calculez (static tokens - agentic tokens) / static tokens avec les reçus réels. Signalez les entrées et les sorties séparément lorsqu’elles sont disponibles. Ne remplacez pas votre résultat par la référence allant jusqu'à 88 % de Google.

Delta des coûts

Utilisez le prix actuel et daté applicable au modèle et à la région enregistrés. Incluez les frais de fonctionnalité, le cas échéant ; L’annonce de Google indique actuellement que la compréhension agentique utilise la tarification standard des jetons API Gemini sans frais de fonctionnalités supplémentaires. Vérifiez cette déclaration avant la publication.

Temps de correction

Demandez à un évaluateur de vérifier chaque réponse et de corriger les erreurs. Enregistrez les minutes passées à trouver l’événement, à réécrire le brief et à documenter l’incertitude. Une réponse bon marché dont l’audit prend plus de temps n’est peut-être pas moins coûteuse sur le plan opérationnel.

Coût du risque de modification

Attribuez une classe de risque. Une phrase récapitulative erronée peut être réversible ; supprimer le seul plan correct, approuver une affirmation de conformité ou acheminer une décision de sécurité a un impact plus important. Ne convertissez pas le risque en fausse monnaie si l’équipe ne dispose pas d’un modèle de coûts défendable. Utilisez faible/moyen/élevé plus un réviseur requis.

Mesure

Statique

Agent

Différence

Total de jetons

___

___

___%

Coût de l'API

___

___

___%

Minutes de correction

___

___

___

Faux négatifs

___

___

___

Faux positifs

___

___

___

Échecs à haut risque

___

___

___

Le coût ajusté en fonction de la qualité peut être exprimé sous la forme API cost + reviewer time + documented remediation. Gardez les entrées visibles afin que le résultat puisse être recalculé en cas de changement de prix ou de personnel.

Acheminez les travaux en toute sécurité et l'examen humain

L'audit se termine par un routage et non par un badge de gagnant. Mappez chaque cas d'utilisation au niveau d'examen justifié par les erreurs spécifiques à votre fichier.

Sûr pour l'automatisation

Commencez par un travail que personne ne craint de refaire : une liste approximative de chapitres, des moments candidats du rouleau B ou un index de navigation de premier passage. La machine pointe, elle ne décide pas. Gardez la source ouverte à côté de la suggestion et assurez-vous qu’un événement manqué n’effacera, n’approuvera ou ne publiera rien.

Vérification ponctuelle

Si le test implanté dépasse votre tolérance, autorisez les résumés, les décomptes, les résultats de recherche ou les brouillons de notes de modification dans une file d'attente de vérification ponctuelle. Un critique ouvre le timecode cité, regarde les secondes environnantes et accepte ou rejette la note. Goûtez à un moment ordinaire et à un moment difficile. La semaine prochaine, alternez les questions ; sinon, le contrôle devient tranquillement un test de la même scène facile.

Requis par l'homme

Certains métiers restent humains. L'interprétation juridique ou de conformité, les décisions sensibles à l'identité, les événements de sécurité et les suppressions irréversibles nécessitent les images originales et un réviseur responsable. Il en va de même pour toute réponse arrivant sans preuves à l’appui. Dans ce flux de travail, l'analyse Gemini n'est pas une fonctionnalité APOB ; c'est un apport extérieur qui doit mériter sa place dans le mémoire.

Déclencheur de nouveau test

Gardez quelques petites vidéos de test de 20 minutes. Réexécutez-le lorsque le modèle, le mode de traitement, le prix, le format d'entrée, le schéma de requête ou le type de source changent. Une nouvelle note de version n'est pas un résultat de régression. L'ancien fichier et le corrigé caché rendent le changement mesurable en un après-midi.

Tâche

Itinéraire

Preuves requises

Approbation humaine

Suggestions approximatives de chapitres

Automation sécurisée après réussite

Horodatage des candidats

Exemple d'examen

Récupération de moments

Vérification ponctuelle

Fenêtre et cadre exacts

Éditeur

Nombre d'actions

Vérification ponctuelle/examen complet par tolérance

Définition du comptage + fenêtre

Réviseur

Conformité ou identité

Requis par l'homme

Source et avis spécialisé

Propriétaire qualifié

Modification irréversible

Requis par l'homme

Décision de modification vérifiée

Éditeur/producteur

Une fois qu'un résultat est vérifié, il peut devenir une fiche de scène dans le APOB AI Storyboard, une note source dans l'APOB AI Video Editor ou un brief pour le APOB AI Video Generator. Joignez le reçu et le timecode. Déplacer une réponse non vérifiée dans un outil de création raffiné ne la rend pas plus sûre.

Avant qu’une analyse de l’IA ne conduise à une véritable coupe, posez ces six questions sur une vidéo que vous possédez. Peut-être que le traitement agent enregistre les jetons. Peut-être qu'il trouve l'inversion de huit images. Peut-être que ça ne change rien. Ces trois résultats sont utiles lorsque les reçus restent visibles.

Sources

Soyez le premier à aimer ceci.

Découvrez d'autres blogs

Découvrez d'autres blogs

Typographie cinétique lisible de synchronisation de Motion Designer pour un ouvre-vidéo vertical
Typographie cinétique : créez un ouvre-vidéo IA lisible
L'éditeur vidéo inspecte les images de mouvement correspondantes à 24, 30, 60 et 120 FPS
Changer le FPS : testez la mise à jour 120 FPS de Runway
L'équipe de tournage cartographie l'axe de la caméra pour une conversation de cinq plans dans un café
Règle des 180 degrés pour la vidéo AI : corriger une scène à cinq plans
Éditeur auditant une chronologie vidéo de navigateur construite à partir de sources d'images vidéo et d'audio
Éditeur vidéo sur navigateur : auditez l'espace de travail unifié de Firefly
L'équipe de commerce électronique examine un catalogue de produits varié avant un transfert de vingt SKU
Alternatives PhotoRoom : auditer un transfert de 20 SKU
Producteur vidéo vérifiant un storyboard explicatif par rapport à des moments de preuve visibles
Exemples de vidéos explicatives : notez la preuve, pas le style
Présentateur de vente en direct montrant un produit pendant qu'un producteur vérifie les indications de l'émission
Script de vente en direct : créez un déroulé aux affirmations vérifiables
Ingénieur créatif acheminant une tâche vidéo en fonction du coût, de la latence et de la qualité
Routage IA : auditez le compromis coût-qualité de Runway
Évaluateur comparant le même personnage d'IA sur trois résultats du modèle
Alternatives à Hedra : auditez un personnage sur plusieurs modèles
Le réalisateur organise six cartes de storyboard de transition avant le tournage
Idées de transitions vidéo : storyboardez six mouvements de révélation
Éditeur comparant les tests vidéo correspondants pour un objet indésirable et des détails protégés
Prompts négatifs : test de contrôle des échecs dans Veo 3.1
Producteur comparant la découverte de tendances à un flux réutilisable d’influenceurs IA
Alternatives à Revid AI : séparez les tendances de la production
Typographie cinétique lisible de synchronisation de Motion Designer pour un ouvre-vidéo vertical
Typographie cinétique : créez un ouvre-vidéo IA lisible
L'éditeur vidéo inspecte les images de mouvement correspondantes à 24, 30, 60 et 120 FPS
Changer le FPS : testez la mise à jour 120 FPS de Runway
L'équipe de tournage cartographie l'axe de la caméra pour une conversation de cinq plans dans un café
Règle des 180 degrés pour la vidéo AI : corriger une scène à cinq plans
Éditeur auditant une chronologie vidéo de navigateur construite à partir de sources d'images vidéo et d'audio
Éditeur vidéo sur navigateur : auditez l'espace de travail unifié de Firefly
L'équipe de commerce électronique examine un catalogue de produits varié avant un transfert de vingt SKU
Alternatives PhotoRoom : auditer un transfert de 20 SKU
Producteur vidéo vérifiant un storyboard explicatif par rapport à des moments de preuve visibles
Exemples de vidéos explicatives : notez la preuve, pas le style
Présentateur de vente en direct montrant un produit pendant qu'un producteur vérifie les indications de l'émission
Script de vente en direct : créez un déroulé aux affirmations vérifiables
Ingénieur créatif acheminant une tâche vidéo en fonction du coût, de la latence et de la qualité
Routage IA : auditez le compromis coût-qualité de Runway

Créez une vision de rêve

avec APOB

Créez une vision de rêve

avec APOB

Pas de carte de crédit requise

LIENS

Fonctionnalités

Outils

INFORMATIONS DE CONTACT

support@apob.ai

DROIT D'AUTEUR 2024 TOUS DROITS RÉSERVÉS PAR ATOMSTOBITS LABS INC