Agentic Video Understanding in Gemini favicon

Agentic Video Understanding in Gemini

La compréhension vidéo agentique dans Gemini utilise une boucle de raisonnement actif pour scanner dynamiquement les segments vidéo, réduisant la consommation de jetons jusqu'à 88 % tout en améliorant la précision pour les contenus longs.

VidéoRécupération de moments à la…Recherche de type « aiguille dans une…Détection d'anomalies grâce au…Comptage précis de mouvements physiques…
Agentic Video Understanding in Gemini product interface screenshot
Visites mensuelles estimées
9 M
Période des données:
Référencé sur AIToolly

Qu’est-ce que Agentic Video Understanding in Gemini ? Présentation du produit

Fonction du produit et positionnement officiel

La compréhension vidéo agentique dans Gemini améliore l'efficacité et la précision de l'analyse vidéo en s'éloignant de l'ingestion de trames à taux fixe. Le modèle joue un rôle actif pour déterminer quels moments et signaux spécifiques sont nécessaires pour répondre à une requête.

Cette fonctionnalité est intégrée à la famille de modèles Gemini Flash et est accessible via les plateformes pour développeurs. Elle est optimisée pour les contenus de longue durée, tels que les conférences et les enregistrements de plusieurs heures, où le traitement statique traditionnel entraîne souvent des coûts de jetons élevés.

À quoi peut servir Agentic Video Understanding in Gemini ?

Cas d’usage étayés par les sources officielles

Montage vidéo automatisé

Identifier avec précision les changements d'état à la fraction de seconde et les limites de coupe serrées qui sont généralement manquées aux fréquences d'images standard.

Sécurité et contrôle qualité

Détecter des anomalies en rééchantillonnant des fenêtres temporelles spécifiques à une fréquence d'images plus élevée pour inspecter les mouvements rapides.

Suivi de l'activité physique

Compter avec précision les mouvements répétés ou suivre des objets distincts tout au long d'une vidéo.

Comment utiliser Agentic Video Understanding in Gemini

Le parcours documenté, lorsqu’il est disponible

  1. 1

    Configuration de l'API

    Le développeur définit le paramètre de traitement vidéo sur « agentic » dans les paramètres de configuration de l'API Gemini.

  2. 2

    Entrée multimédia

    L'utilisateur fournit une source vidéo, telle qu'un téléchargement de fichier ou une URL YouTube, accompagnée d'une invite en langage naturel.

  3. 3

    Inspection ciblée

    Le modèle utilise un outil interne pour récupérer uniquement les segments pertinents de la vidéo, de l'audio ou de la transcription nécessaires à la tâche.

  4. 4

    Livraison de l'analyse

    Le système renvoie les informations demandées, telles qu'un résumé, un horodatage spécifique ou un décompte d'événements.

Traitement vidéo agentique vs statique

Les modèles d'analyse vidéo traditionnels utilisent généralement un traitement statique, où la vidéo est ingérée à un taux fixe. Cette approche peut être inefficace pour les vidéos longues, car elle consomme soit un nombre massif de jetons, soit manque des détails critiques entre les trames échantillonnées.

La compréhension vidéo agentique change cela en permettant au modèle d'agir comme un agent qui décide quoi regarder et à quelle vitesse. En invoquant des outils internes pour charger uniquement les données nécessaires, le modèle peut atteindre une plus grande précision avec une consommation de ressources nettement inférieure.

  • Réduit la consommation de jetons jusqu'à 88 % par rapport aux méthodes statiques.
  • Abaisse les coûts d'analyse jusqu'à 66 % pour les développeurs.
  • Améliore la précision globale d'environ 7 % sur les tests de référence standard.
  • Permet une précision à la sous-seconde pour identifier les changements d'état.

Points à tester avant de choisir Agentic Video Understanding in Gemini

Vérifications à effectuer avec vos contenus et votre flux de travail

  • Confirmer que le modèle peut identifier des changements visuels spécifiques survenant en moins d'une seconde.
  • Vérifier la réduction de l'utilisation des jetons lors de l'analyse d'une vidéo de plus de dix minutes.
  • Vérifier la capacité du modèle à basculer entre les signaux audio et visuels pour répondre à une requête complexe.
  • Examiner la précision du comptage d'objets lors de mouvements physiques rapides.

Sources et date de vérification de Agentic Video Understanding in Gemini

Sources vérifiées et date de la vérification

Dernière vérification
Catégorie
Vidéo

Questions fréquentes sur Agentic Video Understanding in Gemini

Réponses fondées sur la fiche produit dont les sources ont été vérifiées

Quels modèles Gemini prennent en charge la compréhension vidéo agentique ?

La fonctionnalité est disponible pour les modèles Gemini 3.7 Flash, Gemini 3.6 Flash et Gemini 3.5 Flash-Lite.

Comment cette fonctionnalité réduit-elle les coûts pour les développeurs ?

Elle réduit les coûts jusqu'à 66 % en ne récupérant que les segments vidéo nécessaires plutôt qu'en traitant l'intégralité du flux à un taux fixe.

Le modèle peut-il analyser directement des vidéos YouTube ?

Oui, la fonctionnalité prend en charge à la fois les téléchargements directs de vidéos et les vidéos YouTube via l'API Gemini et Google AI Studio.

Quelles modalités le modèle peut-il inspecter pendant l'analyse ?

Le modèle peut choisir dynamiquement d'inspecter les trames visuelles, les pistes audio ou les transcriptions vidéo en fonction de l'objectif.

Y a-t-il des frais supplémentaires pour l'utilisation de la compréhension vidéo agentique ?

Non, la fonctionnalité utilise la tarification standard des jetons de l'API Gemini sans frais supplémentaires spécifiques à la fonctionnalité.

Découvrez d’autres outils récemment ajoutés dans la même catégorie.