Résumé

  • L'annonce du 10 septembre associe Marengo Embed 3.0 à une recherche gérée ; elle ne marque pas la première présence de TwelveLabs sur Bedrock.
  • La facture ne se réduit pas aux embeddings. Cette voie multimodale accepte des requêtes textuelles et renvoie des résultats, sans générer elle-même une réponse.

Un service de recherche se juge sur les moments qu'il retrouve, pas seulement sur le modèle qui transforme une vidéo en vecteurs. Jusqu'à cette étape, il faut un index, un traitement des requêtes et un classement des résultats. TwelveLabs et AWS proposent de prendre en charge cet assemblage avant que le client ne décide si la recherche est utile à son activité.

AWS a annoncé le 10 septembre la disponibilité générale de Marengo Embed 3.0 dans Amazon Bedrock Knowledge Bases. Selon les partenaires, AWS fournit l'infrastructure gérée, les connecteurs et l'orchestration ; Marengo produit les embeddings et TwelveLabs apporte la logique de recherche. Le client n'a plus à provisionner la base vectorielle ni à assembler cette architecture.

La nouveauté réside dans cet ensemble. Marengo 2.7 et Pegasus 1.2 étaient déjà proposés sur Bedrock en juillet 2025. Leurs anciennes conditions régionales, les capacités de génération de Pegasus ou les annonces distinctes de Marengo 3.5 ne définissent pas le périmètre du nouveau service.

Plusieurs unités sur la même facture

Le tarif public AWS distingue le stockage de l'index, à 5 dollars par Go de données brutes et par mois, et la recherche standard, à 1 dollar pour 1 000 appels API. Le parseur, le modèle d'embedding et le module de reclassement intégrés à l'offre gérée sont indiqués sans supplément. Une note précise toutefois que le choix d'un autre modèle pour les embeddings ou le reclassement entraîne des frais du fournisseur. Les appels via Gateway et l'observabilité activée ont aussi leur tarification habituelle.

Ailleurs sur cette même page, AWS illustre l'appel direct à Marengo : dix vidéos totalisant cent minutes représentent 6 000 secondes à 0,00070 dollar, soit 4,20 dollars pour les embeddings. Ce calcul ne chiffre pas un mois de conservation et de recherche dans une vidéothèque. La durée ne donne ni le volume brut des fichiers ni la fréquence des consultations.

AWS décrit les représentations de Marengo 3.0 comme des vecteurs à 512 dimensions. Cette compacité ne suffit pas à prouver une réduction d'un stockage facturé sur les données brutes. Ce sont deux dénominateurs différents. Aucun relevé de facturation ni comparatif de coût complet n'a été vérifié pour cet article.

Retrouver n'est pas raconter

La documentation du traitement multimodal natif transmet les médias directement au modèle d'embedding, sans les réduire d'abord à des blocs de texte. Les séquences audio et vidéo peuvent être segmentées. Cela permet de conserver des signaux qu'une extraction textuelle omettrait, sans garantir une représentation sans perte ou une recherche parfaite.

Le contrat d'utilisation est plus étroit que les capacités générales d'un modèle multimodal : cette voie utilise Retrieve, pas RetrieveAndGenerate, et n'accepte que les requêtes textuelles, non les images comme questions. Un extrait retrouvé n'est donc ni une réponse rédigée automatiquement ni une interprétation vérifiée de l'événement. Une démonstration d'entrée image au niveau du modèle ne change pas ces limites.

Le client conserve également des décisions d'exploitation. AWS demande une destination S3 de traitement multimodal distincte du compartiment source. Le service tente de supprimer les données temporaires après traitement et recommande une expiration limitée à leur emplacement. Une suppression appliquée à tout le compartiment ou à une zone de service trop large emporterait aussi du contenu utile.

Les autorisations d'ingestion et de recherche ainsi que le mode d'appel dans la région choisie doivent être examinés. TwelveLabs affirme que les données restent dans le compte du client ; cela ne constitue pas une vérification indépendante d'un traitement dans une seule région. De même, les résultats presque immédiats et les mois de construction évités relèvent du discours commercial, pas d'un banc d'essai réalisé ici.

L'intérêt est de changer l'ordre de l'évaluation : essayer une recherche exploitable avant de financer un assemblage important. Mais cette commodité rend le coût de l'usage complet plus pertinent que le seul prix du modèle.

Sources : annonce TwelveLabs ; annonce et démonstration AWS ; conditions du traitement multimodal natif ; tarifs AWS ; arrivée des modèles en juillet 2025.