Resumo

  • A novidade de 10 de setembro é a integração de Marengo Embed 3.0 à busca gerenciada, não a estreia da TwelveLabs no Bedrock.
  • O custo de embeddings não representa o serviço completo. Essa modalidade aceita consultas de texto e recupera conteúdo, sem gerar uma resposta.

Antes de saber se um modelo encontra os momentos certos em um acervo, a empresa precisa conseguir pesquisá-lo. Isso exige índice, tratamento das consultas e ordenação dos resultados. A integração entre TwelveLabs e AWS procura retirar essa montagem do início da avaliação: o comprador passa a experimentar uma busca utilizável, em vez de apenas receber componentes.

Em 10 de setembro, a AWS anunciou a disponibilidade geral de Marengo Embed 3.0 no Amazon Bedrock Knowledge Bases. Segundo as empresas, a AWS fornece infraestrutura gerenciada, conectores e orquestração, enquanto Marengo produz embeddings e a TwelveLabs contribui a lógica de recuperação. O cliente deixa de precisar provisionar o banco vetorial e construir essa estrutura de busca.

A parceria já tinha outra camada. Marengo 2.7 e Pegasus 1.2 estavam no Bedrock desde julho de 2025. As regiões desses modelos, a geração de texto do Pegasus e anúncios separados de Marengo 3.5 não devem ser usados para descrever as condições da nova integração.

O que cada unidade de cobrança mede

A tabela pública da AWS lista armazenamento do índice gerenciado a US$ 5 por GB de dados brutos ao mês e recuperação padrão a US$ 1 por 1.000 chamadas de API. O analisador, o modelo de embeddings e o reordenador incorporados à oferta gerenciada aparecem sem custo adicional. A ressalva é importante: escolher outro modelo para embeddings ou reordenação acrescenta a cobrança desse fornecedor. Invocações por Gateway e observabilidade habilitada também têm tarifas próprias.

Na mesma página, um exemplo de chamada direta ao Marengo usa dez vídeos com duração total de cem minutos. São 6.000 segundos a US$ 0,00070, ou US$ 4,20 para gerar embeddings. Esse valor não corresponde a um mês de armazenamento e pesquisa de um acervo. A duração não revela quantos GB os arquivos ocupam nem a frequência das buscas.

A compactação da representação também não determina a conta. A AWS descreve vetores de 512 dimensões no Marengo 3.0, mas cobra o armazenamento do índice com base nos dados brutos. Um vetor menor não prova economia sobre essa outra medida. Não foram examinadas faturas de clientes nem demonstrado um custo total menor neste artigo.

Recuperar uma cena não é explicar o fato

O processamento multimodal nativo descrito pela AWS envia o material diretamente ao modelo de embeddings, sem primeiro reduzi-lo a blocos de texto. Áudio e vídeo têm segmentação configurável. Isso preserva sinais que uma extração textual poderia deixar de fora, mas não é promessa de compreensão sem perda ou busca perfeita.

Há ainda uma restrição objetiva: esse caminho oferece Retrieve, não RetrieveAndGenerate. A consulta deve ser textual; imagens não são aceitas como pergunta. Portanto, um trecho encontrado não equivale a uma resposta gerada nem a uma interpretação verificada de um acontecimento. Exemplos de outros tipos de entrada no modelo não alteram o contrato dessa busca gerenciada.

O cliente continua com escolhas operacionais. A AWS exige um destino S3 para processamento multimodal separado do bucket de origem. O serviço tenta excluir dados temporários após o processamento e recomenda uma expiração restrita à área transitória. Aplicar a exclusão ao bucket inteiro ou a uma área ampla do serviço poderia remover conteúdo que ainda é necessário.

Permissões de ingestão e consulta, além do caminho de invocação na região escolhida, precisam ser conferidas. A TwelveLabs afirma que os dados ficam na conta do cliente, mas isso não comprova de forma independente processamento em uma única região. Avaliação quase imediata e meses de construção evitados continuam sendo alegações comerciais, não resultados de um teste realizado aqui.

A mudança de mercado é permitir que o cliente julgue a utilidade da busca antes de financiar uma montagem extensa. Depois dessa primeira decisão, a unidade de comparação deve ser o trabalho completo do serviço, e não só a tarifa do modelo.

Fontes: anúncio da TwelveLabs; lançamento e demonstração da AWS; limites do processamento multimodal nativo; preços AWS; chegada dos modelos em 2025.