Pular para o conteúdo principal

Gemini 3.7 Flash: recursos, benchmarks e preços

O Gemini 3.7 Flash do Google foca em programação e fluxos com agentes, pela metade do preço de lançamento do 3.6 Flash. Veja o que há de novo, os benchmarks e onde ele se encaixa.
Atualizado 23 de set. de 2026  · 10 min lido

Explorar com IA

ChatGPTClaudePerplexity

Nota: Poucas semanas após o lançamento do Gemini 3.7 Flash, o Google lançou o Gemini 3.8 Flash. Veja o modelo em ação no nosso tutorial da API do Gemini 3.8 Flash.

O Google lançou o Gemini 3.7 Flash, seu modelo mais capaz da linha Flash até agora, voltado diretamente para programação e fluxos de trabalho com agentes. O lançamento chega enquanto o carro-chefe Gemini 3.5 Pro segue atrasado — a Reuters apontou isso como um teste de fogo para ver se o DeepMind consegue acompanhar a Anthropic e a OpenAI.

Os números de destaque são agressivos. O Gemini 3.7 Flash marca 43,6% no FrontierCode 1.1 Main (acima de 34,4% do 3.6 Flash), alcança 1588 de Elo no Code Arena para desenvolvimento web e chega com preço promocional de US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de tokens de saída — metade do custo inicial do 3.6 Flash.

Neste artigo, eu trago tudo o que há de novo no Gemini 3.7 Flash: seus recursos, os benchmarks e testes práticos que você pode reproduzir. Para se aprofundar nos modelos concorrentes, veja nossos guias sobre GPT-5.6 Terra vs Claude Sonnet 5 e como aprender Claude. 

Em poucas palavras

  • O Gemini 3.7 Flash é o modelo Flash mais capaz do Google, voltado para programação e fluxos de trabalho com agentes, com janela de contexto de 1M de tokens.
  • Preço promocional de US$ 0,75/1M de entrada e US$ 3,75/1M de saída até 31 de dezembro de 2026; depois, US$ 1,50/US$ 7,50 padrão.
  • Lidera no FrontierCode 1.1 (43,6%), GDP.pdf (34,0%), Harvey LAB-AA (90,7%) e GDM-MRCR de longo contexto (97,0%) frente ao Claude Sonnet 5 e ao GPT-5.6 Terra.
  • O GPT-5.6 Terra ainda lidera no DeepSWE, Terminal-bench e avaliações de agentes do OSWorld.
  • Disponível via Gemini API, Google Antigravity, Gemini Enterprise e Gemini Spark.

O que é o Gemini 3.7 Flash?

O Gemini 3.7 Flash é o modelo coringa de nível intermediário do Google, posicionado como o mais capaz da linha Flash para programação complexa, fluxos de trabalho com agentes e execução confiável em múltiplas etapas. Ele sucede o Gemini 3.6 Flash, lançado três semanas antes, e o Google credita o salto de qualidade ao feedback de desenvolvedores e a mudanças algorítmicas.

O modelo está disponível de forma geral via Gemini API, com janela de contexto de 1M de tokens (1.048.576 tokens de entrada) e limite de 65.536 tokens de saída. Ele aceita entradas de texto, imagem, vídeo, áudio e PDF, e retorna apenas texto. O Google oferece níveis de "pensamento" ajustáveis — baixo, médio e alto —, mas a API retorna erro se você solicitar a opção não suportada minimal.

O dado mais revelador é o DeepSWE v1.1, uma avaliação de engenharia de software de longo horizonte, onde o 3.7 Flash marca 65,3% contra 34,4% do antecessor no FrontierCode e apenas 48,6% do 3.6 Flash no próprio DeepSWE. É um ganho grande em uma única geração para um modelo que ainda ficou mais barato — algo incomum.

O que há de novo no Gemini 3.7 Flash?

A história aqui é um modelo Flash mais capaz, por um preço menor, com melhor obediência a instruções e menos necessidade de "padrinho" nos loops de agentes. Veja as mudanças que mais importam para quem está na prática.

Programação e correção de issues mais fortes

Você pode delegar ao Gemini 3.7 Flash tarefas mais difíceis de depuração e refatoração e esperar maior acerto já na primeira tentativa. O Google reporta 43,6% no FrontierCode 1.1 Main, para qualidade de código de produção (acima de 34,4% do 3.6 Flash), e 65,3% no DeepSWE v1.1 para engenharia de software de longo horizonte.

Para engenheiros em produção, a leitura prática é: menos retrabalho. Segundo o Google, o modelo lida melhor com bloqueios e segue instruções com mais fidelidade, o que reduz a supervisão manual que costuma tornar modelos baratos caros em tempo total.

Geração mais rápida de apps web e UI

O Gemini 3.7 Flash cria layouts funcionais e apps web completos em menos prompts do que o 3.6 Flash. No leaderboard de desenvolvimento web do Code Arena, ele marca 1588 de Elo contra 1538 do 3.6 Flash e 1541 do Claude Sonnet 5.

O modelo também consegue replicar um input de referência ao gerar UI, seja um screenshot, uma imagem ou um design system completo. Se você fornecer um mockup de uma página de preços, ele busca reproduzir a aderência ao design em vez de improvisar um layout genérico.

Execução de agentes em múltiplas etapas mais consistente

O modelo dedica mais esforço a planejamento e chamadas de ferramentas — justamente onde modelos baratos costumam falhar. No AutomationBench, uma avaliação privada de fluxos de trabalho reais de negócios, o 3.7 Flash marca 30,4% contra 17,0% do 3.6 Flash e 10,7% do Claude Sonnet 5.

Ferramentas integradas disponíveis via API incluem caching, execução de código, busca em arquivos, function calling, grounding de busca, grounding com Google Maps, saídas estruturadas e contexto por URL. O uso de computador está presente, mas em prévia; eu não basearia agentes de produção nisso ainda.

Melhor desempenho em documentos e trabalho de conhecimento

O Gemini 3.7 Flash lida melhor com áreas densas em conhecimento como finanças, direito e biociências, com raciocínio e compreensão de documentos aprimorados. No benchmark GDP.pdf, para compreensão especializada de PDFs, ele marca 34,0% contra 22,0% do 3.6 Flash; no Harvey LAB-AA, para fluxos jurídicos complexos, chega a 90,7%.

Se seu trabalho envolve extrair respostas estruturadas de relatórios anuais ou contratos densos, este é o lançamento para testar. O modelo ainda gera apenas texto — ele não cria os gráficos que lê, apenas os descreve ou resume.

Preço menor para escalar agentes

O preço promocional reduz pela metade o custo de rodar agentes baseados em Flash em comparação com as tarifas de lançamento do 3.6 Flash. Até 31 de dezembro de 2026, você paga US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de tokens de saída.

  • Entrada: US$ 0,75 por 1M de tokens (promocional), subindo para US$ 1,50 por 1M em 1º de janeiro de 2027
  • Saída: US$ 3,75 por 1M de tokens (promocional), subindo para US$ 7,50 por 1M em 1º de janeiro de 2027

Para comparar, o Claude Sonnet 5 está em US$ 2,00 de entrada e US$ 10,00 de saída na própria tabela do Google, e o GPT-5.6 Terra em US$ 2,00 de entrada e US$ 12,00 de saída. Em preço por token, o 3.7 Flash fica bem abaixo de ambos.

Benchmarks do Gemini 3.7 Flash

A tabela de benchmarks do Google coloca o Gemini 3.7 Flash frente ao 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra e Muse Spark 1.2. O padrão é consistente: o 3.7 Flash supera o antecessor em quase todas as avaliações e troca golpes com rivais mais caros, embora o GPT-5.6 Terra leve vantagem em alguns testes de agentes para programação.

Gemini 3.7 Flash vs o campo, em resumo

Veja como os principais números se alinham entre os quatro modelos na tabela do Google.

Métrica Gemini 3.7 Flash Claude Sonnet 5 GPT-5.6 Terra
Preço de entrada / 1M US$ 0,75 US$ 2,00 US$ 2,00
Preço de saída / 1M US$ 3,75 US$ 10,00 US$ 12,00
FrontierCode 1.1 Main 43,6% 42,7% 41,3%
DeepSWE v1.1 65,3% 53,8% 69,6%
Terminal-bench 2.1 85,8% 80,4% 87,4%
GDP.pdf 34,0% 28,0% 24,7%
GDM-MRCR v2 (128k) 97,0% 81,5% 93,5%

FrontierCode 1.1 Main

O FrontierCode 1.1 Main mede qualidade de código de produção — privilegia código correto e pronto para enviar, não apenas sintaticamente válido.

O Gemini 3.7 Flash marca 43,6%, à frente do Claude Sonnet 5 (42,7%), do GPT-5.6 Terra (41,3%) e do próprio antecessor 3.6 Flash (34,4%).

Um modelo da linha Flash superar dois rivais de ponta em código de produção é o grande destaque deste lançamento — especialmente custando um terço do preço por token.

DeepSWE v1.1

O DeepSWE v1.1 testa engenharia de software de longo horizonte — tarefas multi-arquivo que exigem manter contexto por muitas etapas.

Aqui, o 3.7 Flash marca 65,3%, um salto grande frente aos 48,6% do 3.6 Flash; mas o GPT-5.6 Terra lidera com 69,6%, e o Claude Sonnet 5 fica com 53,8%.

Resumo: o 3.7 Flash fechou boa parte da distância para o Terra em programação de longo horizonte, mas não superou. Se você precisa do teto máximo em programação multi-arquivo com agentes, o Terra ainda vence nesse teste específico.

Terminal-bench 2.1 e 3.0

O Terminal-bench mede programação agentiva em terminal, onde o modelo dirige a linha de comando para concluir tarefas.

No Terminal-bench 2.1, o 3.7 Flash marca 85,8% contra 78,0% do 3.6 Flash e 80,4% do Claude Sonnet 5 — embora o GPT-5.6 Terra lidere com 87,4%.

O Terminal-bench 3.0, mais novo e geral para capacidades de agentes, é mais difícil para todos: o 3.7 Flash marca 14,9%, bem acima do 3.6 Flash (5,4%), praticamente empatado com o Claude Sonnet 5 (14,6%) e atrás do Terra (20,8%).

Esses números absolutos baixos servem como um bom lembrete de quanto ainda falta para a confiabilidade geral dos agentes.

GDP.pdf e Harvey LAB-AA

O GDP.pdf avalia compreensão especializada de PDFs; o Harvey LAB-AA mede fluxos jurídicos complexos.

O Gemini 3.7 Flash lidera ambos: 34,0% no GDP.pdf contra 28,0% do Claude Sonnet 5 e 24,7% do GPT-5.6 Terra; e 90,7% no Harvey LAB-AA contra 90,1% do Sonnet 5 e 85,2% do Terra.

Se sua carga de trabalho é pesada em análise jurídica ou financeira de documentos, aqui o modelo mais barato da tabela também é o mais preciso — combinação rara.

GDM-MRCR v2 em longo contexto

O GDM-MRCR v2 (8-needle) mede recuperação em longo contexto, testando se o modelo encontra múltiplas informações enterradas em uma entrada extensa.

Na média de 128k, o 3.7 Flash marca 97,0%, à frente do 3.6 Flash (91,8%), do Claude Sonnet 5 (81,5%) e do GPT-5.6 Terra (93,5%).

Com janela de contexto de 1M de tokens e a melhor recuperação 8-needle da tabela, o 3.7 Flash é uma escolha forte para pipelines que "empacotam" documentos grandes ou transcrições longas em uma única chamada.

Quando comparamos Terra e Sonnet 5, a recuperação em longo contexto foi um dos maiores diferenciais — e agora o 3.7 Flash fica acima de ambos nesse quesito.

Onde o GPT-5.6 Terra ainda lidera

Vale ser transparente sobre as derrotas.

O GPT-5.6 Terra supera o Gemini 3.7 Flash no DeepSWE v1.1 (69,6% vs 65,3%), no Terminal-bench 2.1 (87,4% vs 85,8%), no Terminal-bench 3.0 (20,8% vs 14,9%) e no OSWorld-2.0 para uso agentivo de computador (50,2% vs 47,9%).

O padrão é: o Terra mantém uma pequena vantagem nos testes mais difíceis de agentes e programação em terminal, enquanto o 3.7 Flash vence em código de produção, compreensão de documentos e recuperação em longo contexto. Qual ganha para você depende se o gargalo é a confiabilidade do agente ou o custo.

Preços e disponibilidade do Gemini 3.7 Flash

O Gemini 3.7 Flash já está disponível em várias frentes do Google.

O ID do modelo na API é gemini-3.7-flash, e você pode começar a construir no Google AI Studio, no Android Studio ou no ambiente agent-first Google Antigravity.

  • Desenvolvedores: Gemini API via Google AI Studio e Android Studio; fluxos de agentes no Google Antigravity
  • Empresas: Gemini Enterprise Agent Platform e o app Gemini Enterprise
  • Indivíduos: Gemini Spark, o agente pessoal 24/7 no app Gemini, para assinantes Google AI Pro e Ultra em mais de 160 países

O preço é de US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de tokens de saída até 31 de dezembro de 2026. Em 1º de janeiro de 2027, valem as tarifas padrão: US$ 1,50 de entrada e US$ 7,50 de saída. Observação: geração de áudio, geração de imagem e a Live API não são suportadas neste modelo, e o uso de computador está apenas em prévia.

Considerações finais

O Gemini 3.7 Flash mostra o Google entregando rápido e cortando preços enquanto o carro-chefe Gemini 3.5 Pro segue atrasado.

Lançar um modelo Flash melhorado três semanas após o 3.6 Flash, pela metade do preço por token, soa como uma estratégia para ganhar no segmento intermediário — onde está boa parte do volume de produção.

Sinceramente, este é o modelo que eu escolheria se sua carga for compreensão de documentos, código de produção para web e apps, ou recuperação em longo contexto — áreas em que ele supera Claude Sonnet 5 e GPT-5.6 Terra gastando uma fração do custo.

Se o seu gargalo é programação agentiva pesada em terminal, o Terra ainda mantém uma vantagem estreita no DeepSWE e no Terminal-bench — e você pagará mais por esse teto.

Com a troca na liderança do DeepMind e o atraso do modelo Pro, o Google está apostando no Flash para provar que ainda compete. Pela tabela de benchmarks recém-divulgada, esse argumento se sustenta em grande parte para um modelo de nível intermediário.

Se você quer colocar a mão na massa com modelos como este, recomendo começar pela nossa trilha de habilidades AI Fundamentals para construir a base antes de integrar o Gemini 3.7 Flash nos seus próprios pipelines de agentes.

FAQs

Como o Gemini 3.7 Flash se compara ao Gemini 3.6 Flash?

O Gemini 3.7 Flash melhora o 3.6 Flash em praticamente todos os benchmarks publicados pelo Google, incluindo FrontierCode 1.1 Main (43,6% vs 34,4%), DeepSWE v1.1 (65,3% vs 48,6%), compreensão de documentos no GDP.pdf (34,0% vs 22,0%) e AutomationBench (30,4% vs 17,0%). Ele também chega custando metade do preço por token do 3.6 Flash no lançamento. Os dois modelos compartilham a mesma janela de contexto de 1M de tokens.

Onde posso acessar o Gemini 3.7 Flash?

Desenvolvedores podem usá-lo via Gemini API no Google AI Studio e no Android Studio, ou no ambiente Google Antigravity, focado em agentes, com o ID de modelo gemini-3.7-flash. Empresas têm acesso pela Gemini Enterprise Agent Platform e pelo app Gemini Enterprise. Indivíduos podem acessar via Gemini Spark para assinantes Google AI Pro e Ultra em mais de 160 países.

Quanto custa o Gemini 3.7 Flash?

Até 31 de dezembro de 2026, o preço promocional é de US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de tokens de saída. A partir de 1º de janeiro de 2027, o preço padrão sobe para US$ 1,50 por 1M de entrada e US$ 7,50 por 1M de saída. Esses valores ficam abaixo do Claude Sonnet 5 e do GPT-5.6 Terra, que aparecem a partir de US$ 2,00 de entrada na tabela do Google.

Quais padrões de segurança o Gemini 3.7 Flash segue?

O Gemini 3.7 Flash chega com proteções atualizadas do Frontier Safety contra uso indevido nos domínios Químico, Biológico, Radiológico e Nuclear (CBRN) e em ofensiva cibernética. O Google informa desempenho semelhante ao do 3.6 Flash em avaliações de segurança e tom, com poucas recusas injustificadas. Ele também atendeu aos limites de segurança infantil do Google durante os testes de red teaming.

O Gemini 3.7 Flash é melhor que o GPT-5.6 Terra para programar?

Depende da tarefa. O Gemini 3.7 Flash lidera em qualidade de código de produção no FrontierCode 1.1 (43,6% vs 41,3%), enquanto o GPT-5.6 Terra lidera no DeepSWE v1.1 (69,6% vs 65,3%), no Terminal-bench 2.1 (87,4% vs 85,8%) e no uso agentivo de computador no OSWorld. O Terra mantém uma vantagem estreita nos testes de agentes mais difíceis, mas o 3.7 Flash custa uma fração do preço.


Matt Crabtree's photo
Author
Matt Crabtree
LinkedIn

Escritor e editor de conteúdo na área de edtech. Comprometido com a exploração de tendências de dados e entusiasmado com o aprendizado da ciência de dados.

Tópicos
Inteligência Artificial
Modelos de idiomas grandes

Principais cursos da DataCamp

Curso

IA na prática com Google Gemini e NotebookLM

2 h
9.7K
Domine o Gemini e o NotebookLM para automatizar tarefas, aumentar a produtividade e trabalhar de forma mais inteligente em todo o ecossistema de IA do Google.
Ver detalhesRight Arrow
Iniciar Curso
Ver maisRight Arrow
Relacionado

blog

A OpenAI anuncia o GPT-4 Turbo com visão: O que sabemos até o momento

Descubra a atualização mais recente da OpenAI, GPT-4 Turbo com visão, e seus principais recursos, incluindo o corte de conhecimento aprimorado, uma janela de contexto expandida, preço acessível e muito mais.
Richie Cotton's photo

Richie Cotton

7 min

An avian AI exits its cage

blog

12 Alternativas de código aberto ao GPT-4

GPT-4 alternativas de código aberto que podem oferecer desempenho semelhante e exigem menos recursos computacionais para serem executadas. Esses projetos vêm com instruções, fontes de código, pesos de modelos, conjuntos de dados e interface de usuário do chatbot.
Abid Ali Awan's photo

Abid Ali Awan

9 min

blog

Stability AI anuncia a difusão estável 3: Tudo o que sabemos até agora

Saiba mais sobre as novas atualizações do Stable Diffusion e descubra os recursos do modelo de texto para imagem da versão 3.
Richie Cotton's photo

Richie Cotton

Tutorial

Como fazer o ajuste fino do GPT 3.5: Liberando todo o potencial da IA

Explore o GPT-3.5 Turbo e descubra o potencial transformador do ajuste fino. Saiba como personalizar esse modelo de linguagem avançado para aplicativos de nicho, aprimorar seu desempenho e entender os custos associados, a segurança e as considerações de privacidade.
Moez Ali's photo

Moez Ali

11 min

Tutorial

DeepSeek-Coder-V2 Tutorial: Exemplos, instalação, padrões de referência

O DeepSeek-Coder-V2 é um modelo de linguagem de código de código aberto que rivaliza com o desempenho do GPT-4, Gemini 1.5 Pro, Claude 3 Opus, Llama 3 70B ou Codestral.
Dimitri Didmanidze's photo

Dimitri Didmanidze

8 min

Tutorial

Primeiros passos com o Claude 3 e a API do Claude 3

Saiba mais sobre os modelos Claude 3, benchmarks de desempenho detalhados e como acessá-los. Além disso, descubra a nova API Python do Claude 3 para geração de texto, acesso a recursos de visão e streaming.
Abid Ali Awan's photo

Abid Ali Awan

Ver MaisVer Mais