Pular para o conteúdo principal

Guia do GPT-4o: como funciona, casos de uso, preço e benchmarks

Conheça o GPT-4o da OpenAI, um modelo de IA multimodal que processa texto, áudio e dados visuais, e veja como ele se compara ao GPT-4 Turbo em diferentes casos de uso.
Atualizado 31 de ago. de 2026  · 8 min lido

Explorar com IA

ChatGPTClaudePerplexity

A OpenAI anunciou seu mais novo grande modelo de linguagem, o GPT-4o, sucessor do GPT-4 Turbo. Continue a leitura para conhecer seus recursos, desempenho e como você pode aproveitá-lo.

O que é o GPT-4o da OpenAI?

O GPT-4o é o mais recente LLM da OpenAI. O "o" em GPT-4o vem de "omni"—do latim para "tudo"—indicando que este novo modelo aceita prompts que misturam texto, áudio, imagens e vídeo. Antes, a interface do ChatGPT usava modelos separados para cada tipo de conteúdo.

Por exemplo, ao falar com o ChatGPT pelo Voice Mode, sua fala era convertida em texto com o Whisper, a resposta em texto era gerada pelo GPT-4 Turbo, e essa resposta em texto era convertida em voz com o TTS.

GPT-4o vs GPT-4 Turbo

Comparação de como o GPT-4 Turbo e o GPT-4o processam entrada de voz

Da mesma forma, trabalhar com imagens no ChatGPT envolvia uma combinação do GPT-4 Turbo com o DALL-E 3.

Ter um único modelo para diferentes mídias promete mais velocidade e qualidade nas respostas, uma interface mais simples e novos casos de uso.

O que é o GPT-4o mini?

O GPT-4o Mini é uma versão mais enxuta e rápida do GPT-4o, projetada para tarefas com foco maior em velocidade e eficiência. Ele é derivado do modelo maior GPT-4o por meio de um processo chamado destilação.

Embora mantenha boa parte da capacidade do modelo original de processar entradas multimodais—texto, áudio e imagens—o GPT-4o mini é otimizado para aplicações leves em que respostas mais rápidas são cruciais.

Ele é especialmente útil para desenvolvedores que precisam de uma solução econômica para codificação, depuração e interações em tempo real que não exigem todo o poder computacional do GPT-4o.

Você pode ler mais detalhes neste artigo sobre o GPT-4o mini.

O que torna o GPT-4o diferente do GPT-4 Turbo?

A abordagem de modelo tudo-em-um faz com que o GPT-4o supere várias limitações das capacidades anteriores de interação por voz.

1. Tom de voz agora é considerado, facilitando respostas com emoção

Com o sistema anterior da OpenAI, que combinava Whisper, GPT-4 Turbo e TTS em um pipeline, o mecanismo de raciocínio, o GPT-4, só tinha acesso às palavras faladas. Isso significava que tom de voz, ruídos de fundo e a identificação de múltiplos interlocutores eram descartados. Assim, o GPT-4 Turbo não conseguia realmente expressar respostas com diferentes emoções ou estilos de fala.

Ao unificar texto e áudio em um único modelo capaz de raciocinar sobre ambos, essas informações ricas de áudio podem ser usadas para respostas de maior qualidade e com mais variedade de estilos de fala.

No exemplo a seguir, fornecido pela OpenAI, o GPT-4o gera uma saída sarcástica.

2. Menor latência possibilita conversas em tempo real

O pipeline de três modelos anterior gerava um pequeno atraso ("latência") entre você falar com o ChatGPT e receber a resposta.

A OpenAI compartilhou que a latência média do Voice Mode é de 2,8 segundos no GPT-3.5 e 5,4 segundos no GPT-4. Já a média do GPT-4o é de 0,32 segundo, nove vezes mais rápido que o GPT-3.5 e 17 vezes mais rápido que o GPT-4.

Essa redução de latência se aproxima do tempo médio de resposta humana (0,21 segundo) e é essencial para conversas, em que há muita troca entre humano e IA e os intervalos entre respostas vão se acumulando.

Esse recurso lembra o lançamento do Google Instant em 2010, o preenchimento automático de buscas. Embora a busca não leve tanto tempo, economizar alguns segundos a cada uso melhora a experiência do produto.

Um caso de uso que se torna mais viável com a menor latência do GPT-4o é a tradução de fala em tempo real. A OpenAI apresentou o caso de dois colegas, um falante de inglês e outro de espanhol, se comunicando com o GPT-4o traduzindo a conversa.

3. Visão integrada permite descrever o que está na câmera

Além da integração de voz e texto, o GPT-4o inclui recursos de imagem e vídeo. Isso significa que, se você der acesso à tela do computador, ele pode descrever o que está aparecendo, responder perguntas sobre a imagem na tela ou atuar como um co-piloto no seu trabalho.

Em um vídeo da OpenAI com Sal Khan, da Khan Academy, o GPT-4o ajuda o filho de Sal na lição de casa de matemática.

Mais do que trabalhar com a tela, se você der ao GPT-4o acesso a uma câmera, como a do seu celular, ele pode descrever o que vê.

Uma demonstração mais longa apresentada pela OpenAI combina todos esses recursos. Dois smartphones rodando o GPT-4o conversam entre si. Um GPT tem acesso às câmeras do celular e descreve o que vê para outro GPT que não consegue ver.

O resultado é uma conversa a três entre um humano e duas IAs. O vídeo também inclui um trecho em que as IAs cantam, algo que não era possível com os modelos anteriores.

4. Melhor tokenização para alfabetos não romanos traz mais velocidade e economia

Uma etapa do fluxo de trabalho dos LLMs é quando o texto do prompt é convertido em tokens, as unidades de texto que o modelo entende.

Em inglês, um token costuma ser uma palavra ou pontuação, embora algumas palavras possam ser divididas em vários tokens. Em média, três palavras em inglês ocupam cerca de quatro tokens.

Se uma língua puder ser representada no modelo com menos tokens, são necessários menos cálculos e a geração de texto fica mais rápida.

Além disso, como a OpenAI cobra por token de entrada e saída na API, menos tokens significam menor custo para os usuários da API.

O GPT-4o traz um modelo de tokenização aprimorado que reduz o número de tokens necessários por texto. A melhoria é mais perceptível em idiomas que não usam o alfabeto romano.

Por exemplo, as línguas indianas se beneficiaram bastante: híndi, marata, tâmil, telugo e guzerate apresentaram reduções de 2,9 a 4,4 vezes no número de tokens. Árabe teve redução de 2x, e línguas do leste asiático como chinês, japonês, coreano e vietnamita apresentaram reduções entre 1,4x e 1,7x.

5. Disponibilização no plano gratuito

Com a estratégia atual de preços do ChatGPT, os usuários precisavam pagar para acessar o melhor modelo: o GPT-4 Turbo estava disponível apenas nos planos pagos Plus e Enterprise.

Isso está mudando: a OpenAI prometeu disponibilizar o GPT-4o também no plano gratuito. Usuários Plus terão direito a cinco vezes mais mensagens que os usuários do plano grátis.

A liberação será gradual, começando imediatamente com acesso para a red team (testadores que tentam quebrar o modelo para achar problemas) e ampliando a base de usuários ao longo do tempo.

6. Lançamento do app desktop do ChatGPT

Embora isso não seja exclusivo do GPT-4o, a OpenAI também anunciou o app desktop do ChatGPT. As melhorias em latência e multimodalidade citadas acima, somadas ao app, devem mudar a forma como trabalhamos com o ChatGPT. Por exemplo, a OpenAI mostrou uma demonstração de um fluxo de trabalho de programação aumentada usando voz e o app desktop. Role até a seção de casos de uso para ver esse exemplo em ação!

Como o GPT-4o funciona?

Muitos tipos de conteúdo, uma única rede neural

Ainda há poucos detalhes de como o GPT-4o funciona. A única informação que a OpenAI forneceu no anúncio é que o GPT-4o é uma única rede neural treinada em entradas de texto, visão e áudio.

Essa abordagem difere da técnica anterior de treinar modelos separados para cada tipo de dado.

No entanto, o GPT-4o não é o primeiro modelo a adotar uma abordagem multimodal. Em 2022, o TenCent Lab criou o SkillNet, um modelo que combinou recursos de transformers dos LLMs com técnicas de visão computacional para melhorar o reconhecimento de caracteres chineses.

Em 2023, uma equipe da ETH Zurich, MIT e Stanford criou o WhisBERT, uma variação da série BERT de grandes modelos de linguagem. Embora não seja o primeiro, o GPT-4o é bem mais ambicioso e potente do que essas tentativas anteriores.

O GPT-4o é uma mudança radical em relação ao GPT-4 Turbo?

O quão radical é a mudança na arquitetura do GPT-4o em comparação ao GPT-4 Turbo depende de quem você pergunta na OpenAI: engenharia ou marketing. Em abril, um bot chamado "im-also-a-good-gpt2-chatbot" apareceu na Chatbot Arena da LMSYS, um ranking das melhores IAs generativas. Esse mistério agora foi revelado: era o GPT-4o.

A parte "gpt2" do nome é importante. Sem confundir com o GPT-2, antecessor do GPT-3.5 e GPT-4, o sufixo "2" foi amplamente interpretado como indicação de uma arquitetura totalmente nova para a série GPT.

Ao que tudo indica, alguém nas equipes de pesquisa ou engenharia da OpenAI considera que unificar texto, visão e áudio em um único modelo é uma mudança grande o suficiente para justificar o primeiro salto de versão em seis anos.

Por outro lado, o time de marketing optou por uma mudança de nome mais modesta, mantendo a convenção "GPT-4".

Desempenho do GPT-4o vs. outros modelos

A OpenAI divulgou números de benchmark do GPT-4o comparados a vários outros modelos topo de linha.

  • GPT-4 Turbo
  • GPT-4 (lançamento inicial)
  • Claude 3 Opus
  • Gemini Pro 1.5
  • Gemini Ultra 1.0
  • Llama 3 400B

Desses, três modelos realmente importam para comparação. O GPT-4 Turbo, o Claude 3 Opus e o Gemini Pro 1.5 passaram os últimos meses disputando o topo do ranking da LMSYS Chatbot Arena.

O Llama 3 400B pode virar concorrente no futuro, mas ainda não está pronto. Por isso, aqui apresentamos apenas os resultados desses três modelos e do GPT-4o.

Foram usados os resultados de seis benchmarks.

  • Massive Multitask Language Understanding (MMLU). Tarefas de matemática básica, história dos EUA, ciência da computação, direito e mais. Para obter alta precisão, os modelos precisam ter amplo conhecimento de mundo e capacidade de resolver problemas.
  • Graduate-Level Google-Proof Q&A (GPQA). Questões de múltipla escolha elaboradas por especialistas em biologia, física e química. São perguntas de alta qualidade e extremamente difíceis: especialistas com ou cursando PhD nessas áreas chegam a 74% de acerto.
  • MATH. Problemas de matemática do ensino fundamental e médio.
  • HumanEval. Teste de correção funcional de código, usado para avaliar geração de código.
  • Multilingual Grade School Math (MSGM). Problemas de matemática do ensino fundamental traduzidos para dez idiomas, incluindo línguas sub-representadas como bengali e suaíli.
  • Discrete Reasoning Over Paragraphs (DROP). Perguntas que exigem compreender parágrafos inteiros, por exemplo, somando, contando ou ordenando valores dispersos em várias frases.

Benchmarks de desempenho do GPT-4o vs outros modelos

Desempenho de GPT-4o, GPT-4 Turbo, Gemini Pro 1.5 e Claude 3 Opus em seis benchmarks de LLM. As pontuações variam de 0 a 100. Gráfico recriado a partir de dados fornecidos pela OpenAI. Não há dados para o Gemini Pro 1.5 no benchmark GPQA.

O GPT-4o obteve a melhor pontuação em quatro benchmarks, mas foi superado pelo Claude 3 Opus no MSGM e pelo GPT-4 Turbo no DROP. No geral, o desempenho é impressionante e indica o potencial da nova abordagem de treinamento multimodal.

Se você olhar de perto os números do GPT-4o em comparação ao GPT-4 Turbo, verá que os ganhos são de alguns pontos percentuais.

É um salto bacana um ano depois, mas está longe dos avanços dramáticos do GPT-1 para o GPT-2, ou do GPT-2 para o GPT-3.

Ser 10% melhor em raciocinar sobre texto ano a ano provavelmente será o novo normal. O ganho mais fácil já foi capturado, e é difícil continuar com grandes saltos no raciocínio textual.

Por outro lado, esses benchmarks de LLM não capturam o desempenho em problemas multimodais. O conceito é tão novo que ainda não temos boas formas de medir quão bom um modelo é em texto, áudio e visão ao mesmo tempo.

No geral, o desempenho do GPT-4o é impressionante e reforça o potencial da abordagem de treinamento multimodal.

Quais são os casos de uso do GPT-4o?

1. GPT-4o para análise de dados e tarefas de código

Modelos recentes da família GPT e seus derivados, como o GitHub Copilot, já conseguem ajudar na programação: escrever código, explicar e corrigir erros. As capacidades multimodais do GPT-4o abrem novas oportunidades interessantes.

Em um vídeo apresentado pela CTO da OpenAI, Mira Murati, os pesquisadores Mark Chen e Barret Zoph demonstraram o uso do GPT-4o com código em Python.

O código é compartilhado com o GPT como texto, e o recurso de interação por voz é usado para pedir que o GPT explique o código. Depois, ao executar o código, a visão do GPT-4o é usada para explicar o gráfico.

No geral, mostrar sua tela ao ChatGPT e fazer a pergunta por voz pode ser um fluxo de trabalho mais simples do que salvar um gráfico como imagem, enviar ao ChatGPT e digitar a pergunta.

2. GPT-4o para tradução em tempo real

Prepare o GPT-4o para a sua próxima viagem. As capacidades de fala com baixa latência do GPT-4o permitem tradução em tempo real (desde que você tenha dados de roaming no seu celular!). Viajar para países em que você não fala o idioma ficou muito mais fácil.

3. Roleplay com o GPT-4o

O ChatGPT já era útil para simulações de conversa, seja para se preparar para uma entrevista de emprego dos sonhos em dados ou para treinar seu time de vendas a argumentar melhor.

Até agora, ele funcionava melhor para roleplays só de texto, o que não era ideal nesses casos. As melhorias na fala tornam a simulação falada uma opção viável.

4. GPT-4o para auxiliar pessoas com deficiência visual

A capacidade do GPT-4o de entender vídeo de uma câmera e descrever a cena por voz pode ser um recurso essencial para pessoas com deficiência visual. É, basicamente, o recurso de audiodescrição das TVs, só que na vida real.

Mão na massa com o GPT-4o

Tenho acesso a alguns recursos novos do GPT-4o desde logo após o anúncio (infelizmente, ainda sem chat por voz) e fiquei impressionado com muitas das respostas. As saídas parecem mais rápidas e consistentes, e ele parece entender melhor meus pedidos do que antes. Não quer dizer que esteja perfeito.

Aqui vão alguns exemplos das interações que tive com o ChatGPT-4o:

Tarefa de análise de dados

Primeiro, por voz, perguntei se ele tinha ideias de como analisar o desempenho do time de futebol que eu torço, o poderoso Leeds United. Além de várias opções, ele trouxe um exemplo de código em Python:

import pandas as pd

# Sample data for Leeds United's match results
data = {
    'Match': ['Match1', 'Match2', 'Match3', 'Match4', 'Match5'],
    'Result': ['Win', 'Draw', 'Loss', 'Win', 'Win'],
    'Goals Scored': [2, 1, 0, 3, 2]
}

# Create a DataFrame
df = pd.DataFrame(data)

# Summarize match results
summary = df['Result'].value_counts()
total_goals = df['Goals Scored'].sum()
average_goals = df['Goals Scored'].mean()

# Display summary
print("Match Results Summary:")
print(summary)
print("\nTotal Goals Scored:", total_goals)
print("Average Goals Per Match:", round(average_goals, 2))

Geração de código no GPT-4o

Mas, quando aprofundei a linha de raciocínio, as coisas desviaram um pouco. Pedi dados reais para usar — ele pesquisou na web e encontrou duas boas fontes, mas relatou as estatísticas erradas. O Leeds jogou 46 partidas na temporada regular, marcou 81 gols e teve saldo de 38, em vez das 40 partidas que ele mencionou.

Depois, pedi ao ChatGPT que visualizasse os gols marcados contra cada time:

Visualização de dados no GPT-4o

De novo, ele cumpriu metade da tarefa. Criou a visualização solicitada, que parece boa à primeira vista. Mas, na prática, muitos dados foram inventados e estão imprecisos (times repetidos, gols não contabilizados e equipes que nem estão na mesma divisão do Leeds).

Para ser justo, imagino que o desempenho teria sido melhor se eu tivesse fornecido um dataset completo, mas preferia que ele tivesse dito isso em vez de inventar respostas com confiança.

Análise de imagem

Depois, pedi ao GPT-4o para analisar a foto de uma das minhas plantas. Ainda não tenho acesso à visão integrada, então tirei uma foto e perguntei ao ChatGPT que planta era:

Análise de imagem no GPT-4o

Não foi um mau palpite, embora não esteja totalmente correto. É um bonsai, mas é um Ilex crenata, não um Carmona retusa. Ainda assim, as duas plantas são parecidas, então é um erro compreensível — e gostei do contexto extra sobre como cuidar da planta.

Geração de imagem

Por fim, quis testar as habilidades de imagem do novo modelo. Mostrei uma foto da minha tartaruga, Darwin, e pedi que ele falasse sobre meu amigo:

Análise de imagem no GPT-4o 2

De novo, chegou perto, mas não acertou. O Darwin é, na verdade, uma tartaruga Horsefield, não Hermann’s, embora sejam bem parecidas. Depois pedi ao ChatGPT-4o para pegar a imagem original e recriá-la no estilo de Hokusai. Eis o resultado:

Geração de imagem no GPT-4o

Ficou bem legal, embora não lembre tanto a imagem original — o que é aceitável. Também demorou um pouco para gerar.

No geral, fiquei impressionado com a responsividade do novo modelo e com o quanto ele entendeu bem meus pedidos. Está longe de ser perfeito e ainda tem alucinações confiantes às vezes, mas mal posso esperar para testar a fala aprimorada e a visão integrada.

Limitações e riscos do GPT-4o

A regulação da IA generativa ainda está no começo; o AI Act da UE é o único marco legal relevante até agora. Isso significa que as empresas que criam IA precisam tomar decisões próprias sobre o que é IA segura.

A OpenAI tem um framework de preparação que usa para determinar se um novo modelo está pronto para ser lançado ao público.

O framework testa quatro áreas de preocupação.

  • Cibersegurança. A IA pode aumentar a produtividade de cibercriminosos e ajudar a criar exploits?
  • BCRN. A IA pode ajudar especialistas a criar ameaças biológicas, químicas, radiológicas ou nucleares?
  • Persuasão. A IA pode criar conteúdo (potencialmente interativo) que convença pessoas a mudar de opinião?
  • Autonomia do modelo. A IA pode agir como um agente, executando ações em outros softwares?

Cada área é classificada como Baixa, Média, Alta ou Crítica, e a pontuação do modelo é a mais alta entre as quatro categorias.

A OpenAI promete não lançar um modelo com preocupação crítica, embora isso seja uma barra de segurança relativamente baixa: pelas definições deles, uma preocupação crítica corresponderia a algo que abalaria a civilização humana. O GPT-4o passa longe disso, recebendo nível Médio de preocupação.

Saídas imperfeitas

Como em toda IA generativa, o modelo nem sempre se comporta como esperado. A visão computacional não é perfeita, então interpretações de imagens ou vídeos podem falhar.

Do mesmo modo, transcrições de fala raramente são 100% corretas, especialmente quando há sotaque forte ou termos técnicos.

A OpenAI disponibilizou um vídeo com erros de gravação em que o GPT-4o não funcionou como esperado.

Vale notar que a tradução entre duas línguas não inglesas foi um dos casos em que houve falha. Outros problemas incluíram tom de voz inadequado (soando condescendente) e falar no idioma errado.

Risco acelerado de deepfakes de áudio

O anúncio da OpenAI observa que "Reconhecemos que as modalidades de áudio do GPT-4o apresentam uma variedade de riscos novos". Em muitos aspectos, o GPT-4o pode acelerar o aumento de golpes com deepfake por ligação, em que a IA imita celebridades, políticos e pessoas próximas. É um problema que deve piorar antes de melhorar, e o GPT-4o tem poder para tornar essas ligações ainda mais convincentes.

Para mitigar esse risco, a saída de áudio está limitada a uma seleção de vozes predefinidas.

Presumivelmente, golpistas mais técnicos podem usar o GPT-4o para gerar texto e, depois, empregar seu próprio modelo de text-to-speech. Não está claro, porém, se ainda obteriam os benefícios de latência e tom de voz que o GPT-4o oferece.

Data de lançamento do GPT-4o

Em 19 de julho de 2024, muitos recursos do GPT-4o já vinham sendo liberados gradualmente. As capacidades de texto e imagem foram adicionadas para muitos usuários nos planos Plus e gratuito, inclusive no acesso ao ChatGPT via navegador móvel. Da mesma forma, os recursos de texto e visão do GPT-4o já estão disponíveis via API.

Esses recursos do GPT-4o estão amplamente disponíveis nos apps móveis para iOS e Android. Porém, ainda aguardamos o novo Voice Mode, que será atualizado para usar o GPT-4o; a API ganhará capacidades de áudio e vídeo; e o novo modelo chegará ao desktop para Mac. O acesso a este último também está sendo liberado gradualmente para usuários Plus, e um app para Windows está planejado para este ano.

Abaixo, um resumo das datas de lançamento do GPT-4o:

  • Anúncio do GPT-4o: 13 de maio de 2024
  • Início da liberação das capacidades de texto e imagem do GPT-4o: a partir de 13 de maio de 2024
  • Disponibilidade do GPT-4o no plano gratuito e para usuários Plus: a partir de 13 de maio de 2024
  • Acesso à API para GPT-4o (texto e visão): a partir de 13 de maio de 2024
  • Disponibilidade do GPT-4o no desktop Mac para usuários Plus: nas próximas semanas (a partir de 13 de maio de 2024)
  • Nova versão do Voice Mode com GPT-4o em alfa: nas próximas semanas/meses (após 13 de maio de 2024)
  • Suporte na API para capacidades de áudio e vídeo: nas próximas semanas/meses (após 13 de maio de 2024)
  • GPT-4o mini: 18 de julho de 2024

No entanto, após a polêmica causada pela demo das novas capacidades de voz, parece que a OpenAI está sendo cautelosa com o lançamento. Segundo a atualização no blog deles, 'Nas próximas semanas e meses, vamos trabalhar na infraestrutura técnica, na usabilidade via pós-treinamento e na segurança necessárias para liberar as outras modalidades. Por exemplo, no lançamento, as saídas de áudio estarão limitadas a uma seleção de vozes predefinidas e seguirão nossas políticas de segurança existentes.' 

Quanto custa o GPT-4o?

Apesar de ser mais rápido que o GPT-4 Turbo e ter visão melhor, o GPT-4o será cerca de 50% mais barato que seu antecessor. Segundo o site da OpenAI, o uso do modelo custará US$ 5 por milhão de tokens de entrada e US$ 15 por milhão de tokens de saída.

Como acessar o GPT-4o na versão web do ChatGPT?

A interface do ChatGPT mudou. Todas as conversas no ChatGPT agora usam o GPT-4o por padrão, e você pode alternar para o GPT-3.5 em um controle logo abaixo da resposta.

O que o GPT-4o indica para o futuro?

Existem duas linhas de pensamento sobre para onde a IA deve caminhar. Uma defende que a IA fique cada vez mais poderosa e resolva uma gama mais ampla de tarefas. A outra, que a IA fique melhor em tarefas específicas, com o menor custo possível.

A missão da OpenAI de criar uma inteligência artificial geral (AGI), assim como seu modelo de negócios, a coloca firmemente no primeiro grupo. O GPT-4o é mais um passo rumo a IAs cada vez mais poderosas.

Esta é a primeira geração de uma arquitetura completamente nova de modelos da OpenAI. Isso significa que há muito a aprender e otimizar nos próximos meses.

No curto prazo, espere novos tipos de "manias" e alucinações; no longo prazo, melhorias de desempenho, tanto em velocidade quanto em qualidade das respostas.

O timing do GPT-4o é curioso. Justo quando as big techs perceberam que Siri, Alexa e Google Assistente não são as máquinas de fazer dinheiro que imaginaram, a OpenAI quer tornar a IA conversacional de novo. No melhor cenário, isso trará uma leva de novos casos de uso para IA generativa. No mínimo, agora você pode pedir um timer no idioma que quiser.

Conclusão

O GPT-4o representa mais um avanço na IA generativa, unindo processamento de texto, áudio e visão em um único modelo eficiente. Essa inovação promete respostas mais rápidas, interações mais ricas e uma variedade maior de aplicações, da tradução em tempo real à análise de dados aprimorada e à acessibilidade para pessoas com deficiência visual.

Embora haja limitações e riscos iniciais, como o uso indevido em golpes com deepfake e a necessidade de mais otimizações, o GPT-4o é outro passo rumo ao objetivo da OpenAI de alcançar AGI. À medida que se torna mais acessível, ele pode mudar a forma como interagimos com a IA, integrando-se a tarefas do dia a dia e do trabalho.

Com menor custo e recursos aprimorados, o GPT-4o tende a estabelecer um novo padrão na indústria de IA, ampliando as possibilidades para usuários de diversas áreas.

O futuro da IA é empolgante, e este é um ótimo momento para começar a entender como essa tecnologia funciona. Se você está começando, conheça nossa trilha de habilidades AI Fundamentals, com conteúdo prático sobre ChatGPT, grandes modelos de linguagem, IA generativa e muito mais. Você também pode aprender mais sobre como trabalhar com a OpenAI API no nosso curso hands-on, ou conferir o catálogo completo de cursos de IA.


Richie Cotton's photo
Author
Richie Cotton
LinkedIn

Richie ajuda indivíduos e organizações a melhorar o uso de dados e IA. Ele é cientista de dados desde antes de o termo ser chamado de ciência de dados, escreveu dois livros e criou muitos cursos DataCamp sobre o assunto. Ele é apresentador do podcast DataFramed e dirige o programa de webinars do DataCamp.

FAQs

O GPT-4o consegue lidar com conversas multilíngues?

Sim, o GPT-4o consegue conduzir conversas multilíngues, oferecendo tradução em tempo real entre idiomas graças à sua fala de baixa latência. No entanto, na demonstração, houve alguns erros ao processar traduções. 

O GPT-4o oferece o mesmo suporte para todos os idiomas?

Embora o GPT-4o tenha tokenização aprimorada para alfabetos não romanos, o desempenho pode variar entre idiomas, principalmente aqueles com menor representação nos dados de treino.

Como o GPT-4o lida com ruído de fundo na entrada de áudio?

O GPT-4o pode considerar ruídos de fundo ao processar áudio, o que pode gerar respostas mais contextuais.

O GPT-4o é capaz de gerar vídeos?

Não. O GPT-4o pode analisar e descrever conteúdo em vídeo, mas não gera novos vídeos. O Sora da OpenAI é o modelo capaz de gerar vídeo. 

O GPT-4o consegue imitar vozes específicas?

Não. Para mitigar riscos como golpes com deepfake, o GPT-4o usa apenas uma seleção de vozes predefinidas na saída de áudio.

Quão seguros são os dados inseridos no GPT-4o?

A OpenAI segue rigorosas medidas de segurança, mas os usuários devem sempre ter cautela e evitar compartilhar informações sensíveis.

O GPT-4o pode ser integrado a aplicações existentes?

Sim. O GPT-4o pode ser integrado a diversas aplicações via OpenAI API, ampliando funcionalidades em diferentes plataformas.

Confira nosso curso Working with the OpenAI API para começar sua jornada desenvolvendo aplicações com IA.

Quando devo usar o GPT-4o Mini em vez do GPT-4o?

O GPT-4o Mini é ideal para tarefas que priorizam velocidade e eficiência em vez de raciocínio complexo ou interações multimodais. É ótimo para tarefas simples de código, depuração ou respostas rápidas em aplicações leves, sendo uma alternativa econômica para projetos que não precisam de todo o poder do GPT-4o.

Quais são as diferenças entre o GPT-4o e o modelo o1?

O GPT-4o foi projetado para tarefas multimodais, lidando de forma eficiente com entradas de texto, áudio e imagem. Já o modelo o1 foca em raciocínio avançado e resolução de problemas complexos, destacando-se em áreas como código e ciência. Enquanto o GPT-4o privilegia versatilidade e velocidade, o o1 prioriza processamento lógico profundo para tarefas de raciocínio intrincado.

Tópicos
Inteligência Artificial
OpenAI
ChatGPT

Aprenda a criar ferramentas de IA com a OpenAI hoje mesmo!

Curso

Trabalhar com a API da OpenAI

3 h
172.6K
Comece a criar aplicativos com IA usando a API da OpenAI e conheça a tecnologia por trás de aplicativos de IA populares, como o ChatGPT.
Ver detalhesRight Arrow
Iniciar Curso
Ver maisRight Arrow