Curso
Vivemos em um mundo onde a criatividade tem cada vez menos limites. Graças às capacidades da IA generativa para criar linguagem natural, imagens e vídeo, nossas imaginações mais vívidas podem virar realidades visuais impressionantes.
Tais possibilidades pareciam ficção há alguns anos, mas isso já não é verdade — especialmente com a tecnologia inovadora da API do DALL-E 3.
Este artigo traz um guia completo para entender a tecnologia do DALL-E 3, explorando seus recursos, aplicações práticas e do mundo real, e como ela está remodelando o cenário criativo.
Visão geral da API do DALL-E 3
Antes de mergulhar no aspecto de API, vamos entender o que é o DALL-E 3. Temos uma introdução completa sobre como usar o DALL-E 3 via Bing e ChatGPT; já este guia foca principalmente na integração via API.
O que é o DALL-E 3?
É o mais recente modelo de geração de imagens da OpenAI, anunciado em setembro de 2023. Esse modelo entende muito mais nuances e detalhes do que seus antecessores. O DALL-E 3 permite gerar visuais excepcionais a partir de descrições em texto.
As versões anteriores, como DALL-E 1 e DALL-E 2, foram lançadas em janeiro de 2021 e abril de 2022, respectivamente. O DALL-E 3 é, de longe, a versão mais avançada. Abaixo está uma tabela comparando com as versões anteriores.
Detalhes de preços
Os preços são informados para cada versão do DALL-E. Como podemos ver, apenas o DALL-E 3 oferece qualidades padrão e em alta definição e suas respectivas resoluções.
|
Modelo |
Qualidade |
Resolução |
Preço por imagem (em US$) |
|
DALL-E |
1024x1024 |
0.13 |
|
|
DALL·E 2 |
1024×1024 |
0.020 |
|
|
512×512 |
0.018 |
||
|
256×256 |
0.016 |
||
|
DALL·E 3 |
Padrão |
1024×1024 |
0.040 |
|
1024×1792, 1792×1024 |
0.080 |
||
|
HD |
1024×1024 |
0.080 |
|
|
1024×1792, 1792×1024 |
0.120 |
Características adicionais
A tabela acima traz uma visão comparativa de três iterações do sistema de IA DALL-E, projetado para gerar imagens a partir de descrições em texto. As versões são DALL-E, DALL-E 2 e DALL-E 3, cada uma com sua data de lançamento e conjunto de recursos.
- O DALL-E, a primeira versão, foi apresentado em janeiro de 2021, utilizando o GPT-3 como modelo de linguagem subjacente. Ele marcou o primeiro passo da tecnologia de texto para imagem, disponível para usuários com conta na API da OpenAI.
- A segunda versão, DALL-E 2, foi lançada em julho de 2022, avançando a tecnologia com o modelo de linguagem CLIP. As capacidades do CLIP ampliaram o entendimento dos prompts de texto, gerando imagens mais precisas.
- A versão mais recente é o DALL-E 3, lançada em outubro de 2023. Ela integra o modelo de linguagem mais avançado GPT-4, oferecendo provavelmente ainda melhor compreensão de texto e criação de imagens. Essa versão está acessível não só para quem tem conta na API da OpenAI, mas também para assinantes "Plus" via interface do ChatGPT.
Cada versão representa um passo evolutivo nas capacidades de IA de texto para imagem, com avanços em modelos de linguagem e acessibilidade que refletem o compromisso da OpenAI em aprimorar e democratizar a tecnologia de IA.
A OpenAI oferece capacidades adicionais por meio da assinatura "Plus", e uma delas é o GPT-4 Vision. Para saber mais, nosso GPT-4 Vision: um guia completo para iniciantes apresenta tudo o que você precisa saber, do acesso a exemplos práticos do mundo real e suas limitações.
|
DALL-E |
DALL-E 2 |
DALL-E 3 |
|
|
Data de lançamento |
Janeiro de 2021 |
Julho de 2022 |
Outubro de 2023 |
|
Tipo de dado de entrada |
Prompt de texto |
Prompt de texto |
Prompt de texto |
|
Modelo de linguagem |
GPT-3 |
CLIP |
GPT-4 |
|
Disponível para |
Qualquer pessoa com conta na API da OpenAI |
Qualquer pessoa com conta na API da OpenAI |
Qualquer pessoa com conta na API da OpenAI e assinantes "Plus" via ChatGPT |
Por que uma versão em API?
A OpenAI anunciou o lançamento de várias APIs durante seu primeiro developer day, e o DALL-E 3 foi uma delas.
A versão em API do DALL-E 3 oferece acesso mais direto e versátil às suas capacidades. Depois de chegar à interface do ChatGPT e ao Bing Chat, que oferecem uma experiência mais controlada e guiada, a API permite que desenvolvedores e empresas integrem diretamente os recursos do DALL-E 3 em seus próprios aplicativos e fluxos de trabalho.
Recursos da API do DALL-E 3
A API traz um conjunto de recursos pensados para melhorar a experiência do usuário. Vamos explorar essas capacidades em detalhe:

Recursos da API do DALL-E 3
- Integração de texto nas imagens: a API do DALL-E 3 consegue integrar o texto desejado no contexto visual, fazendo parecer que ele sempre fez parte da cena original.
- Diversas orientações de imagem: com o DALL-E 3, é possível gerar imagens nos formatos paisagem e retrato, garantindo flexibilidade para diferentes mídias e layouts.
- Melhor qualidade de imagem: o modelo não só cria imagens visualmente atraentes, como também ricas em detalhes, proporcionando uma experiência realista e envolvente.
- Compreensão de prompts complexos: o DALL-E 3 interpreta prompts complexos com eficiência, permitindo criar imagens altamente específicas e detalhadas.
Casos de uso por setor da API do DALL-E 3
Muitos setores vêm aproveitando a tecnologia do DALL-E desde as primeiras versões. A API atual oferece capacidades mais avançadas de geração de imagens, facilitando criatividade e eficiência.
Embora haja inúmeras indústrias, vamos focar em três: publicidade e marketing, educação e desenvolvimento de jogos.
- Publicidade e marketing: diversas agências podem aproveitar a API para criar rapidamente visuais personalizados para campanhas e branding. O benefício é impulsionar a criatividade e reduzir o tempo de ida ao mercado.
- Educação: plataformas de ensino online podem usar a API para gerar ilustrações e diagramas sob medida, tornando o material didático mais envolvente e acessível a um público mais amplo.
- Desenvolvimento de jogos: este é, sem dúvida, um dos campos que mais vão se beneficiar da API do DALL-E 3, já que games são pura experiência visual. Os desenvolvedores podem integrar a tecnologia para criar rapidamente visuais únicos para jogos.
Mão na massa: começando com a API do DALL-E 3
Agora que você já entende melhor a API do DALL-E 3 e do que ela é capaz, vamos colocar a criatividade para jogo. Esta seção orienta o processo de geração de imagens usando a API do DALL-E 3 após configurar todos os requisitos.
Fluxo de geração de imagens
Em qualquer implementação técnica, é útil fornecer um fluxo visual que mostre a interação entre os principais componentes do aplicativo sendo desenvolvido.
Este fluxo explica como o usuário interage com a API, desde o envio do prompt até a obtenção da imagem final.

Fluxo simplificado da interação do usuário com a API do DALL-E 3
Há duas partes principais nesse fluxo:
- O front-end é a parte que permite ao usuário fornecer a descrição da imagem desejada.
- A segunda parte é o back-end, responsável por mapear o prompt do usuário para a API do DALL-E 3.
Agora é hora de entrar na implementação técnica. O código-fonte deste tutorial está disponível neste workbook do DataLab; crie uma cópia para editar e executar no navegador sem instalar nada no seu computador.
Configurar a OpenAI KEY
As principais ferramentas necessárias para reproduzir os resultados deste tutorial são:
- Python: é a principal linguagem de programação que usaremos aqui. Uma alternativa é NodeJS.
- OpenAI: o pacote para interagir com os serviços da OpenAI
- OS: o pacote do sistema operacional para configurar a variável de ambiente
- Image: responsável por converter a resposta do DALL-E 3 no formato de imagem
O primeiro passo é obter a OpenAI KEY, que permite acessar o modelo DALL-E 3. As etapas principais estão ilustradas abaixo:

Quatro etapas principais para criar uma OpenAI KEY
As quatro etapas acima são autoexplicativas. No entanto, é importante criar a conta no site oficial da OpenAI.
Interagir com a API do DALL-E 3
Depois de obter a KEY, não compartilhe com ninguém. Ela deve permanecer privada. Em seguida, defina a chave como variável de ambiente da seguinte forma para poder utilizá-la:
import os
OPENAI_API_KEY= “<YOUR PRIVATE KEY>”
os.environ["OPENAI_API_KEY"] = OPENAI_API_KEY
A instrução os.environ inicia a interação com os serviços da OpenAI conforme o escopo da chave privada do usuário, que pode ser Personal ou Enterprise.
Em seguida, usando a função generate dos clientes da OpenAI, é possível especificar:
- O modelo a ser usado — neste tutorial, dall-e-3.
- O prompt a ser enviado ao modelo.
- As dimensões da imagem final gerada pelo dall-e-3; usamos 1024x1024 para todas as imagens.
- A qualidade da imagem, se é standard ou alta definição (hd). Vamos focar em gerar apenas imagens em alta definição.
- É possível solicitar uma imagem por vez com o DALL-E 3 ou até dez imagens simultâneas usando o parâmetro n, útil para requisições em paralelo. Neste tutorial, usamos n=1 para simplificar.
A função auxiliar abaixo combina todas essas informações para maior reprodutibilidade, mas, antes, precisamos instalar a biblioteca OpenAI e importar os pacotes necessários:
A instalação é feita com o gerenciador de pacotes pip do Python, assim:
pip install --upgrade openai
A opção de upgrade atualiza para o SDK do Python v1.2, necessário para interagir com o DALL-E 3.
from openai import OpenAI
# Instantiate the OpenAI client
client = OpenAI()
from IPython.display import Image
O client é responsável por iniciar a comunicação com a API do DALL-E 3.
A função auxiliar é implementada abaixo:
def get_image_from_DALL_E_3_API(user_prompt,
image_dimension="1024x1024",
image_quality="hd",
model="dall-e-3",
nb_final_image=1):
response = client.images.generate(
model = model,
prompt = user_prompt,
size = image_dimension,
quality = image_quality,
n=nb_final_image,
)
image_url = response.data[0].url
display(Image(url=image_url))
Gerar imagens realistas
Com a função auxiliar acima, vamos experimentar a geração de imagens usando prompts simples e avançados. Os prompts avançados usam a ilustração dos casos de uso setoriais anteriores.
É importante notar que executar o mesmo código várias vezes pode gerar resultados diferentes — isso acontece por causa do lado "criativo" do modelo.
Usar um prompt simples
Vamos imaginar o envio do seguinte prompt ao modelo:
Create an image of a cute brown puppy sitting in a green meadow under a clear blue sky.
puppy_prompt = "Create an image of a cute brown puppy sitting in a green meadow under a clear blue sky."
get_image_from_DALL_E_3_API(puppy_prompt)
A imagem a seguir é gerada após a execução bem-sucedida do código acima.

Imagem gerada a partir do prompt simples
Esse resultado reflete fielmente o prompt enviado.
Usar prompts mais complexos
Agora, vamos considerar prompts complexos para educação, publicidade e desenvolvimento de jogos.
Conteúdo educacional
- Prompt:
Generate an illustration of the solar system with planets orbiting the sun, labeled in English, for a grade school science textbook.
- Código:
education_prompt = "Generate an illustration of the solar system with planets orbiting the sun, labeled in English, for a grade school science textbook"
get_image_from_DALL_E_3_API(education_prompt)
- Resultado:

Imagem gerada para o prompt "Education"
Publicidade e marketing
- Prompt:
Create an image of a family enjoying a picnic in a futuristic city park, with skyscrapers in the background and a clear blue sky, to be used in a campaign promoting eco-friendly urban living.
- Código:
advertising_prompt = "Create an image of a family enjoying a picnic in a futuristic city park, with skyscrapers in the background and a clear blue sky, to be used in a campaign promoting eco-friendly urban living."
get_image_from_DALL_E_3_API(advertising_prompt)
- Resultado:

Imagem gerada para o prompt "Advertising"
Desenvolvimento de jogos
Para este exemplo final, vamos pedir ao modelo que adicione informação textual destacada em laranja no prompt e ver como ele se comporta.
- Prompt:
Design a concept art of a mystical forest at twilight, with glowing plants and a hidden entrance to an underground cave, for an adventure game setting. Include a signpost in the image with the text 'Beware: Mythical Creatures Ahead' in an ancient, mystical font style.
- Código:
game_dev_prompt = "Design a concept art of a mystical forest at twilight, with glowing plants and a hidden entrance to an underground cave, for an adventure game setting. Include a signpost in the image with the text 'Beware: Mythical Creatures Ahead' in an ancient, mystical font style"
get_image_from_DALL_E_3_API(game_dev_prompt)
- Resultado:

Imagem gerada para o prompt "Game Development"
Percebemos que o modelo conseguiu adicionar com sucesso o texto "BEWARE MYTHICAL CREATURES AHEAD" após gerar a imagem. Sensacional.
Boas práticas ao usar a API do DALL-E 3
Para uma melhor experiência com a API do DALL-E 3, siga estas boas práticas e orientações:
- Priorize a comunicação detalhada: fornecer prompts precisos e detalhados ao DALL-E 3 é essencial — assim como instruções claras ajudam na interação humana. Quanto mais explícito o pedido, mais fiel será o resultado.
- Considere a ética: é importante estar atento às implicações éticas das criações finais, respeitando leis de direitos autorais e privacidade, e considerando o impacto potencial das imagens geradas.
- Reconheça e se adapte às limitações: como qualquer tecnologia, o DALL-E 3 também tem limitações. Entender o que a API consegue ou não fazer ajuda a ajustar os prompts para expectativas mais realistas.
- Mantenha-se informado e evolua: experimentar diferentes prompts ajuda a descobrir a amplitude da API e também os próprios limites criativos. Para pintores, é como explorar pincéis e cores diferentes.
Conclusão
Em resumo, este artigo apresentou uma exploração abrangente da API do DALL-E 3, detalhando sua configuração e várias aplicações. Começamos com uma visão geral da API, destacando suas capacidades inovadoras e preparando o terreno para um mergulho mais profundo.
Em seguida, detalhamos os recursos do DALL-E 3, esclarecendo suas funcionalidades avançadas de geração de imagens. Depois, analisamos casos de uso em diferentes setores, demonstrando a versatilidade e o amplo impacto da API.
O artigo também orientou os passos iniciais para usar a API do DALL-E 3, desde obter acesso até configurá-la para diferentes aplicações, destacando a importância de entender e usar seus recursos de forma eficaz.
Além disso, discutimos boas práticas para o uso da API do DALL-E 3, enfatizando considerações éticas e estratégias para maximizar seu potencial. Dicas práticas, acompanhadas de exemplos das capacidades da API, foram compartilhadas para ajudar você a otimizar sua experiência.
Pronto para dar o próximo passo no mundo da IA e da tecnologia criativa? Aprimore suas habilidades e libere todo o seu potencial criativo com as ferramentas avançadas usadas por inovadores em IA. Comece sua jornada com o nosso tutorial How to Use Midjourney: A Comprehensive Guide to AI-Generated Artwork Creation hoje mesmo. Ou aprenda a trabalhar com outras APIs populares, como no nosso curso Working with the OpenAI API.
A Zoumana desenvolve ferramentas de IA LLM para ajudar as empresas a realizar due diligence de sustentabilidade e avaliações de risco. Anteriormente, ele trabalhou como cientista de dados e engenheiro de aprendizado de máquina na Axionable e na IBM. Zoumana é o fundador da plataforma de tecnologia educacional de aprendizagem entre pares ETP4Africa. Ele escreveu mais de 20 tutoriais para o DataCamp.




