course
OpenAI ogłosiło swój najnowszy duży model językowy, GPT-4o, następcę GPT-4 Turbo. Czytaj dalej, aby poznać jego możliwości, wydajność i potencjalne zastosowania.
Czym jest GPT-4o od OpenAI?
GPT-4o to najnowszy LLM od OpenAI. Litera „o” w GPT-4o oznacza „omni” — po łacinie „wszystko” — i odnosi się do faktu, że nowy model potrafi przyjmować polecenia stanowiące mieszankę tekstu, dźwięku, obrazów i wideo. Wcześniej interfejs ChatGPT używał osobnych modeli do różnych typów treści.
Na przykład podczas rozmowy z ChatGPT w trybie głosowym twoja mowa była zamieniana na tekst przez Whisper, odpowiedź tekstowa była generowana przez GPT-4 Turbo, a następnie zamieniana na mowę przez TTS.

Porównanie sposobu, w jaki GPT-4 Turbo i GPT-4o przetwarzają wejście mowy
Podobnie, praca z obrazami w ChatGPT obejmowała połączenie GPT-4 Turbo i DALL-E 3.
Jeden model do różnych mediów treści obiecuje większą szybkość i jakość wyników, prostszy interfejs oraz nowe zastosowania.
Czym jest GPT-4o mini?
GPT-4o Mini to lżejsza, szybsza wersja GPT-4o, zaprojektowana z myślą o zadaniach wymagających większego nacisku na szybkość i efektywność. Powstała z większego modelu GPT-4o w procesie zwanym destylacją.
Choć zachowuje sporą część możliwości oryginalnego modelu w zakresie przetwarzania danych multimodalnych — tekstu, dźwięku i obrazów — GPT-4o mini jest zoptymalizowany pod kątem lekkich aplikacji, w których kluczowy jest krótki czas reakcji.
Szczególnie przyda się deweloperom potrzebującym opłacalnego rozwiązania do kodowania, debugowania i interakcji w czasie rzeczywistym, które nie wymagają pełnej mocy obliczeniowej GPT-4o.
Więcej szczegółów znajdziesz w artykule o GPT-4o mini.
Czym GPT-4o różni się od GPT-4 Turbo?
Podejście „wszystko w jednym” sprawia, że GPT-4o pokonuje kilka ograniczeń wcześniejszych możliwości interakcji głosowych.
1. Ton głosu jest teraz brany pod uwagę, co ułatwia emocjonalne reakcje
W poprzednim systemie OpenAI łączącym w potoku Whisper, GPT-4 Turbo i TTS, silnik rozumowania, GPT-4, miał dostęp wyłącznie do wypowiedzianych słów. Oznaczało to, że takie elementy jak ton głosu, dźwięki w tle czy rozpoznawanie głosów wielu mówców były po prostu odrzucane. W efekcie GPT-4 Turbo nie bardzo potrafił wyrażać odpowiedzi z różnymi emocjami lub stylami mowy.
Dzięki jednemu modelowi potrafiącemu rozumować na podstawie tekstu i dźwięku, te bogate informacje audio można wykorzystać do udzielania wyższej jakości odpowiedzi z większą różnorodnością stylów wypowiedzi.
W poniższym przykładzie podanym przez OpenAI, GPT-4o generuje sarkastyczną wypowiedź.
2. Niższe opóźnienie umożliwia rozmowy w czasie rzeczywistym
Istniejący potok z trzema modelami powodował niewielkie opóźnienie („latencję”) między wypowiedzią do ChatGPT a otrzymaniem odpowiedzi.
OpenAI podało, że średnie opóźnienie w trybie głosowym wynosi 2,8 s dla GPT-3.5 i 5,4 s dla GPT-4. Dla porównania, średnie opóźnienie GPT-4o to 0,32 s, czyli dziewięć razy szybciej niż GPT-3.5 i 17 razy szybciej niż GPT-4.
To mniejsze opóźnienie jest zbliżone do średnich czasów reakcji człowieka (0,21 s) i ma znaczenie w zastosowaniach konwersacyjnych, gdzie jest dużo wymiany zdań między człowiekiem a AI i przerwy między odpowiedziami się sumują.
Ta funkcja przypomina wrażenie z premiery Google Instant, autouzupełniania zapytań, w 2010 roku. Choć samo wyszukiwanie nie trwa długo, oszczędność kilku sekund za każdym razem sprawia, że doświadczenie produktu jest lepsze.
Jednym z przypadków użycia, który staje się bardziej realny dzięki mniejszemu opóźnieniu GPT-4o, jest tłumaczenie mowy w czasie rzeczywistym. OpenAI zaprezentowało przypadek dwóch współpracowników — anglo- i hiszpańskojęzycznego — komunikujących się, gdy GPT-4o tłumaczy ich rozmowę.
3. Zintegrowana wizja umożliwia opisy strumienia z kamery
Oprócz integracji głosu i tekstu, GPT-4o ma wbudowane funkcje obrazu i wideo. Oznacza to, że jeśli dasz mu dostęp do ekranu komputera, może opisać to, co jest na ekranie, odpowiedzieć na pytania dotyczące obrazu na ekranie lub działać jako kopilot w twojej pracy.
W wideo od OpenAI z udziałem Sala Khana z Khan Academy, GPT-4o pomaga synowi Sala w pracy domowej z matematyki.
Poza pracą z ekranem, jeśli dasz GPT-4o dostęp do kamery, np. w smartfonie, może opisać to, co widzi.
Dłuższe demo zaprezentowane przez OpenAI łączy wszystkie te funkcje. Dwa smartfony z uruchomionym GPT-4o prowadzą rozmowę. Jeden GPT ma dostęp do kamer smartfona i opisuje to, co widzi, drugiemu GPT, który nie widzi.
Wynikiem jest trójstronna rozmowa między człowiekiem a dwiema SI. Wideo zawiera też fragment, w którym SI śpiewają — coś, co nie było możliwe we wcześniejszych modelach.
4. Lepsza tokenizacja dla alfabetów nieromańskich zapewnia większą szybkość i opłacalność
Jednym z kroków w przepływie pracy LLM jest konwersja tekstu polecenia na tokeny. To jednostki tekstu, które model potrafi zrozumieć.
W języku angielskim token to zwykle jedno słowo lub znak interpunkcyjny, choć niektóre słowa mogą być rozbijane na wiele tokenów. Średnio trzy angielskie słowa zajmują około czterech tokenów.
Jeśli język można reprezentować w modelu mniejszą liczbą tokenów, trzeba wykonać mniej obliczeń, a szybkość generowania tekstu rośnie.
Dodatkowo, ponieważ OpenAI rozlicza swoje API per token wejściowy lub wyjściowy, mniej tokenów oznacza niższy koszt dla użytkowników API.
GPT-4o ma ulepszony model tokenizacji, który sprawia, że na tekst potrzeba mniej tokenów. Ulepszenie jest najbardziej zauważalne w językach nieużywających alfabetu łacińskiego.
Na przykład języki indyjskie szczególnie skorzystały — w hindi, marathi, tamilskim, telugu i gudżarati liczba tokenów spadła od 2,9 do 4,4 razy. W arabskim redukcja wyniosła 2x, a w językach wschodnioazjatyckich, takich jak chiński, japoński, koreański i wietnamski — między 1,4x a 1,7x.
5. Wprowadzenie do planu bezpłatnego
Przy dotychczasowej strategii cenowej ChatGPT, użytkownicy musieli płacić za dostęp do najlepszego modelu: GPT-4 Turbo był dostępny tylko w płatnych planach Plus i Enterprise.
To się zmienia — OpenAI obiecuje udostępnić GPT-4o także w planie bezpłatnym. Użytkownicy Plus dostaną pięć razy więcej wiadomości niż użytkownicy darmowi.
Wdrożenie będzie stopniowe — dostęp dla red teamu (testerów próbujących „psuć” model, by znaleźć problemy) zaczyna się natychmiast, a kolejne grupy użytkowników będą uzyskiwać dostęp z czasem.
6. Premiera aplikacji desktopowej ChatGPT
Choć nie jest to aktualizacja wyłącznie dla GPT-4o, OpenAI zapowiedziało także wydanie desktopowej aplikacji ChatGPT. Opisane wyżej usprawnienia w latencji i multimodalności, wraz z premierą aplikacji, oznaczają, że sposób pracy z ChatGPT prawdopodobnie się zmieni. Na przykład OpenAI pokazało demo rozszerzonego przepływu pracy programistycznej z użyciem głosu i aplikacji desktopowej ChatGPT. Przewiń w dół do sekcji zastosowań, by zobaczyć ten przykład w akcji!
Jak działa GPT-4o?
Wiele typów treści, jedna sieć neuronowa
Szczegóły działania GPT-4o są wciąż skąpe. Jedyna informacja podana przez OpenAI w ogłoszeniu to to, że GPT-4o jest pojedynczą siecią neuronową wytrenowaną na tekście, obrazie i dźwięku.
To nowe podejście różni się od wcześniejszej techniki, w której osobne modele były trenowane na różnych typach danych.
Nie jest to jednak pierwszy model podchodzący multimodalnie. W 2022 r. TenCent Lab stworzyło SkillNet, model łączący cechy transformera LLM z technikami wizyjnymi w celu lepszego rozpoznawania chińskich znaków.
W 2023 r. zespół z ETH Zurich, MIT i Stanfordu stworzył WhisBERT, wariant serii dużych modeli językowych BERT. Choć nie pierwszy, GPT-4o jest znacznie ambitniejszy i potężniejszy niż te wcześniejsze próby.
Czy GPT-4o to radykalna zmiana względem GPT-4 Turbo?
Skala zmian w architekturze GPT-4o względem GPT-4 Turbo zależy od tego, czy zapytasz inżynierów, czy marketing OpenAI. W kwietniu na Chatbot Arena LMSYS, tablicy liderów dla najlepszych generatywnych SI, pojawił się bot „im-also-a-good-gpt2-chatbot”. Ta tajemnicza SI okazała się GPT-4o.
Istotna jest część nazwy „gpt2”. Nie mylić z GPT-2, poprzednikiem GPT-3.5 i GPT-4 — sufiks „2” powszechnie uznano za oznaczający zupełnie nową architekturę serii GPT.
Najwyraźniej ktoś w zespole badawczo-inżynieryjnym OpenAI uznał, że połączenie tekstu, obrazu i dźwięku w jednym modelu to zmiana na tyle duża, by uzasadniać pierwszy od sześciu lat skok numeru wersji.
Z drugiej strony zespół marketingu pozostał przy dość zachowawczej zmianie nazwy, kontynuując konwencję „GPT-4”.
Wydajność GPT-4o vs inne modele
OpenAI opublikowało wyniki benchmarków GPT-4o na tle kilku innych topowych modeli.
- GPT-4 Turbo
- GPT-4 (pierwsze wydanie)
- Claude 3 Opus
- Gemini Pro 1.5
- Gemini Ultra 1.0
- Llama 3 400B
Spośród nich dla porównania realnie liczą się trzy modele. GPT-4 Turbo, Claude 3 Opus i Gemini Pro 1.5 przez ostatnie miesiące rywalizowały o czołowe miejsca na liście LMSYS Chatbot Arena.
Llama 3 400B może być w przyszłości konkurentem, ale jeszcze nie jest gotowa. Dlatego tutaj prezentujemy wyniki tylko dla tych trzech modeli i GPT-4o.
Wykorzystano wyniki sześciu benchmarków.
- Massive Multitask Language Understanding (MMLU). Zadania z matematyki podstawowej, historii USA, informatyki, prawa i innych. Żeby osiągnąć wysoką dokładność, modele muszą mieć rozległą wiedzę o świecie i zdolność rozwiązywania problemów.
- Graduate-Level Google-Proof Q&A (GPQA). Pytania wielokrotnego wyboru napisane przez ekspertów z biologii, fizyki i chemii. Pytania są wysokiej jakości i bardzo trudne: eksperci z doktoratami lub w trakcie ich zdobywania osiągają 74% skuteczności.
- MATH. Zadania matematyczne na poziomie szkoły średniej.
- HumanEval. Test poprawności funkcjonalnej kodu, używany do sprawdzania generowania kodu.
- Multilingual Grade School Math (MSGM). Zadania matematyczne na poziomie szkoły podstawowej, przetłumaczone na dziesięć języków, w tym słabiej reprezentowane, jak bengalski i suahili.
- Discrete Reasoning Over Paragraphs (DROP). Pytania wymagające zrozumienia całych akapitów, np. poprzez dodawanie, liczenie czy sortowanie wartości rozproszonych w wielu zdaniach.

Wyniki GPT-4o, GPT-4 Turbo, Gemini Pro 1.5 i Claude 3 Opus w sześciu benchmarkach LLM. Wyniki każdego benchmarku mieszczą się w przedziale 0–100. Odtworzone na podstawie danych od OpenAI. Dla Gemini Pro 1.5 nie podano danych w benchmarku GPQA.
GPT-4o zdobywa najwyższy wynik w czterech benchmarkach, choć w MSGM przegrywa z Claude 3 Opus, a w DROP — z GPT-4 Turbo. Ogólnie rzecz biorąc, to imponująca wydajność i obiecujący sygnał dla nowego podejścia do treningu multimodalnego.
Jeśli przyjrzysz się uważnie liczbom GPT-4o względem GPT-4 Turbo, zobaczysz, że wzrosty to tylko kilka punktów procentowych.
To imponujący skok rok do roku, ale daleki od dramatycznych przeskoków z czasów GPT-1 → GPT-2 czy GPT-2 → GPT-3.
Bycie o 10% lepszym w rozumowaniu tekstu rok do roku to prawdopodobnie nowa norma. Nisko wiszące owoce już zebrano i trudno kontynuować duże skoki w rozumowaniu tekstu.
Z drugiej strony te benchmarki LLM nie oddają wydajności SI w problemach multimodalnych. Koncepcja jest na tyle nowa, że nie mamy jeszcze dobrych metod pomiaru jakości modelu w tekście, dźwięku i wizji łącznie.
Podsumowując, wydajność GPT-4o jest imponująca i dobrze rokuje dla nowego podejścia do treningu multimodalnego.
Jakie są zastosowania GPT-4o?
1. GPT-4o do analizy danych i zadań programistycznych
Nowsze modele GPT i ich pochodne, jak GitHub Copilot, już potrafią pomagać w kodowaniu — pisać kod oraz wyjaśniać i naprawiać błędy. Multimodalne możliwości GPT-4o otwierają ciekawe możliwości.
W filmie promocyjnym prowadzonym przez CTO OpenAI Mirę Murati dwaj badacze OpenAI, Mark Chen i Barret Zoph, pokazali pracę z kodem w Pythonie przy użyciu GPT-4o.
Kod jest przekazywany GPT jako tekst, a funkcja interakcji głosowej służy do poproszenia GPT o wyjaśnienie kodu. Później, po uruchomieniu kodu, funkcja wizji GPT-4o jest użyta do wyjaśnienia wykresu.
Ogólnie rzecz biorąc, pokazanie ChatGPT swojego ekranu i zadanie pytania głosem może być prostszym przepływem pracy niż zapisywanie wykresu do pliku graficznego, przesyłanie go do ChatGPT, a potem wpisywanie pytania.
2. GPT-4o do tłumaczeń w czasie rzeczywistym
Szykuj się, by zabrać GPT-4o na wakacje. Niska latencja mowy w GPT-4o oznacza, że tłumaczenie w czasie rzeczywistym jest teraz możliwe (o ile masz dane w roamingu w swoim planie!). Dzięki temu podróżowanie po krajach, w których nie mówisz w lokalnym języku, właśnie stało się dużo łatwiejsze.
3. Odgrywanie ról z GPT-4o
ChatGPT już był przydatnym narzędziem do scenariuszy odgrywania ról — czy to przygotowania do rozmowy o pracę w wymarzonej karierze w danych, czy treningu zespołu sprzedaży, by lepiej sprzedawał twój produkt.
Dotąd najlepiej sprawdzał się w odgrywaniu ról wyłącznie tekstowych, co nie jest idealne dla tych zastosowań. Ulepszone możliwości mowy sprawiają, że odgrywanie ról w mowie staje się realną opcją.
4. GPT-4o jako wsparcie dla osób z dysfunkcją wzroku
Zdolność GPT-4o do rozumienia wideo z kamery i słownego opisywania sceny może być funkcją niezbędną dla osób słabowidzących. To w zasadzie odpowiednik funkcji audiodeskrypcji z telewizorów — tyle że w prawdziwym życiu.
Praktyka z GPT-4o
Mam dostęp do części nowych funkcji GPT-4o od niedługo po ogłoszeniu (niestety, jeszcze bez czatu głosowego) i wiele odpowiedzi zrobiło na mnie wrażenie. Reakcje wydają się szybsze i bardziej spójne, a model lepiej rozumie moje prośby niż wcześniej. To nie znaczy, że jest idealny.
Oto kilka przykładów moich interakcji z ChatGPT-4o:
Zadanie analizy danych
Najpierw, używając czatu głosowego, zapytałem, czy ma pomysły, jak analizować występy drużyny piłkarskiej, której kibicuję — potężnego Leeds United. Oprócz kilku opcji, podał przykładowy kod w Pythonie:
import pandas as pd
# Sample data for Leeds United's match results
data = {
'Match': ['Match1', 'Match2', 'Match3', 'Match4', 'Match5'],
'Result': ['Win', 'Draw', 'Loss', 'Win', 'Win'],
'Goals Scored': [2, 1, 0, 3, 2]
}
# Create a DataFrame
df = pd.DataFrame(data)
# Summarize match results
summary = df['Result'].value_counts()
total_goals = df['Goals Scored'].sum()
average_goals = df['Goals Scored'].mean()
# Display summary
print("Match Results Summary:")
print(summary)
print("\nTotal Goals Scored:", total_goals)
print("Average Goals Per Match:", round(average_goals, 2))

Jednak gdy dopytałem o ten wątek, zaczęły się drobne problemy. Najpierw poprosiłem o prawdziwe dane do użycia — przeszukał sieć i znalazł dwa dobre źródła, ale błędnie zrelacjonował statystyki. Leeds rozegrało 46 meczów w sezonie zasadniczym, strzelając 81 bramek i mając bilans +38, a nie 40 meczów, jak podał.
Potem poprosiłem ChatGPT o wizualizację goli strzelonych przeciwko każdej drużynie:

Znów zadanie wykonane połowicznie. Stworzył wizualizację zgodnie z prośbą i na pierwszy rzut oka wygląda ok. W rzeczywistości jednak dużo danych jest zmyślonych i niedokładnych (powtarzające się zespoły, brak zliczonych bramek, drużyny spoza tej samej ligi co Leeds).
Uczciwie mówiąc, pewnie byłoby lepiej, gdybym sam dostarczył pełny zbiór danych, ale wolałbym, żeby to powiedział, zamiast pewnym tonem zmyślać odpowiedzi.
Analiza obrazu
Następnie poprosiłem GPT-4o o analizę zdjęcia jednej z moich roślin. Nadal nie mam dostępu do zintegrowanej wizji, więc musiałem zrobić zdjęcie i zapytać ChatGPT, co to za roślina:

To niezły wynik, choć nie do końca trafny. To co prawda bonsai, ale Ilex crenata, a nie Carmona retusa. Obie wyglądają jednak dość podobnie, więc łatwo o pomyłkę, a doceniłem dodatkowy kontekst o pielęgnacji.
Generowanie obrazu
Na koniec chciałem sprawdzić możliwości obrazowe nowego modelu. Najpierw pokazałem mu zdjęcie mojego żółwia, Darwina, i poprosiłem, by opowiedział mi o moim przyjacielu:

Znów blisko, ale nie idealnie. Darwin to w rzeczywistości żółw stepowy (Horsefield), a nie żółw grecki (Hermann), ale są do siebie bardzo podobne. Potem poprosiłem ChatGPT-4o, by wziął oryginalny obraz i odtworzył go w stylu Hokusai. Oto wynik:

Całkiem dobra próba, choć do oryginału niewiele podobny — ale to w sumie zrozumiałe. Wygenerowanie też chwilę zajęło.
Ogólnie byłem jednak pod wrażeniem responsywności nowego modelu i tego, jak dobrze rozumiał moje prośby. Do ideału daleko i czasem z przekonaniem halucynuje, ale nie mogę się doczekać pracy z ulepszoną mową i zintegrowaną wizją.
Ograniczenia i ryzyka GPT-4o
Regulacje dla generatywnej SI są wciąż na wczesnym etapie; AI Act UE to jak dotąd jedyny godny uwagi framework prawny. To oznacza, że firmy tworzące SI muszą same podejmować część decyzji, co stanowi bezpieczną SI.
OpenAI ma ramy gotowości, których używa do oceny, czy nowy model nadaje się do publicznego wydania.
Ramy testują cztery obszary obaw.
- Cyberbezpieczeństwo. Czy SI może zwiększyć produktywność cyberprzestępców i pomagać w tworzeniu exploitów?
- BCRN. Czy SI może pomagać ekspertom w tworzeniu zagrożeń biologicznych, chemicznych, radiologicznych lub jądrowych?
- Perswazja. Czy SI może tworzyć (potencjalnie interaktywne) treści, które przekonują ludzi do zmiany przekonań?
- Autonomia modelu. Czy SI może działać jak agent, wykonując akcje z innym oprogramowaniem?
Każdy obszar obaw jest oceniany jako Niski, Średni, Wysoki lub Krytyczny, a wynik modelu to najwyższa z ocen w czterech kategoriach.
OpenAI obiecuje nie wydawać modelu o krytycznym poziomie obaw, choć to względnie nisko ustawiona poprzeczka bezpieczeństwa: w ich definicji „krytyczny” odpowiada czemuś, co wywróciłoby ludzką cywilizację do góry nogami. GPT-4o spokojnie tego unika, uzyskując poziom Średni.
Niedoskonałe wyniki
Jak w przypadku wszystkich generatywnych SI, model nie zawsze zachowuje się zgodnie z intencją. Wizja komputerowa nie jest idealna, więc interpretacje obrazów czy wideo nie są gwarantowane.
Podobnie transkrypcje mowy rzadko są w 100% poprawne, zwłaszcza gdy mówca ma silny akcent lub używa specjalistycznego słownictwa.
OpenAI udostępniło wideo z wpadkami, gdzie GPT-4o nie zadziałał zgodnie z oczekiwaniami.
W szczególności porażką okazało się tłumaczenie między dwoma językami nieangielskimi. Inne problemy obejmowały nieodpowiedni ton (protekcjonalny) i mówienie w niewłaściwym języku.
Przyspieszone ryzyko głosowych deepfake’ów
W ogłoszeniu OpenAI zauważa: „Zdajemy sobie sprawę, że modalności audio GPT-4o niosą różne nowe ryzyka”. Pod wieloma względami GPT-4o może przyspieszyć wzrost oszustw z użyciem deepfake’ów głosowych, gdzie SI podszywa się pod celebrytów, polityków oraz bliskich. To problem, który pogorszy się, zanim zostanie rozwiązany, a GPT-4o ma moc, by uczynić takie oszustwa jeszcze bardziej przekonującymi.
Aby ograniczyć to ryzyko, wyjście audio jest dostępne tylko w wybranym zestawie z góry ustalonych głosów.
Przypuszczalnie technicznie obyci oszuści mogą używać GPT-4o do generowania tekstu, a potem skorzystać z własnego modelu text-to-speech, choć nie wiadomo, czy nadal zyskają na tym niską latencję i niuanse tonu głosu, które oferuje GPT-4o.
Data wydania GPT-4o
Na 19 lipca 2024 r. wiele funkcji GPT-4o jest stopniowo wdrażanych. Możliwości tekstowe i obrazowe zostały dodane dla wielu użytkowników planów Plus i darmowego, w tym korzystających z ChatGPT w przeglądarkach mobilnych. Podobnie funkcje tekstu i wizji GPT-4o są już dostępne przez API.
Te funkcje GPT-4o są szeroko dostępne w aplikacjach mobilnych na iOS i Androidzie. Wciąż jednak czekamy na nowy tryb głosowy, który zostanie zaktualizowany do użycia GPT-4o, API doda możliwości audio i wideo dla GPT-4o, a nowy model będzie dostępny na komputerach Mac. Dostęp do tego ostatniego jest również stopniowo wdrażany dla użytkowników Plus, a aplikacja desktopowa dla Windows jest planowana na późniejszy czas w tym roku.
Poniżej podsumowanie dat wydania GPT-4o:
- Ogłoszenie GPT-4o: 13 maja 2024
- Wdrożenie możliwości tekstu i obrazu GPT-4o: od 13 maja 2024
- Dostępność GPT-4o w warstwie bezpłatnej i dla użytkowników Plus: od 13 maja 2024
- Dostęp przez API do GPT-4o (tekst i wizja): od 13 maja 2024
- Dostępność GPT-4o na Mac desktop dla użytkowników Plus: nadchodzące tygodnie (od 13 maja 2024)
- Nowa wersja trybu głosowego z GPT-4o w alfie: nadchodzące tygodnie/miesiące (po 13 maja 2024)
- Wsparcie API dla możliwości audio i wideo: nadchodzące tygodnie/miesiące (po 13 maja 2024)
- GPT-4o mini: 18 lipca 2024
Jednak po kontrowersjach wywołanych demem nowych możliwości głosowych wygląda na to, że OpenAI ostrożnie podchodzi do wydania. Według zaktualizowanego wpisu na blogu, 'W nadchodzących tygodniach i miesiącach będziemy pracować nad infrastrukturą techniczną, użytecznością poprzez post-training oraz bezpieczeństwem niezbędnym do wydania pozostałych modalności. Na przykład na starcie wyjścia audio będą ograniczone do wyboru z zestawu z góry ustalonych głosów i będą przestrzegać naszych obecnych zasad bezpieczeństwa.'
Ile kosztuje GPT-4o?
Mimo że jest szybszy niż GPT-4 Turbo i ma lepsze możliwości wizji, GPT-4o będzie około 50% tańszy od poprzednika. Według strony OpenAI korzystanie z modelu kosztuje 5 USD za milion tokenów wejścia i 15 USD za milion tokenów wyjścia.
Jak uzyskać dostęp do GPT-4o w wersji webowej ChatGPT?
Interfejs ChatGPT uległ zmianie. Wszystkie wiadomości w ChatGPT domyślnie używają GPT-4o, a model można zmienić na GPT-3.5 przełącznikiem pod odpowiedzią.
Co GPT-4o oznacza dla przyszłości?
Są dwa nurty myślenia o kierunku rozwoju SI. Jeden mówi, że SI powinna być coraz potężniejsza i wykonywać coraz szerszy zakres zadań. Drugi — że SI powinna coraz lepiej rozwiązywać konkretne zadania jak najtaniej.
Misja OpenAI, by stworzyć sztuczną inteligencję ogólną (AGI), a także jej model biznesowy, stawia ją wyraźnie w tym pierwszym obozie. GPT-4o to kolejny krok w kierunku coraz potężniejszej SI.
To pierwsza generacja zupełnie nowej architektury modelu dla OpenAI. Oznacza to, że firma ma wiele do nauczenia się i zoptymalizowania w najbliższych miesiącach.
Krótkoterminowo spodziewaj się nowych rodzajów dziwactw i halucynacji, a długoterminowo — poprawy wydajności, zarówno pod względem szybkości, jak i jakości wyników.
Ciekawy jest moment premiery GPT-4o. W chwili, gdy giganci technologiczni zorientowali się, że Siri, Alexa czy Google Assistant nie są takimi maszynkami do pieniędzy, jak liczyli, OpenAI chce znów uczynić SI rozmowną. W najlepszym wypadku przyniesie to falę nowych zastosowań generatywnej SI. W najgorszym — możesz teraz ustawić timer w dowolnym języku.
Wnioski
GPT-4o to kolejny krok naprzód w generatywnej SI, łączący przetwarzanie tekstu, dźwięku i obrazu w jednym wydajnym modelu. Ta innowacja obiecuje szybsze odpowiedzi, bogatsze interakcje i szerszy wachlarz zastosowań — od tłumaczeń w czasie rzeczywistym po lepszą analizę danych i zwiększoną dostępność dla osób z dysfunkcją wzroku.
Choć istnieją początkowe ograniczenia i ryzyka, takie jak potencjalne nadużycia w oszustwach deepfake i potrzeba dalszej optymalizacji, GPT-4o to kolejny krok w stronę celu OpenAI, jakim jest AGI. Wraz z rosnącą dostępnością GPT-4o może zmienić sposób interakcji z SI, integrując się z codziennymi i zawodowymi zadaniami.
Dzięki niższym kosztom i rozszerzonym możliwościom GPT-4o może wyznaczyć nowy standard w branży AI, poszerzając możliwości użytkowników w różnych dziedzinach.
Przyszłość AI zapowiada się ekscytująco — to dobry moment, by zacząć poznawać, jak działa ta technologia. Jeśli dopiero zaczynasz, zacznij od naszego ścieżki umiejętności AI Fundamentals, która obejmuje praktyczną wiedzę o takich tematach jak ChatGPT, duże modele językowe, generatywna AI i więcej. Możesz też dowiedzieć się więcej o pracy z OpenAI API na naszym kursie praktycznym lub zajrzeć do pełnego katalogu kursów AI.
FAQ
Czy GPT-4o poradzi sobie z rozmowami wielojęzycznymi?
Tak, GPT-4o potrafi prowadzić wielojęzyczne rozmowy, zapewniając tłumaczenie w czasie rzeczywistym między językami dzięki niskiej latencji mowy. Jednak w demonstracji pojawiały się błędy podczas przetwarzania tłumaczeń.
Czy GPT-4o obsługuje wszystkie języki jednakowo dobrze?
Choć GPT-4o ma ulepszoną tokenizację dla alfabetów nieromańskich, wydajność może się różnić między językami, zwłaszcza słabiej reprezentowanymi w danych treningowych.
Jak GPT-4o radzi sobie z hałasem w tle w wejściu audio?
GPT-4o może brać pod uwagę dźwięki tła podczas przetwarzania wejścia audio, co może prowadzić do bardziej kontekstowych odpowiedzi.
Czy GPT-4o potrafi generować treści wideo?
Nie, GPT-4o potrafi analizować i opisywać treści wideo, ale nie generuje nowego wideo. Sora od OpenAI to model, który potrafi generować wideo.
Czy GPT-4o może naśladować konkretne głosy?
Nie, GPT-4o używa wyboru z zestawu z góry ustalonych głosów dla wyjścia audio, by ograniczyć ryzyka, takie jak oszustwa z użyciem deepfake’ów.
Na ile bezpieczne są dane wprowadzane do GPT-4o?
OpenAI stosuje rygorystyczne środki bezpieczeństwa, ale użytkownicy zawsze powinni zachować ostrożność i nie udostępniać wrażliwych informacji.
Czy GPT-4o można zintegrować z istniejącymi aplikacjami?
Tak, GPT-4o można integrować z różnymi aplikacjami przez OpenAI API, co umożliwia rozszerzone funkcje na wielu platformach.
Sprawdź nasz kurs Working with the OpenAI API, aby rozpocząć tworzenie aplikacji zasilanych AI.
Kiedy użyć GPT-4o Mini zamiast GPT-4o?
GPT-4o Mini jest idealny do zadań, w których priorytetem są szybkość i efektywność, a nie złożone rozumowanie czy interakcje multimodalne. Świetnie sprawdzi się przy prostych zadaniach kodowania, debugowania lub szybkich odpowiedziach w lekkich aplikacjach — to opłacalna alternatywa tam, gdzie nie potrzeba pełnej mocy GPT-4o.
Czym różnią się GPT-4o i model o1?
GPT-4o jest zaprojektowany do zadań multimodalnych, sprawnie obsługuje wejścia tekstowe, dźwiękowe i wizualne. Model o1 koncentruje się natomiast na zaawansowanym rozumowaniu i złożonym rozwiązywaniu problemów, świetnie sprawdzając się w dziedzinach takich jak kodowanie i nauki ścisłe. GPT-4o oferuje wszechstronność i szybkość, a o1 priorytetyzuje głębokie, logiczne przetwarzanie w złożonych zadaniach rozumowania.