Courses
OpenAI đã công bố mô hình ngôn ngữ lớn mới nhất của mình, GPT-4o, thế hệ kế nhiệm GPT-4 Turbo. Hãy tiếp tục đọc để khám phá năng lực, hiệu năng và cách bạn có thể sử dụng nó.
GPT-4o của OpenAI là gì?
GPT-4o là LLM mới nhất của OpenAI. Chữ ‘o’ trong GPT-4o là viết tắt của "omni"—tiếng Latinh nghĩa là "mọi"—ám chỉ việc mô hình mới này có thể nhận các lời nhắc là sự kết hợp của văn bản, âm thanh, hình ảnh và video. Trước đây, giao diện ChatGPT dùng các mô hình riêng cho từng loại nội dung.
Ví dụ, khi trò chuyện với ChatGPT qua Chế độ thoại, giọng nói của bạn sẽ được chuyển thành văn bản bằng Whisper, phản hồi văn bản được tạo bằng GPT-4 Turbo, và phản hồi văn bản đó sẽ được chuyển thành giọng nói bằng TTS.

So sánh cách GPT-4 Turbo và GPT-4o xử lý đầu vào bằng giọng nói
Tương tự, làm việc với hình ảnh trong ChatGPT liên quan đến sự kết hợp giữa GPT-4 Turbo và DALL-E 3.
Việc có một mô hình duy nhất cho các phương tiện nội dung khác nhau hứa hẹn tăng tốc độ và chất lượng kết quả, giao diện đơn giản hơn và một số trường hợp sử dụng mới.
GPT-4o mini là gì?
GPT-4o Mini là phiên bản gọn nhẹ, nhanh hơn của GPT-4o, được thiết kế để xử lý các tác vụ với trọng tâm là tốc độ và hiệu quả. Nó được dẫn xuất từ mô hình GPT-4o lớn hơn thông qua một quy trình gọi là chưng cất.
Mặc dù vẫn giữ được phần lớn khả năng xử lý đầu vào đa phương thức—văn bản, âm thanh và hình ảnh—GPT-4o mini được tối ưu cho các ứng dụng nhẹ, nơi thời gian phản hồi nhanh là yếu tố then chốt.
Nó đặc biệt hữu ích cho nhà phát triển cần giải pháp tiết kiệm chi phí cho việc viết mã, gỡ lỗi và tương tác thời gian thực mà không đòi hỏi toàn bộ sức mạnh tính toán của GPT-4o.
Bạn có thể đọc thêm chi tiết trong bài viết về GPT-4o mini.
Điểm khác biệt giữa GPT-4o và GPT-4 Turbo là gì?
Cách tiếp cận mô hình tất-cả-trong-một có nghĩa là GPT-4o khắc phục một số hạn chế của khả năng tương tác bằng giọng nói trước đây.
1. Giọng điệu đã được tính đến, giúp phản hồi mang tính cảm xúc
Với hệ thống trước đây của OpenAI kết hợp Whisper, GPT-4 Turbo và TTS theo chuỗi, động cơ suy luận GPT-4 chỉ có quyền truy cập vào từ ngữ được nói ra. Cách làm này nghĩa là các yếu tố như ngữ điệu, tiếng ồn nền và nhận biết giọng của nhiều người nói bị loại bỏ. Vì thế, GPT-4 Turbo khó có thể thể hiện phản hồi với cảm xúc hoặc phong cách lời nói khác nhau.
Bằng cách có một mô hình duy nhất có thể suy luận về văn bản và âm thanh, thông tin âm thanh phong phú này có thể được sử dụng để đưa ra phản hồi chất lượng cao hơn với đa dạng phong cách nói hơn.
Trong ví dụ sau do OpenAI cung cấp, GPT-4o đưa ra đầu ra châm biếm.
2. Độ trễ thấp hơn cho phép hội thoại thời gian thực
Chuỗi ba mô hình hiện tại khiến có một độ trễ nhỏ ("latency") giữa lúc bạn nói với ChatGPT và lúc nhận phản hồi.
OpenAI cho biết độ trễ trung bình của Chế độ thoại là 2,8 giây với GPT-3.5 và 5,4 giây với GPT-4. Ngược lại, độ trễ trung bình của GPT-4o là 0,32 giây, nhanh gấp chín lần GPT-3.5 và 17 lần GPT-4.
Độ trễ giảm này gần với thời gian phản hồi trung bình của con người (0,21 giây) và quan trọng đối với các trường hợp hội thoại, nơi có nhiều trao đổi qua lại giữa con người và AI, và các khoảng dừng giữa các phản hồi sẽ cộng dồn.
Tính năng này gợi nhớ đến việc Google ra mắt Instant, tính năng tự động hoàn thành truy vấn tìm kiếm, vào năm 2010. Mặc dù việc tìm kiếm không mất nhiều thời gian, nhưng tiết kiệm được vài giây mỗi lần sử dụng giúp trải nghiệm sản phẩm tốt hơn.
Một trường hợp sử dụng trở nên khả thi hơn với độ trễ giảm của GPT-4o là dịch giọng nói thời gian thực. OpenAI đã trình diễn trường hợp hai đồng nghiệp, một người nói tiếng Anh và người kia nói tiếng Tây Ban Nha, giao tiếp bằng cách nhờ GPT-4o dịch cuộc trò chuyện của họ.
3. Tích hợp thị giác cho phép mô tả luồng hình ảnh từ camera
Ngoài tích hợp giọng nói và văn bản, GPT-4o còn có các tính năng về hình ảnh và video. Điều này có nghĩa là nếu bạn cấp quyền truy cập màn hình máy tính, nó có thể mô tả những gì hiển thị trên màn hình, trả lời câu hỏi về hình ảnh trên màn hình hoặc đóng vai trò đồng hành cho công việc của bạn.
Trong một video từ OpenAI có Sal Khan của Khan Academy, GPT-4o hỗ trợ làm bài tập toán của con trai Sal.
Vượt ra ngoài việc làm việc với màn hình, nếu bạn cho GPT-4o truy cập camera, có thể là điện thoại thông minh của bạn, nó có thể mô tả những gì nó nhìn thấy.
Một bản demo dài hơn do OpenAI trình bày kết hợp tất cả các tính năng này. Hai điện thoại thông minh chạy GPT-4o trò chuyện với nhau. Một GPT có quyền truy cập camera của điện thoại và mô tả những gì nó thấy cho một GPT khác không có khả năng nhìn.
Kết quả là một cuộc trò chuyện ba bên giữa một con người và hai AI. Video cũng bao gồm phần các AI hát, điều mà các mô hình trước đây không thể làm được.
4. Tách từ (tokenization) tốt hơn cho các bảng chữ cái phi La-tinh mang lại tốc độ cao hơn và tiết kiệm chi phí
Một bước trong quy trình LLM là khi văn bản lời nhắc được chuyển thành các token. Đây là những đơn vị văn bản mà mô hình có thể hiểu được.
Trong tiếng Anh, một token thường là một từ hoặc một dấu câu, dù một số từ có thể bị tách thành nhiều token. Trung bình, ba từ tiếng Anh chiếm khoảng bốn token.
Nếu ngôn ngữ có thể được biểu diễn trong mô hình bằng ít token hơn, cần thực hiện ít phép tính hơn và tốc độ tạo văn bản sẽ tăng lên.
Hơn nữa, vì OpenAI tính phí API theo số token đầu vào hoặc đầu ra, ít token hơn đồng nghĩa giá thấp hơn cho người dùng API.
GPT-4o có mô hình tách từ được cải thiện, dẫn đến cần ít token hơn cho mỗi văn bản. Cải thiện này nhận thấy rõ nhất ở các ngôn ngữ không dùng bảng chữ cái La-tinh.
Ví dụ, các ngôn ngữ Ấn Độ đặc biệt được lợi, với Hindi, Marathi, Tamil, Telugu và Gujarati đều giảm số token từ 2,9 đến 4,4 lần. Tiếng Ả Rập giảm 2 lần, và các ngôn ngữ Đông Á như Trung, Nhật, Hàn và Việt giảm từ 1,4 đến 1,7 lần.
5. Triển khai đến gói miễn phí
Với chiến lược giá hiện tại của OpenAI cho ChatGPT, người dùng phải trả phí để truy cập mô hình tốt nhất: GPT-4 Turbo chỉ có trên các gói Plus và Enterprise trả phí.
Điều này đang thay đổi, OpenAI hứa sẽ đưa GPT-4o lên cả gói miễn phí. Người dùng Plus sẽ có số lượng tin nhắn gấp năm lần so với người dùng miễn phí.
Việc triển khai sẽ dần dần, với quyền truy cập cho đội red team (những người thử phá mô hình để tìm vấn đề) bắt đầu ngay lập tức và thêm người dùng được cấp quyền theo thời gian.
6. Ra mắt ứng dụng ChatGPT trên máy tính
Dù không hẳn là cập nhật dành riêng cho GPT-4o, OpenAI cũng công bố phát hành ứng dụng ChatGPT dành cho máy tính. Những cập nhật về độ trễ và đa phương thức nêu trên, cùng với việc phát hành ứng dụng, có nghĩa là cách chúng ta làm việc với ChatGPT có khả năng sẽ thay đổi. Ví dụ, OpenAI đã trình diễn quy trình lập trình tăng cường dùng giọng nói và ứng dụng ChatGPT trên máy tính. Kéo xuống phần trường hợp sử dụng để xem ví dụ đó!
GPT-4o hoạt động như thế nào?
Nhiều loại nội dung, một mạng nơ-ron
Chi tiết về cách GPT-4o hoạt động vẫn còn khan hiếm. Thông tin duy nhất OpenAI cung cấp trong thông báo là GPT-4o là một mạng nơ-ron duy nhất được huấn luyện trên đầu vào văn bản, thị giác và âm thanh.
Cách tiếp cận mới này khác với kỹ thuật trước đây là có các mô hình riêng được huấn luyện trên các loại dữ liệu khác nhau.
Tuy nhiên, GPT-4o không phải là mô hình đầu tiên theo đuổi hướng đa phương thức. Năm 2022, TenCent Lab tạo ra SkillNet, một mô hình kết hợp đặc trưng transformer của LLM với kỹ thuật thị giác máy tính để cải thiện khả năng nhận diện chữ Hán.
Năm 2023, một nhóm từ ETH Zurich, MIT và Stanford tạo ra WhisBERT, một biến thể của dòng mô hình ngôn ngữ lớn BERT. Dù không phải đầu tiên, GPT-4o tham vọng và mạnh mẽ hơn đáng kể so với hai nỗ lực trước đó.
GPT-4o có thay đổi đột phá so với GPT-4 Turbo không?
Mức độ đột phá của kiến trúc GPT-4o so với GPT-4 Turbo phụ thuộc vào việc bạn hỏi đội kỹ thuật hay đội tiếp thị của OpenAI. Vào tháng Tư, một bot tên "im-also-a-good-gpt2-chatbot" xuất hiện trên Chatbot Arena của LMSYS, bảng xếp hạng các AI sinh sinh tốt nhất. AI bí ẩn đó nay đã được tiết lộ là GPT-4o.
Phần "gpt2" trong tên là quan trọng. Không nhầm với GPT-2, tiền nhiệm của GPT-3.5 và GPT-4, hậu tố "2" được nhiều người xem là ám chỉ một kiến trúc hoàn toàn mới cho dòng mô hình GPT.
Rõ ràng, ai đó trong nhóm nghiên cứu hoặc kỹ thuật của OpenAI cho rằng việc kết hợp văn bản, thị giác và âm thanh vào một mô hình duy nhất là thay đổi đủ lớn để xứng đáng với cú nhảy số phiên bản đầu tiên trong sáu năm.
Mặt khác, đội tiếp thị đã chọn cách đổi tên tương đối khiêm tốn, tiếp tục quy ước "GPT-4".
Hiệu năng GPT-4o so với các mô hình khác
OpenAI đã công bố số liệu điểm chuẩn của GPT-4o so với một số mô hình cao cấp khác.
- GPT-4 Turbo
- GPT-4 (bản phát hành đầu)
- Claude 3 Opus
- Gemini Pro 1.5
- Gemini Ultra 1.0
- Llama 3 400B
Trong số này, chỉ có ba mô hình thực sự quan trọng để so sánh. GPT-4 Turbo, Claude 3 Opus và Gemini Pro 1.5 đã dành vài tháng qua để tranh vị trí dẫn đầu trên bảng xếp hạng LMSYS Chatbot Arena.
Llama 3 400B có thể là đối thủ trong tương lai, nhưng chưa hoàn thiện. Vì vậy, ở đây, chúng tôi chỉ trình bày kết quả cho ba mô hình này và GPT-4o.
Kết quả của sáu bộ điểm chuẩn đã được sử dụng.
- Massive Multitask Language Understanding (MMLU). Các nhiệm vụ về toán học sơ cấp, lịch sử Hoa Kỳ, khoa học máy tính, luật, và hơn thế. Để đạt độ chính xác cao, mô hình phải có kiến thức thế giới sâu rộng và năng lực giải quyết vấn đề.
- Graduate-Level Google-Proof Q&A (GPQA). Câu hỏi trắc nghiệm do chuyên gia trong sinh học, vật lý, và hóa học biên soạn. Câu hỏi chất lượng cao và cực khó: các chuyên gia có hoặc đang làm nghiên cứu sinh tiến sĩ ở lĩnh vực tương ứng đạt độ chính xác 74%.
- MATH. Bài toán toán học cấp 2 và cấp 3.
- HumanEval. Kiểm tra tính đúng đắn chức năng của mã máy tính, dùng để đánh giá sinh mã.
- Multilingual Grade School Math (MSGM). Bài toán toán học tiểu học, được dịch sang mười ngôn ngữ, bao gồm cả ngôn ngữ ít được đại diện như tiếng Bengal và Swahili.
- Discrete Reasoning Over Paragraphs (DROP). Câu hỏi đòi hỏi hiểu toàn bộ đoạn văn. Ví dụ, bằng cách cộng, đếm hoặc sắp xếp các giá trị rải rác qua nhiều câu.

Hiệu năng của GPT-4o, GPT-4 Turbo, Gemini Pro 1.5 và Claude 3 Opus trên sáu bộ điểm chuẩn LLM. Điểm cho mỗi bộ dao động từ 0 đến 100. Tái tạo từ dữ liệu do OpenAI cung cấp. Không có dữ liệu cho Gemini Pro 1.5 ở bộ điểm GPQA.
GPT-4o đạt điểm cao nhất ở bốn bộ điểm chuẩn, dù bị Claude 3 Opus vượt ở MSGM và GPT-4 Turbo vượt ở DROP. Nhìn chung, hiệu năng này ấn tượng và cho thấy triển vọng cho cách tiếp cận huấn luyện đa phương thức mới.
Nếu bạn nhìn kỹ các con số của GPT-4o so với GPT-4 Turbo, bạn sẽ thấy mức tăng hiệu năng chỉ vài điểm phần trăm.
Đó là cú hích ấn tượng sau một năm, nhưng còn xa mới bằng các cú nhảy ngoạn mục từ GPT-1 lên GPT-2 hoặc GPT-2 lên GPT-3.
Việc tốt hơn 10% trong suy luận văn bản theo năm có lẽ sẽ trở thành bình thường mới. Trái thấp đã hái hết, và rất khó để tiếp tục với những bước nhảy lớn trong suy luận văn bản.
Mặt khác, những bộ điểm chuẩn LLM này không đo được hiệu năng AI trên các bài toán đa phương thức. Khái niệm này còn mới đến mức chúng ta chưa có cách đánh giá tốt về mức độ giỏi của mô hình trên văn bản, âm thanh và thị giác.
Tổng thể, hiệu năng của GPT-4o rất ấn tượng và cho thấy triển vọng cho cách tiếp cận huấn luyện đa phương thức.
Các trường hợp sử dụng GPT-4o là gì?
1. GPT-4o cho phân tích dữ liệu & tác vụ lập trình
Các mô hình GPT gần đây và dẫn xuất của chúng, như GitHub Copilot, đã có khả năng hỗ trợ mã, bao gồm viết mã và giải thích, sửa lỗi. Khả năng đa phương thức của GPT-4o mở ra một số cơ hội thú vị.
Trong một video quảng bá do CTO OpenAI Mira Murati dẫn, hai nhà nghiên cứu của OpenAI, Mark Chen và Barret Zoph, đã trình diễn việc dùng GPT-4o để làm việc với một số mã Python.
Mã được chia sẻ với GPT dưới dạng văn bản, và tính năng tương tác bằng giọng nói được dùng để nhờ GPT giải thích mã. Sau đó, sau khi chạy mã, khả năng thị giác của GPT-4o được dùng để giải thích biểu đồ.
Nhìn chung, cho ChatGPT xem màn hình của bạn và nói câu hỏi có thể là quy trình đơn giản hơn so với lưu biểu đồ thành tệp ảnh, tải lên ChatGPT, rồi gõ câu hỏi.
2. GPT-4o cho dịch thời gian thực
Hãy sẵn sàng mang GPT-4o đi du lịch. Khả năng giọng nói có độ trễ thấp của GPT-4o đồng nghĩa dịch thời gian thực giờ đã khả thi (miễn là bạn có dữ liệu chuyển vùng trong gói điện thoại!). Điều này có nghĩa là việc đi lại ở những quốc gia nơi bạn không nói ngôn ngữ bản địa sẽ dễ dàng hơn nhiều.
3. Nhập vai (roleplay) với GPT-4o
ChatGPT vốn đã là công cụ hữu ích cho các kịch bản nhập vai, dù bạn đang chuẩn bị phỏng vấn cho công việc mơ ước trong lĩnh vực dữ liệu hay huấn luyện đội ngũ bán hàng bán hàng tốt hơn.
Cho đến nay, nó hoạt động tốt nhất với các màn nhập vai chỉ văn bản, điều này không lý tưởng cho những trường hợp sử dụng đó. Khả năng giọng nói được cải thiện đồng nghĩa nhập vai bằng lời nói giờ là lựa chọn khả thi.
4. GPT-4o hỗ trợ người khiếm thị
Khả năng của GPT-4o trong việc hiểu đầu vào video từ camera và mô tả bằng lời có thể là tính năng không thể thiếu cho người khiếm thị. Về bản chất, đó là tính năng thuyết minh âm thanh mà TV có, nhưng cho đời thực.
Trải nghiệm thực tế với GPT-4o
Tôi đã có quyền truy cập một số tính năng mới của GPT-4o ngay sau khi công bố (đáng tiếc là chưa có trò chuyện bằng giọng nói), và tôi ấn tượng với nhiều đầu ra của nó. Phản hồi có vẻ nhanh và nhất quán hơn, và có vẻ hiểu yêu cầu của tôi tốt hơn trước. Dẫu vậy, không phải lúc nào nó cũng hoàn hảo.
Dưới đây là một số ví dụ về tương tác tôi có với ChatGPT-4o:
Bài toán phân tích dữ liệu
Đầu tiên, sử dụng trò chuyện bằng giọng nói, tôi hỏi liệu nó có ý tưởng nào về cách phân tích phong độ của đội bóng tôi hâm mộ, Leeds United hùng mạnh. Bên cạnh việc đưa ra vài phương án, nó còn đưa ví dụ mã Python:
import pandas as pd
# Sample data for Leeds United's match results
data = {
'Match': ['Match1', 'Match2', 'Match3', 'Match4', 'Match5'],
'Result': ['Win', 'Draw', 'Loss', 'Win', 'Win'],
'Goals Scored': [2, 1, 0, 3, 2]
}
# Create a DataFrame
df = pd.DataFrame(data)
# Summarize match results
summary = df['Result'].value_counts()
total_goals = df['Goals Scored'].sum()
average_goals = df['Goals Scored'].mean()
# Display summary
print("Match Results Summary:")
print(summary)
print("\nTotal Goals Scored:", total_goals)
print("Average Goals Per Match:", round(average_goals, 2))

Tuy nhiên, khi tôi đào sâu hơn theo hướng này, mọi thứ hơi lệch. Tôi đầu tiên yêu cầu một số dữ liệu thực tế để dùng - nó tìm web và thấy hai nguồn tốt, nhưng lại báo cáo sai thống kê. Leeds đã chơi 46 trận ở mùa giải thường niên, ghi 81 bàn với hiệu số +38, trái với 40 trận mà nó nêu trong phản hồi.
Sau đó tôi yêu cầu ChatGPT trực quan hóa số bàn thắng ghi được trước mỗi đội:

Lần nữa, nó chỉ hoàn thành nửa chừng. Nó đã tạo trực quan hóa theo yêu cầu, nhìn bề ngoài ổn. Nhưng thực tế, nhiều dữ liệu bị bịa và không chính xác (đội xuất hiện hai lần, không đếm bàn thắng, và có đội không cùng hạng đấu với Leeds).
Công bằng mà nói, tôi hình dung hiệu năng sẽ tốt hơn nếu tôi tự cung cấp bộ dữ liệu đầy đủ, nhưng tôi ước nó nói rõ điều đó thay vì tự tin bịa đáp án.
Phân tích hình ảnh
Tiếp theo, tôi yêu cầu GPT-4o phân tích ảnh một cây cảnh của tôi. Tôi vẫn chưa có quyền truy cập tính năng thị giác tích hợp, nên tôi phải chụp ảnh và hỏi ChatGPT đó là cây gì:

Không tệ, dù chưa hoàn toàn chính xác. Dù đúng là cây bonsai, nhưng đó là Ilex crenata chứ không phải Carmona retusa. Dù vậy, hai loại trông khá giống nhau nên cũng dễ nhầm, và tôi đánh giá cao phần ngữ cảnh thêm về cách chăm cây.
Tạo hình ảnh
Cuối cùng, tôi muốn thử khả năng hình ảnh của mô hình mới. Tôi đầu tiên cho nó xem ảnh chú rùa cưng Darwin và yêu cầu nó kể về người bạn của tôi:

Lại một lần nữa, gần đúng nhưng chưa chuẩn. Darwin thực ra là rùa Horsefield chứ không phải Hermann’s, nhưng chúng trông rất giống. Sau đó tôi yêu cầu ChatGPT-4o lấy ảnh gốc và tái tạo theo phong cách Hokusai. Đây là kết quả:

Một nỗ lực khá tốt, dù không giống nhiều với ảnh gốc, nhưng có lẽ vậy cũng hợp lý. Mất hơi lâu để tạo tấm này.
Tổng thể, tôi ấn tượng với độ phản hồi của mô hình mới và mức độ hiểu yêu cầu của tôi. Còn xa mới hoàn hảo, và đôi lúc vẫn tự tin "ảo giác", nhưng tôi nóng lòng được trải nghiệm thực tế với giọng nói cải thiện và thị giác tích hợp.
Hạn chế & rủi ro của GPT-4o
Quy định cho AI sinh sinh vẫn ở giai đoạn đầu; Đạo luật AI của EU là khung pháp lý đáng chú ý duy nhất đến nay. Điều đó có nghĩa các công ty tạo AI cần tự đưa ra một số quyết định về việc thế nào là AI an toàn.
OpenAI có khung sẵn sàng để xác định liệu một mô hình mới có phù hợp phát hành công khai hay không.
Khung này kiểm tra bốn mối quan ngại.
- An ninh mạng. AI có thể tăng năng suất tội phạm mạng và giúp tạo lỗ hổng khai thác không?
- BCRN. AI có thể hỗ trợ chuyên gia tạo ra mối đe dọa sinh học, hóa học, phóng xạ hoặc hạt nhân không?
- Thuyết phục. AI có thể tạo nội dung (có thể tương tác) thuyết phục người khác thay đổi niềm tin không?
- Tính tự chủ của mô hình. AI có thể hoạt động như một tác nhân, thực hiện hành động với phần mềm khác không?
Mỗi mối quan ngại được chấm Low, Medium, High hoặc Critical, và điểm của mô hình là mức cao nhất trong bốn hạng mục.
OpenAI hứa không phát hành mô hình ở mức lo ngại nghiêm trọng (Critical), dù đây là ngưỡng an toàn tương đối thấp: theo định nghĩa của họ, mức Critical tương ứng với điều gì đó làm đảo lộn nền văn minh loài người. GPT-4o tránh được điều này một cách thoải mái, đạt mức lo ngại Trung bình (Medium).
Đầu ra chưa hoàn hảo
Như mọi AI sinh sinh, mô hình không phải lúc nào cũng hành xử như dự định. Thị giác máy tính không hoàn hảo, nên diễn giải về một hình ảnh hay video không được đảm bảo chính xác.
Tương tự, phiên âm giọng nói hiếm khi chính xác 100%, đặc biệt nếu người nói có giọng địa phương mạnh hoặc dùng từ kỹ thuật.
OpenAI cung cấp một video các cảnh hỏng nơi GPT-4o không hoạt động như mong muốn.
Đáng chú ý, dịch giữa hai ngôn ngữ không phải tiếng Anh là một trong các trường hợp nó thất bại. Vấn đề khác gồm giọng điệu không phù hợp (kiểu trịch thượng) và nói sai ngôn ngữ.
Rủi ro deepfake âm thanh gia tăng
Thông báo của OpenAI lưu ý rằng "Chúng tôi nhận thấy các mô thức âm thanh của GPT-4o đưa ra nhiều rủi ro mới." Ở nhiều khía cạnh, GPT-4o có thể thúc đẩy sự gia tăng của cuộc gọi lừa đảo deepfake, nơi AI giả mạo giọng nói người nổi tiếng, chính trị gia và bạn bè, người thân của mọi người. Đây là vấn đề sẽ còn tệ hơn trước khi được giải quyết, và GPT-4o có sức mạnh khiến các cuộc gọi lừa đảo deepfake thêm thuyết phục.
Để giảm thiểu rủi ro này, đầu ra âm thanh chỉ có sẵn bằng một số giọng đọc cài sẵn.
Nhiều khả năng, những kẻ lừa đảo am hiểu kỹ thuật có thể dùng GPT-4o để tạo đầu ra văn bản rồi dùng mô hình chuyển văn bản thành giọng nói riêng, dù chưa rõ liệu cách đó còn giữ được lợi thế về độ trễ và ngữ điệu mà GPT-4o mang lại hay không.
Ngày phát hành GPT-4o
Tính đến ngày 19 tháng 7 năm 2024, nhiều tính năng của GPT-4o đã được triển khai dần. Khả năng văn bản và hình ảnh đã được bổ sung cho nhiều người dùng ở gói Plus và miễn phí. Điều này bao gồm cả ChatGPT truy cập trên trình duyệt di động. Tương tự, tính năng văn bản và thị giác của GPT-4o đã có sẵn qua API.
Những tính năng này của GPT-4o đã khả dụng rộng rãi trên ứng dụng di động iOS và Android. Tuy nhiên, chúng ta vẫn đang chờ Chế độ thoại mới, sẽ được cập nhật để dùng GPT-4o; API sẽ bổ sung khả năng âm thanh và video cho GPT-4o; và mô hình mới sẽ có trên máy tính Mac. Quyền truy cập cái sau cũng đang được triển khai dần cho người dùng Plus, và ứng dụng máy tính cho Windows dự kiến ra mắt vào cuối năm nay.
Dưới đây là tóm tắt các mốc phát hành GPT-4o:
- Công bố GPT-4o: 13 tháng 5, 2024
- Triển khai khả năng văn bản và hình ảnh của GPT-4o: Bắt đầu từ 13 tháng 5, 2024
- GPT-4o khả dụng cho tầng miễn phí và người dùng Plus: Bắt đầu từ 13 tháng 5, 2024
- Truy cập API cho GPT-4o (văn bản và thị giác): Bắt đầu từ 13 tháng 5, 2024
- GPT-4o khả dụng trên máy tính Mac cho người dùng Plus: Trong vài tuần (bắt đầu 13 tháng 5, 2024)
- Phiên bản mới của Chế độ thoại với GPT-4o ở giai đoạn alpha: Trong vài tuần/tháng (sau 13 tháng 5, 2024)
- Hỗ trợ API cho khả năng âm thanh và video: Trong vài tuần/tháng (sau 13 tháng 5, 2024)
- GPT-4o mini: 18 tháng 7, 2024
Tuy nhiên, sau tranh cãi do bản demo khả năng giọng nói mới gây ra, có vẻ OpenAI đang thận trọng với việc phát hành. Theo blog cập nhật của họ, 'Trong những tuần và tháng tới, chúng tôi sẽ làm việc trên hạ tầng kỹ thuật, khả năng sử dụng thông qua hậu huấn luyện, và các biện pháp an toàn cần thiết để phát hành các mô thức khác. Ví dụ, khi ra mắt, đầu ra âm thanh sẽ bị giới hạn ở một số giọng đọc cài sẵn và tuân theo các chính sách an toàn hiện có.'
GPT-4o có giá bao nhiêu?
Dù nhanh hơn GPT-4 Turbo với khả năng thị giác tốt hơn, GPT-4o sẽ rẻ hơn khoảng 50% so với tiền nhiệm. Theo trang web OpenAI, dùng mô hình này sẽ có giá 5 USD mỗi triệu token đầu vào và 15 USD mỗi triệu token đầu ra.
Tôi có thể truy cập GPT-4o trong phiên bản web của ChatGPT như thế nào?
Giao diện người dùng của ChatGPT đã thay đổi. Tất cả tin nhắn trong ChatGPT mặc định dùng GPT-4o, và có thể chuyển sang GPT-3.5 bằng một nút gạt phía dưới phản hồi.
GPT-4o mang ý nghĩa gì cho tương lai?
Có hai trường phái về hướng đi của AI. Một là AI nên ngày càng mạnh hơn và có thể hoàn thành dải nhiệm vụ rộng hơn. Hai là AI nên giỏi hơn trong việc giải các tác vụ cụ thể với chi phí thấp nhất có thể.
Sứ mệnh của OpenAI là tạo ra trí tuệ nhân tạo tổng quát (AGI), cũng như mô hình kinh doanh của họ, đặt công ty vào trường phái thứ nhất. GPT-4o là một bước nữa hướng tới mục tiêu AI ngày càng mạnh mẽ.
Đây là thế hệ đầu tiên của một kiến trúc mô hình hoàn toàn mới đối với OpenAI. Điều đó nghĩa là còn nhiều điều để công ty học hỏi và tối ưu trong những tháng tới.
Ngắn hạn, hãy kỳ vọng các dạng lỗi và ảo giác mới; dài hạn, kỳ vọng cải thiện hiệu năng, cả về tốc độ và chất lượng đầu ra.
Thời điểm ra mắt GPT-4o thật thú vị. Đúng lúc các gã khổng lồ công nghệ nhận ra rằng Siri, Alexa và Google Assistant không còn là cỗ máy in tiền như từng kỳ vọng, OpenAI hy vọng khiến AI trở nên “biết nói” trở lại. Trong kịch bản tốt nhất, điều này sẽ mang đến hàng loạt trường hợp sử dụng mới cho AI sinh sinh. Tối thiểu, giờ bạn có thể đặt hẹn giờ bằng bất cứ ngôn ngữ nào bạn thích.
Kết luận
GPT-4o thể hiện bước tiến mới trong AI sinh sinh, kết hợp xử lý văn bản, âm thanh và hình ảnh trong một mô hình hiệu quả. Đổi mới này hứa hẹn phản hồi nhanh hơn, tương tác phong phú hơn và phạm vi ứng dụng rộng hơn, từ dịch thời gian thực đến tăng cường phân tích dữ liệu và cải thiện khả năng tiếp cận cho người khiếm thị.
Dù có những hạn chế và rủi ro ban đầu, như khả năng bị lạm dụng trong lừa đảo deepfake và nhu cầu tối ưu thêm, GPT-4o là một bước nữa hướng tới mục tiêu AGI của OpenAI. Khi trở nên dễ tiếp cận hơn, GPT-4o có thể thay đổi cách chúng ta tương tác với AI, tích hợp vào công việc hàng ngày và chuyên môn.
Với chi phí thấp hơn và khả năng nâng cao, GPT-4o sẵn sàng thiết lập một tiêu chuẩn mới trong ngành AI, mở rộng khả năng cho người dùng trong nhiều lĩnh vực.
Tương lai của AI thật đáng háo hức, và giờ là thời điểm tốt để bắt đầu tìm hiểu công nghệ này hoạt động ra sao. Nếu bạn mới vào lĩnh vực, hãy bắt đầu với lộ trình kỹ năng AI Fundamentals của chúng tôi, bao quát kiến thức thực hành về ChatGPT, mô hình ngôn ngữ lớn, AI sinh sinh và hơn thế. Bạn cũng có thể tìm hiểu thêm về làm việc với OpenAI API trong khóa học thực hành của chúng tôi, hoặc xem toàn bộ danh mục khóa học AI.
Richie giúp các cá nhân và tổ chức nâng cao khả năng sử dụng dữ liệu và AI. Anh đã làm khoa học dữ liệu từ trước khi lĩnh vực này được gọi là khoa học dữ liệu, và đã viết hai cuốn sách cùng nhiều khóa học trên DataCamp về chủ đề này. Anh là người dẫn chương trình podcast DataFramed và phụ trách chương trình webinar của DataCamp.
Trò chuyện với AI Richie về mọi tập của DataFramed - chào đón tất cả những nhà vô địch dữ liệu!
Câu hỏi thường gặp
GPT-4o có xử lý hội thoại đa ngôn ngữ không?
Có, GPT-4o có thể xử lý hội thoại đa ngôn ngữ, cung cấp dịch thời gian thực giữa các ngôn ngữ nhờ khả năng giọng nói có độ trễ thấp. Tuy nhiên, trong bản trình diễn, có một số lỗi khi xử lý bản dịch.
GPT-4o hỗ trợ mọi ngôn ngữ tốt như nhau chứ?
Dù GPT-4o đã cải thiện tách từ cho các bảng chữ cái phi La-tinh, hiệu năng có thể khác nhau giữa các ngôn ngữ, đặc biệt với những ngôn ngữ ít được đại diện trong dữ liệu huấn luyện.
GPT-4o xử lý tiếng ồn nền trong đầu vào âm thanh như thế nào?
GPT-4o có thể tính đến tiếng ồn nền khi xử lý đầu vào âm thanh, từ đó có thể đưa ra phản hồi nhận thức ngữ cảnh tốt hơn.
GPT-4o có thể tạo nội dung video không?
Không, GPT-4o có thể phân tích và mô tả nội dung video nhưng không thể tạo video mới. Sora của OpenAI là mô hình có thể tạo nội dung video.
GPT-4o có thể bắt chước giọng nói cụ thể không?
Không, GPT-4o sử dụng một số giọng đọc cài sẵn cho đầu ra âm thanh để giảm thiểu rủi ro như lừa đảo deepfake.
Dữ liệu nhập vào GPT-4o an toàn đến mức nào?
OpenAI tuân thủ các biện pháp bảo mật nghiêm ngặt, nhưng người dùng luôn nên thận trọng và tránh chia sẻ thông tin nhạy cảm.
Có thể tích hợp GPT-4o vào các ứng dụng hiện có không?
Có, GPT-4o có thể tích hợp vào nhiều ứng dụng qua OpenAI API, cho phép tăng cường chức năng trên nhiều nền tảng.
Hãy tham khảo khóa Working with the OpenAI API để bắt đầu hành trình phát triển ứng dụng tích hợp AI.
Khi nào tôi nên dùng GPT-4o Mini thay vì GPT-4o?
GPT-4o Mini lý tưởng cho các tác vụ ưu tiên tốc độ và hiệu quả hơn là suy luận phức tạp hoặc tương tác đa phương thức. Nó phù hợp với các tác vụ mã đơn giản, gỡ lỗi, hoặc phản hồi nhanh trong ứng dụng nhẹ, là lựa chọn tiết kiệm chi phí cho dự án không cần toàn bộ sức mạnh của GPT-4o.
Sự khác nhau giữa GPT-4o và mô hình o1 là gì?
GPT-4o được thiết kế cho các tác vụ đa phương thức, xử lý hiệu quả đầu vào văn bản, âm thanh và hình ảnh. Trong khi đó, mô hình o1 tập trung vào suy luận nâng cao và giải quyết vấn đề phức tạp, vượt trội ở các lĩnh vực như lập trình và khoa học. GPT-4o ưu tiên tính đa dụng và tốc độ, còn o1 ưu tiên xử lý logic sâu cho các nhiệm vụ suy luận tinh vi.
