Viết bởi: Techub News biên tập
Lời dẫn
Trong tập mới nhất của podcast AI nổi tiếng 'Unsupervised Learning', người dẫn chương trình Jacob Effron đã mời hai nhân vật chủ chốt của dự án mô hình ngôn ngữ lớn Google Gemini: Noam Shazeer và Jack Rae. Noam Shazeer là một trong những người đồng phát minh kiến trúc Transformer, đồng thời là người sáng lập Character.ai, hiện đã trở lại Google để lãnh đạo dự án Gemini. Jack Rae là người đóng góp quan trọng cho nhiều nghiên cứu đột phá tại DeepMind, hiện cũng đang tham gia sâu vào việc phát triển Gemini. Cuộc trò chuyện kéo dài 70 phút này diễn ra vào thời điểm dòng mô hình Gemini 2.0 được công bố và sự nổi lên của mô hình tính toán tại thời điểm kiểm tra, hai chuyên gia hàng đầu trong lĩnh vực nghiên cứu AI đã chia sẻ những quan sát độc đáo của họ về hiện trạng công nghệ, con đường tương lai và hệ sinh thái ngành.
Tóm tắt
- Tiềm năng của tính toán tại thời điểm kiểm tra là rất lớn, nhưng không phải là chìa khóa vạn năng cho AGI:Bằng cách đầu tư nhiều hơn vào tài nguyên tính toán tại thời điểm suy luận (như chuỗi suy nghĩ), khả năng của mô hình có thể được cải thiện đáng kể, đặc biệt là trong các lĩnh vực có thể kiểm chứng như toán học và mã lập trình. Tuy nhiên, để đạt được AGI thực sự, vẫn cần giải quyết các thách thức cốt lõi như hành động trong môi trường phức tạp và đặt ra những câu hỏi thực sự mới mẻ.
- Khả năng của mô hình đang chuyển từ 'thi cử' sang 'sáng tạo':Trọng tâm nghiên cứu hiện tại đang chuyển từ việc 'đạt điểm cao' trên các bài kiểm tra tiêu chuẩn cố định sang việc cho phép mô hình thực hiện khám phá mở, đặt ra câu hỏi mới và cuối cùng đóng góp vào các lĩnh vực sáng tạo thực tế như khám phá khoa học.
- Tốc độ bắt kịp của các mô hình mã nguồn mở vượt quá mong đợi:Cả Noam Shazeer và Jack Rae đều bày tỏ sự ngạc nhiên và ngưỡng mộ trước tốc độ mà cộng đồng mã nguồn mở (như Gemma, DeepSeek) đã theo kịp và phát hành các mô hình cạnh tranh, cho rằng lực lượng đổi mới này sẽ tiếp tục tồn tại.
- Triển vọng kết hợp AI và giáo dục là rất lớn:Jack Rae đã lấy ví dụ từ trải nghiệm cá nhân của con mình để minh họa cách AI có thể trở thành công cụ học tập cá nhân hóa mạnh mẽ, cho rằng thế hệ tiếp theo sẽ trở nên 'thông minh hơn' nhờ đó, và tiềm năng của AI trong lĩnh vực giáo dục đang bị đánh giá thấp nghiêm trọng.
- Thái độ thận trọng lạc quan về rủi ro AGI:Cả hai đều cho rằng cần nghiêm túc đối mặt với các vấn đề an toàn và liên kết của AI, cũng như tác động của công nghệ đối với kinh tế xã hội. Google có một đội ngũ chuyên trách đánh giá rủi ro khi phát hành mô hình. Noam Shazeer ví von, hy vọng AI sẽ tôn trọng người tạo ra nó giống như một đứa trẻ tôn trọng cha mẹ.
Tính toán tại thời điểm kiểm tra: Hiện trạng, bất ngờ và giới hạn
Cuộc trò chuyện bắt đầu với việc thảo luận về dòng mô hình Gemini 2.0, đặc biệt là khả năng 'Suy nghĩ' hoặc tính toán tại thời điểm kiểm tra của nó. Jack Rae chia sẻ một bất ngờ ban đầu: nhóm nghiên cứu ban đầu tập trung vào việc cải thiện hiệu suất của mô hình trong các 'nhiệm vụ suy luận' như toán học và mã lập trình, nhưng nhanh chóng nhận ra rằng khả năng suy nghĩ sâu sắc này cũng có thể cải thiện đáng kể các nhiệm vụ sáng tạo, chẳng hạn như viết bài. Quá trình lên ý tưởng và sửa đổi mà mô hình thể hiện trong quá trình 'Suy nghĩ', chất lượng và phong cách của đầu ra đều rất ấn tượng.
Noam Shazeer nhấn mạnh tầm quan trọng của việc đạt được đột phá trong các lĩnh vực có thể kiểm chứng (như toán học và mã lập trình), vì các chỉ số đánh giá này có thể phân biệt hiệu quả liệu mô hình đã thực sự học được cách suy luận hay chỉ đơn thuần là ghi nhớ nhiều dữ liệu hơn. Ông thừa nhận rằng 'tuổi thọ' của các tiêu chuẩn đánh giá (Evals) đang giảm mạnh, những nhiệm vụ từng là thách thức lớn chỉ vài tháng trước đây nhanh chóng bị mô hình chinh phục và trở nên 'tầm thường'. Điều này thúc đẩy toàn ngành cần liên tục phát triển các hệ thống đánh giá mới phức tạp và riêng tư hơn.
Khi được hỏi điều gì thực sự là cột mốc ý nghĩa, Noam Shazeer đã đưa ra một câu trả lời đáng suy ngẫm: 'Khi Gemini X có thể viết Gemini X+1.' Điều này hướng tới vòng lặp tự cải thiện của AI - sử dụng các công cụ AI đã xây dựng để phát triển hiệu quả hơn thế hệ AI mạnh mẽ hơn tiếp theo. Ông cho rằng, ngoài 'vòng lặp meta' này, bánh xe dữ liệu từ phản hồi người dùng và bánh xe đầu tư và sự quan tâm toàn cầu sẽ cùng thúc đẩy sự tăng tốc của phát triển AI.
Vậy, 'giới hạn' của tính toán tại thời điểm kiểm tra là gì? Liệu nó có thể đưa chúng ta thẳng tới AGI? Về vấn đề này, quan điểm của hai người rất rõ ràng. Noam Shazeer phân tích từ góc độ kinh tế: chi phí suy luận của các mô hình ngôn ngữ lớn hiện tại là cực kỳ thấp (mỗi đô la có thể tạo ra hàng triệu tokens), thấp hơn nhiều so với chi phí đọc sách của con người hoặc thuê kỹ sư. Do đó, miễn là giá trị tồn tại, sẽ có không gian lớn để đầu tư nhiều hơn vào tài nguyên tính toán để mô hình 'suy nghĩ' sâu hơn và thông minh hơn tại thời điểm suy luận. Điều này chắc chắn sẽ mang lại đường cong cải thiện khả năng đáng kể.
Tuy nhiên, Jack Rae chỉ rõ rằng mô hình tính toán tại thời điểm kiểm trakhông phải làcon đường hoàn chỉnh để đạt được AGI. Ông đồng ý rằng cần có các thành phần chủ chốt khác, đặc biệt là nghiên cứu về 'tác nhân' (Agent) cho phép AI có thể hành động trong môi trường phức tạp. Tính toán tại thời điểm kiểm tra hiện tại giống như 'suy nghĩ lâu hơn về một vấn đề cụ thể để tìm ra câu trả lời', trong khi mục tiêu tương lai nên là cho phép mô hình thực hiện 'suy nghĩ sâu sắc', tạo ra và nội hóa kiến thức mới trong quá trình 'Suy nghĩ', từ đó cải thiện đáng kể hiệu quả dữ liệu trong việc giải quyết các nhiệm vụ tiếp theo. Giống như một nhà toán học nhân loại thông qua việc nghiên cứu kỹ lưỡng một cuốn sách giáo khoa và suy nghĩ sâu sắc, cuối cùng trở thành chuyên gia đẳng cấp thế giới. Họ đang hướng tới mục tiêu này, nhưng chưa đạt được.
Từ 'người thi cử' đến 'người khám phá': Sự thay đổi mô hình nghiên cứu AI
Khi khả năng của mô hình được nâng cao, vai trò của nó cũng đang thay đổi căn bản. Jack Rae lấy toán học làm ví dụ để minh họa sự thay đổi này: toán học hiện tại thường được sử dụng như một bài kiểm tra tiêu chuẩn, tương tự như 'thi cử'; trong khi bước ngoặt quan trọng trong tương lai là để AI bắt đầu tạo ra 'toán học hữu ích', giải quyết những vấn đề thực sự quan trọng và chưa được giải quyết. Điều này đòi hỏi xây dựng một hệ thống đánh giá bậc thang từ khả năng hiện tại dần chuyển sang đóng góp khoa học thực tế.
Noam Shazeer hoàn toàn đồng ý với điều này và đã sử dụng nó để phản hồi lại những chỉ trích rằng 'mô hình lớn chỉ là bắt chước và không thể tạo ra ý tưởng mới' (như quan điểm của Yann LeCun). Ông cho rằng, ngay cả việc chỉ kết hợp hai lĩnh vực kiến thức đã biết và không liên quan với nhau để khám phá các thuộc tính mới (ví dụ như trong khoa học vật liệu), bản thân điều này đã có thể thúc đẩy quá trình khoa học một cách đáng kể. Về việc điều gì là 'thực sự mới mẻ', ông cho rằng không cần sa vào tranh luận triết học, thái độ thực tế hơn là tiếp tục xây dựng AI, nâng cao trình độ công nghệ toàn cầu và giúp đỡ nhân loại.
Jack Rae thì vẽ nên một bức tranh lớn hơn: so sánh hiện trạng nghiên cứu toán học hiện tại với thời kỳ khám phá địa lý vào thế kỷ 15. Chỉ có một số ít nhà thám hiểm ưu tú (các nhà toán học) có thể mạo hiểm khám phá những vùng đất chưa biết và mang về những tấm bản đồ mới lẻ tẻ. Nếu AI có thể học cách đặt ra các câu hỏi toán học chính xác (được coi là phần khó nhất) và có khả năng giải quyết chúng, thì trong tương lai chúng ta có thể có 'một triệu nhà toán học đẳng cấp Terence Tao', nhanh chóng vẽ nên toàn bộ 'bản đồ toán học', điều này sẽ tạo ra tác động cách mạng đối với tất cả các ngành khoa học.
Văn hóa nghiên cứu, hệ sinh thái mã nguồn mở và triển vọng tương lai
Nhìn lại thập kỷ nghiên cứu AI vừa qua, đặc biệt là những đột phá như Transformer, Noam Shazeer so sánh nó với thời kỳ 'giả kim thuật' - mang tính thử nghiệm cao, biết rằng nó hoạt động nhưng không nhất thiết biết tại sao. Ông nhấn mạnh tầm quan trọng của việc hào phóng ghi nhận trong văn hóa nghiên cứu, vì việc truy nguyên ý tưởng và phân bổ đóng góp thường cực kỳ phức tạp. Về việc liệu sự ra đời của Transformer có tính tất yếu hay không, ông cho rằng những ý tưởng tương tự đã xuất hiện vào thời điểm đó, nhưng sự va chạm và kết hợp cụ thể thực sự cần một chút duyên.
Cả hai cũng thảo luận về các mô hình tổ chức nghiên cứu khác nhau. Jack Rae kết hợp kinh nghiệm của mình tại OpenAI (tập trung hơn) và DeepMind (nhiều hơn từ trên xuống), cho rằng trong môi trường hiện tại của Google, việc duy trì sự cân bằng giữa chiến lược tập trung 'từ trên xuống' và khám phá tự do 'từ dưới lên' là rất quan trọng. Chiến lược tập trung đảm bảo đầu tư nguồn lực vào các hướng đi chủ chốt (như tính toán tại thời điểm kiểm tra) và mang lại kết quả, trong khi khám phá tự do thường mang lại những đột phá bất ngờ và có tác động lớn hơn.
Một lĩnh vực khiến cả hai cùng 'thay đổi suy nghĩ' là tiến trình của các mô hình mã nguồn mở. Jack Rae thừa nhận rằng ông từng nghĩ rằng các mô hình đóng có thể dần dần mở rộng khoảng cách dẫn đầu, nhưng sự nhiệt huyết, sáng tạo và khả năng lặp lại nhanh chóng mà cộng đồng mã nguồn mở thể hiện đã gây sốc. Các mô hình như Gemma 3 và DeepSeek có hiệu suất xuất sắc, cho thấy sức mạnh mã nguồn mở hoàn toàn có thể tiếp tục đổi mới và duy trì tính cạnh tranh. Noam Shazeer cũng cho rằng 'khoảng cách thời gian' giữa mã nguồn mở và đóng đang thu hẹp, trong tương lai có thể là tình huống 'khoảng cách chất lượng rõ ràng nhưng khoảng cách thời gian cực nhỏ'.
Tác động xã hội của AI: Giáo dục, rủi ro và vai trò của con người
Khi nói về tác động của AI đối với cuộc sống cá nhân, Jack Rae chia sẻ một ví dụ sinh động: con trai bốn tuổi của ông thích sử dụng Gemini để nhận diện các loài thực vật và thằn lằn trong vườn, và nhanh chóng tiếp thu kiến thức chuyên môn chi tiết, thậm chí có thể mô tả chính xác với giáo viên ở trường. Ông cho rằng sự kết hợp giữa AI và giáo dục sẽ tạo ra một phương thức học tập cá nhân hóa chưa từng có, khiến thế hệ tiếp theo trở nên 'thông minh hơn', triển vọng này đang bị đánh giá thấp nghiêm trọng.
Noam Shazeer thì có những suy nghĩ mang tính triết học hơn. Ông cho rằng khi AI có thể đảm nhận nhiều công việc sản xuất vật chất hơn trong tương lai, con người cần tìm lại ý nghĩa cuộc sống - điều này có thể không còn là cuộc đấu tranh sinh tồn mà nhiều hơn là theo đuổi các giá trị tinh thần. Ông khuyến khích mọi người, nếu hiện tại có điều gì muốn làm và có ý nghĩa vật chất, 'hãy làm ngay bây giờ', vì tương lai có thể khác.
Về rủi ro AGI, cả hai đều có thái độ thận trọng. Jack Rae bày tỏ 'lo ngại vừa phải', chỉ ra rằng việc tạo ra một thực thể vượt xa trí thông minh của chính mình nhưng vẫn có thể phục vụ một cách đáng tin cậy cho người tạo ra nó là điều chưa có tiền lệ trong lịch sử. Ngoài ra, tác động tiềm tàng của AI đối với việc làm và cấu trúc kinh tế cũng là vấn đề thực tế cần được đối mặt nghiêm túc. Ông đề cập rằng Google có một đội ngũ độc lập chuyên trách đánh giá an toàn và tác động xã hội của việc phát hành mô hình từ góc nhìn tổng thể hơn. Noam Shazeer thì sử dụng một phép so sánh khéo léo: hy vọng AI sẽ tôn trọng con người giống như (trong lý tưởng) một đứa trẻ tôn trọng cha mẹ. Ông thừa nhận cần đầu tư toàn lực vào nghiên cứu an toàn, nhưng nhìn chung không sợ hãi.
Cuối cùng, trong phần hỏi đáp nhanh, với câu hỏi 'Điều gì trong giới AI hiện tại đang được đánh giá cao/quá thấp?', Jack Rae cho rằng một số tiêu chuẩn nhiệm vụ tổng hợp phức tạp cụ thể (như ARC-AGI) đang được đánh giá cao, vì chúng có thể không hiệu quả trong việc hướng tới AGI phổ dụng và hữu ích. Noam Shazeer thì kiên định cho rằng các mô hình ngôn ngữ lớn và bản thân AGI vẫn đang bị 'đánh giá thấp nghiêm trọng', tiềm năng của chúng vượt xa việc tạo ra các sản phẩm trị giá nghìn tỷ đô la. Nếu để họ phát triển ứng dụng ngay bây giờ, cả hai đều cho rằng lĩnh vực 'tác nhân', đặc biệt là các tác nhân có thể tự động hóa thực hiện các nhiệm vụ phức tạp (không giới hạn trong mã hóa), cũng như AI hỗ trợ kỹ thuật phần mềm (chìa khóa của vòng lặp tự tăng tốc), là những hướng đi đáng chú ý nhất.


