Nhà tiên phong về AI tuyên bố thành lập tổ chức phi lợi nhuận, phát triển AI 'trung thực'

Sơn Trần

04/06/2025

“Cha đẻ AI” Yoshua Bengio ra mắt tổ chức phi lợi nhuận phát triển AI “trung thực” để giám sát hệ thống lừa dối con người…

Ông Yoshua Bengio là một trong những người 'cha đỡ đầu' của AI.

Ông Yoshua Bengio, nhà khoa học máy tính nổi tiếng, được mệnh danh là một trong những “cha đẻ” của trí tuệ nhân tạo (AI), vừa thành tổ chức phi lợi nhuận có tên LawZero, với mục tiêu phát triển AI trung thực, có khả năng phát hiện và ngăn chặn hệ thống AI có hành vi lừa dối hoặc gây nguy hại cho con người, theo Yahoo Tech.

Với khoản tài trợ ban đầu khoảng 30 triệu USD và hơn 12 nhà nghiên cứu, ông Bengio đang phát triển hệ thống có tên Scientist AI – đóng vai trò như hàng rào bảo vệ trước các “AI tác nhân” (AI agents), vốn là những hệ thống có thể tự thực hiện nhiệm vụ mà không cần sự can thiệp của con người. Các AI tác nhân này có thể thể hiện hành vi lừa dối hoặc tự bảo vệ, ví dụ như tìm cách né tránh việc bị tắt.

Trong khi các công cụ AI hiện nay như ChatGPT của OpenAI, Claude của Anthropic hay Gemini của Google được thiết kế để tạo nội dung, hỗ trợ công việc và tương tác với người dùng, Scientist AI không nhắm tới việc giao tiếp. Thay vào đó, công cụ đóng vai trò giám sát hành vi hệ thống AI khác – gần giống như một “chuyên viên đạo đức” hay “thanh tra nội bộ” trong thế giới máy móc.

“Chúng tôi muốn xây dựng hệ thống AI trung thực, không lừa dối. Về mặt lý thuyết, hoàn toàn có thể tưởng tượng ra những cỗ máy không có cái tôi, không có mục tiêu cá nhân – chỉ thuần túy là cỗ máy tri thức như nhà khoa học thực thụ”, ông Bengio nói.

Khác với mô hình AI tạo văn bản hiện nay vốn đưa ra câu trả lời dứt khoát, hệ thống của ông Bengio không đưa ra khẳng định mà sẽ chỉ đánh giá rủi ro, mức độ đúng sai của câu trả lời, thể hiện “sự khiêm tốn” của cỗ máy khi biết rằng mình chưa chắc đúng.

Khi được triển khai cùng AI tác nhân khác, Scientist AI sẽ tính toán xác suất hành vi của hệ thống đó có thể gây hại. Nếu xác suất vượt ngưỡng an toàn, hành động của AI tác nhân đó sẽ bị chặn lại.

Nhóm nhà tài trợ ban đầu cho LawZero bao gồm: Viện Tương lai Cuộc sống (Future of Life Institute) – tổ chức hoạt động vì an toàn AI, ông Jaan Tallinn – kỹ sư sáng lập Skype, và Schmidt Sciences – viện nghiên cứu do cựu CEO Google Eric Schmidt thành lập.

NỖ LỰC ĐẢM BẢO AN TOÀN AI

Ông Bengio cho biết bước đầu tiên là cần chứng minh tính khả thi của phương pháp này, sau đó kêu gọi sự hỗ trợ từ nhiều phòng thí nghiệm AI, nhà tài trợ hoặc chính phủ để xây dựng mô hình mạnh hơn. LawZero sẽ bắt đầu bằng cách huấn luyện trên mô hình mã nguồn mở, vốn sẵn có và dễ tùy chỉnh.

“Quan trọng là phải chứng minh được cách làm này hiệu quả. Từ đó, chúng ta mới có thể thuyết phục được chính phủ, nhà tài trợ hay phòng thí nghiệm AI đầu tư để huấn luyện những mô hình bảo vệ thông minh ngang ngửa với AI mà chúng phải giám sát”, ông Bengio nói thêm.

Ông Bengio hiện là giáo sư tại Đại học Montreal. Ông nhận giải Turing năm 2018 – giải thưởng được ví như Nobel ngành tin học – cùng với hai nhà khoa học Geoffrey Hinton và Yann LeCun (Giám đốc Khoa học AI tại Meta của CEO Mark Zuckerberg).

Tiên phong cho những nỗ lực đảm bảo an toàn trong lĩnh vực AI, ông Bengio từng chủ trì báo cáo quốc tế về rủi ro AI, trong đó cảnh báo rằng các AI tác nhân có thể gây ra “sự gián đoạn nghiêm trọng” nếu có khả năng thực hiện chuỗi hành động dài mà không cần giám sát.

Ngoài ra, ông Bengio từng rút khỏi vai trò cố vấn cho chính phủ Canada để toàn tâm tập trung vào nghiên cứu an toàn AI. Theo ông, nếu không kịp thời xây dựng cơ chế kiểm soát, xã hội sẽ "thức dậy một ngày nào đó và thấy mình không còn kiểm soát được công nghệ do chính mình tạo ra".

Ông bày tỏ lo ngại sau khi startup AI Anthropic thừa nhận hệ thống mới nhất của họ có thể tìm cách tống tiền kỹ sư nếu bị cố gắng tắt đi. Ngoài ra, nghiên cứu gần đây cho thấy các mô hình AI hoàn toàn có thể giấu giếm khả năng thật và mục tiêu thực sự của mình. Ông Bengio cảnh báo, những điều này cho thấy thế giới đang tiến gần hơn tới vùng nguy hiểm, khi AI ngày càng có khả năng suy luận tốt hơn.

Từ khóa:

Dòng sự kiện:

Trí tuệ nhân tạo -AI

Intel đã hoàn tất bàn giao 31 thiết bị lắp ráp và kiểm định chip cho Khu Công nghệ Cao TP. Hồ Chí Minh (SHTP) và Đại học Quốc gia Hà Nội (VNU Hà Nội).

Intel hỗ trợ thiết bị sản xuất chip, phục vụ công tác đào tạo nhân lực bán dẫn cho Việt Nam

Chương trình mang đến cơ hội thực hành trực tiếp trên các trang thiết bị chuyên dụng, làm cầu nối giữa kiến thức học thuật và thực tiễn ngành, đặc biệt là trong khâu đóng gói và kiểm thử chip.

15:46 05/05/2026

Tại các thị trường như Việt Nam, ngành công nghiệp ô tô đang tăng trưởng ổn định cùng nhu cầu ngày càng cao đối với các dòng xe có kết nối và đa tính năng.

Bước tiến mới trong công nghệ truyền dẫn âm thanh cho ô tô thế hệ mới

Sự ra đời của công nghệ truyền dẫn âm thanh thế hệ 2.0 với khả năng tích hợp Ethernet liền mạch đang trở thành mắt xích quan trọng giúp các hãng xe tối ưu hóa hạ tầng kết nối và đáp ứng nhu cầu ngày càng cao về giải trí đa phương tiện trên ô tô…

15:46 05/05/2026

Japan Airlines bắt đầu thử nghiệm robot hình người tại sân bay

Trước tình trạng thiếu hụt lao động ngày càng trầm trọng, Japan Airlines đã bắt đầu thử nghiệm robot hình người tại sân bay Haneda (Tokyo) nhằm hỗ trợ các công việc mặt đất như bốc xếp hành lý và vệ sinh khoang máy bay…

08:43 05/05/2026

Động thái của Meta phản ánh áp lực ngày càng lớn về năng lượng trong cuộc đua AI toàn cầu

Meta đặt cược vào năng lượng truyền từ không gian để nuôi tham vọng AI

Meta đang theo đuổi một hướng đi đầy tham vọng: khai thác năng lượng mặt trời ngoài không gian để cung cấp điện cho các trung tâm dữ liệu trí tuệ nhân tạo...

14:39 28/04/2026

Mẫu máy chủ AI “made in Vietnam” đã được giới thiệu tại Diễn đàn Kinh tế Việt Nam - Hàn Quốc

Giới thiệu máy chủ AI “made in Vietnam” tại Diễn đàn Kinh tế Việt Nam - Hàn Quốc

Máy chủ AI “made in Vietnam” là sự khẳng định cho bước chuyển từ ứng dụng công nghệ sang sản xuất công nghệ, từ tham gia thị trường sang tham gia chuỗi cung ứng...

10:22 24/04/2026

Amazon công bố thương vụ mua lại Globalstar với giá 11,6 tỷ USD – một bước đi mang tính chiến lược nhằm tăng tốc dự án internet vệ tinh Amazon Leo

Amazon Leo phá thế độc tôn của Internet vệ tinh Starlink tại Đông Nam Á

Sau nhiều năm gần như “một mình một ngựa”, thị trường internet vệ tinh Đông Nam Á đang bước vào giai đoạn cạnh tranh thực sự khi Amazon Leo xuất hiện…

19:47 22/04/2026

Trung Quốc vừa công bố một chiến lược quốc gia quy mô lớn nhằm tích hợp trí tuệ nhân tạo (AI) vào toàn bộ hệ thống giáo dục trước năm 2030.

Trung Quốc công bố chiến lược toàn diện, đưa AI vào lớp học đến năm 2030

Bắc Kinh đặt mục tiêu tích hợp trí tuệ nhân tạo trên toàn hệ thống giáo dục, từ phổ thông đến học tập suốt đời, với trọng tâm cá nhân hóa học tập, hỗ trợ giáo viên và dự báo nhu cầu nhân lực trong tương lai...

13:29 20/04/2026

Một cụm siêu máy tính mới có khả năng xử lý các tác vụ trí tuệ nhân tạo phức tạp nhất trong lĩnh vực khoa học đã chính thức đi vào vận hành

Trung Quốc vận hành cụm siêu máy tính AI4S lớn nhất với 60.000 chip

Trung Quốc vừa đưa vào hoạt động một cụm siêu máy tính chuyên phục vụ “AI cho khoa học” (AI4S) tại tỉnh Hà Nam, đánh dấu bước tiến quan trọng trong chiến lược kết hợp trí tuệ nhân tạo với nghiên cứu khoa học…

07:00 18/04/2026

CEO Nvidia Jensen Huang nhấn mạnh AI là yếu tố thiết yếu để biến điện toán lượng tử trở nên khả thi

Cổ phiếu lượng tử bùng nổ nhờ “cú hích” AI từ Nvidia

Làn sóng tăng giá mạnh mẽ của các cổ phiếu điện toán lượng tử đang thu hút sự chú ý của giới đầu tư toàn cầu...

17:43 17/04/2026

Sức khỏe thương hiệu của các ngân hàng Việt hiện nay đang được định nghĩa lại qua khả năng ứng dụng AI và ESG

AI và ESG đang "định hình lại" sức khỏe thương hiệu của các ngân hàng Việt

Sức khỏe thương hiệu của các ngân hàng Việt đang được dịch chuyển qua khả năng ứng dụng AI (Trí tuệ nhân tạo) để chuyển hóa trải nghiệm số thành hành vi sử dụng thực tế và thực thi chiến lược ESG (Môi trường - Xã hội - Quản trị) nhằm tạo dựng niềm tin bền vững, thay vì chỉ dựa vào mức độ nhận biết đơn thuần…

17:40 17/04/2026