Hiển thị các bài đăng có nhãn business. Hiển thị tất cả bài đăng
Hiển thị các bài đăng có nhãn business. Hiển thị tất cả bài đăng

Thứ Năm, 11 tháng 9, 2025

Bàn về 'Lợi thế của doanh nghiệp Việt là dữ liệu Việt, bài toán Việt' - bài phát biểu của Bộ trưởng Nguyễn Mạnh Hùng ngày 21/08/2025


Lê Trung Nghĩa. ORCID iD: https://orcid.org/0009-0007-7683-7703

Viện Nghiên cứu, Đào tạo và Phát triển Tài nguyên Giáo dục Mở (InOER),

Hiệp hội các trường đại học cao đẳng Việt Nam (AVU&C)


Giấy phép nội dung: CC BY 4.0 Quốc tế


---------------------------------------------------

Tóm tắt: Nhân sự kiện Lễ ra mắt Công ty CMC OpenAI ngày 21/08/2025, Bộ trưởng Bộ Khoa học và Công nghệ Nguyễn Mạnh Hùng đã có bài phát biểu nhấn mạnh đến sự cần thiết của việc phát triển công nghệ mở trong kỷ nguyên số ở Việt Nam để khai mở sức sáng tạo của toàn dân, cam kết Việt Nam phát triển và làm chủ công nghệ số dựa trên chuẩn mở, mã nguồn mở, và chiến lược cũng như hành động của Việt Nam trong thời gian tới là: Mở để phát triển và làm chủ công nghệ Việt Nam, để Make in Vietnam. Bài viết này bổ sung các bình luận xung quanh nội dung bài phát biểu với mong muốn làm rõ thêm các khái niệm về MỞ được nhắc tới trong bài phát biểu của Bộ trưởng.

Từ khóa: phát triển công nghệ mở, phần mềm nguồn mở, dữ liệu mở, tiêu chuẩn mở, AI (nguồn) mở, giải pháp mở, hàng hóa công cộng kỹ thuật số.

---------------------------------------------------

Bộ trưởng Bộ Khoa học và Công nghệ Nguyễn Mạnh Hùng có bài phát biểu nhân sự kiện Lễ ra mắt Công ty CMC OpenAI với tựa đề 'Lợi thế của doanh nghiệp Việt là dữ liệu Việt, bài toán Việt'1. Dưới đây là một vài trích đoạn trong bài viết đó:

Một quốc gia phát triển là một quốc gia mà 80% tài sản là tài sản vô hình, là tài sản trí tuệ. Một quốc gia kém phát triển thì tới 80% là tài sản vật chất, tài sản vật lý.”

Điều này là hoàn toàn phù hợp với triết lý “quả táo và ý tưởng” của Nguồn Mở. Nó được nêu như sau: “Nếu tôi có một quả táo và bạn có một quả táo và chúng ta trao đổi cho nhau thì mỗi người chúng ta vẫn có một quả táo. Nhưng nếu tôi có một ý tưởng và bạn có một ý tưởng và chúng ta trao đổi cho nhau thì mỗi người chúng ta sẽ có hai ý tưởng”. Thấy rõ ở đây là quả táo đại diện cho các tài sản vật lý, hữu hình, có thể sờ mó được; trong khi ý tưởng đại diện cho các tài sản vô hình, các tài sản kỹ thuật số - là kết quả của mọi hoạt động chuyển đổi số. Triết lý này cho thấy, khi tài sản vô hình được trao đổi, được chia sẻ mở, hay nói cách khác, khi VÔ HÌNH đi cùng với MỞ sẽ cho giá trị cao nhất (xem Hình 1); vì nếu VÔ HÌNH đi với ĐÓNG thì ý tưởng của bạn vẫn là của bạn và ý tưởng của tôi vẫn là của tôi, không có gì thay đổi cả. Đây là nguyên lý cộng lực để phát triển


Hình 1. Nguyên lý cộng lực để phát triển

Thực tế trên thế giới chỉ ra rằng, để MỞ cùng với VÔ HÌNH có thể mang lại giá trị cao nhất, các doanh nghiệp cần có các mô hình kinh doanh đổi mới sáng tạo, nhất là các mô hình kinh doanh dựa vào việc cung cấp dịch vụ, bao gồm các dịch vụ giá trị gia tăng, chẳng hạn như Phần mềm như một Dịch vụ - SaaS (Software as a Service), chứ không phải các mô hình kinh doanh truyền thống dựa vào việc bán sản phẩm. Bất kỳ ai cũng có thể nhận ra điều này khi nhìn vào các tập đoàn phần mềm hàng đầu thế giới cũng như các công ty AI đương thời. Bạn không mua các sản phẩm của họ, mà trả tiền dịch vụ thuê bao để sử dụng chúng, thường với lựa chọn miễn phí sử dụng trong một khoảng thời gian nhất định ban đầu.

Tương lai của trí tuệ nhân tạo sẽ không bị kiểm soát hoàn toàn bởi những đại gia công nghệ, mà sẽ còn bị chi phối bởi cộng đồng mã nguồn mở, bởi các doanh nghiệp phát triển ứng dụng của các quốc gia. Không một công ty nào, không một tập đoàn đa quốc gia nào, dù quy mô to đến đâu, có thể giải quyết mọi bài toán, đáp ứng mọi nhu cầu thay đổi của các tổ chức, quốc gia. Phát triển công nghệ mở là chìa khóa khai mở sức sáng tạo của toàn dân, từ đó mà giá rẻ đi, nhiều người tiếp cận hơn để giải quyết các bài toán kinh tế xã hội của mỗi quốc gia.

Công nghệ thông tin, công nghệ số đã, đang và sẽ thâm nhập sâu vào mọi ngõ ngách của đời sống xã hội, sẽ trở thành không khí thở của chúng ta. Và vì thế, nó phải rẻ như không khí. Và cách để đạt được điều đó là công nghệ mở. Công nghệ mở không chỉ là mã nguồn mở, mà còn là kiến trúc mở và chuẩn mở. Và đi cùng công nghệ mở là văn hóa mở. Tất cả chúng ta sẽ cùng đóng góp phát triển công nghệ, cùng chia sẻ sử dụng công nghệ. Và vì thế mà giá công nghệ sẽ rẻ đi.”

Bộ trưởng hoàn toàn đúng. Nghiên cứu cho thấy2, trí tuệ nhân tạo (AI) không chỉ có nhiều khía cạnh tích cực, mà cũng có nhiều hơn các khía cạnh tiêu cực (xem Hình 2). Vì vậy, trí tuệ nhân tạo không thể “bị kiểm soát hoàn toàn bởi những đại gia công nghệ”, đặc biệt khi chúng được sử dụng trong các ứng dụng của quốc gia.


Hình 2. AI tích cực và AI tiêu cực

Ngày nay, bên cạnh thuật ngữ công nghệ mở, một vài thuật ngữ mới liên quan đến “Mở” đã xuất hiện, chẳng hạn như tài liệu của UNESCO xuất bản nhân sự kiện Hội nghị Tài nguyên Giáo dục Mở Thế giới lần thứ 3 năm 2024 có tiêu đề “Tài sản Công cộng Kỹ thuật số: Giải pháp Mở và AI vì Quyền truy cập Toàn diện tới Tri thức3, trong đó giải thích:

  • Các giải pháp mở (Open Solutions), chúng là các hàng hóa công cộng kỹ thuật số - DPG (Digital Public Goods) có sẵn dựa vào một giấy phép bản quyền mở (Open Copyright License) đã trở thành thiết yếu trong hàng loạt các lĩnh vực, bao gồm việc học tập (tài nguyên giáo dục mở), phần mềm (phần mềm nguồn mở), khoa học (truy cập mở), và chính phủ (dữ liệu mở). Các giải pháp mở, nhờ vào chế độ sở hữu trí tuệ của chúng, cho phép tính linh hoạt, khả năng mở rộng, và tính tương hợp để thúc đẩy việc chia sẻ kiến thức và quyền truy cập tới thông tin”.

  • Giấy phép bản quyền mở: các giấy phép mở là các giấy phép tôn trọng các quyền sở hữu trí tuệ của chủ sở hữu bản quyền và cung cấp sự cho phép trao cho công chúng các quyền để truy cập, sử dụng lại, tái mục đích, tùy chỉnh và phân phối lại các tài liệu thông tin. Các loại giấy phép mở được sử dụng khác nhau tùy theo giải pháp mở. Giấy phép mở phổ biến nhất là Creative Commons (CC)”.

Tài liệu của Văn phòng Công nghệ Kỹ thuật số và mới nổi của Liên hiệp quốc với tựa đề “Hiệp ước Kỹ thuật số Toàn cầu4 đã được các nhà lãnh đạo thế giới thông qua vào ngày 22/09/2024 tại Hội nghị thượng đỉnh về Tương lai ở New York, đã cam kết và hành động theo 5 mục tiêu, trong đó chủ đề ‘Hàng hóa công cộng kỹ thuật số và cơ sở hạ tầng công cộng kỹ thuật số’ của mục tiêu số 1 ‘Thu hẹp mọi khoảng cách kỹ thuật số và đẩy nhanh tiến độ trên khắp các Mục tiêu Phát triển Bền vững’, nêu: ‘14. Chúng tôi thừa nhận hàng hóa công cộng kỹ thuật số, bao gồm phần mềm nguồn mở, dữ liệu mở, mô hình trí tuệ nhân tạo mở, tiêu chuẩn mở và nội dung mở tuân thủ luật về quyền riêng tư và các luật, tiêu chuẩn và thông lệ quốc tế tốt nhất hiện hành khác và không gây hại, trao quyền cho các xã hội và cá nhân để hướng các công nghệ số vào nhu cầu phát triển của họ và có thể tạo điều kiện cho hợp tác và đầu tư kỹ thuật số.’

Các quốc gia khắp trên thế giới ngày càng có nhu cầu ứng dụng và phát triển hàng hóa công cộng kỹ thuật số, bao gồm cả các mô hình trí tuệ nhân tạo mở, để có thể tận dụng được tài nguyên VÔ HÌNH đó theo cách thức chúng được chia sẻ MỞ, miễn phí cho bất kỳ ai cũng có quyền để truy cập, sử dụng lại, tái mục đích, tùy chỉnh và phân phối lại chúng.

Nhưng thế nào là một mô hình trí tuệ nhân tạo mở? Sáng kiến Nguồn Mở - OSI (Open Source Initiative), một tổ chức phi lợi nhuận phạm vi toàn cầu được thành lập với sứ mệnh để giáo dục và bảo vệ những lợi ích của nguồn mở và xây dựng cầu nối giữa các bên liên quan khác nhau trong cộng đồng nguồn mở toàn thế giới, đã đưa ra Định nghĩa trí tuệ nhân tạo - AI (Artificial Intelligence) Nguồn Mở, phiên bản 1.05 như sau:

AI Nguồn Mở (Open Source AI) là một hệ thống AI được làm cho sẵn sàng theo các điều khoản và theo một cách thức trao các quyền tự do để:

  • Sử dụng hệ thống đó vì bất kỳ mục đích gì và không phải hỏi sự cho phép.

  • Nghiên cứu cách hệ thống đó làm việc và kiểm tra các cấu thành của nó.

  • Sửa đổi hệ thống đó vì bất kỳ mục đích gì, bao gồm thay đổi đầu ra của nó.

  • Chia sẻ hệ thống đó với người khác để sử dụng với hoặc không với những sửa đổi, vì bất kỳ mục đích gì.

Để một mô hình AI được gọi là AI Nguồn Mở, tất cả các thành phần trong tất cả các lớp cấu thành của nó, bao gồm cả phần mềm, dữ liệu và nội dung các tài liệu của nó (xem Bảng 1), đều cần phải được cấp phép mở bằng các giấy phép mở tương ứng (xem Bảng 2) để cho phép bất kỳ ai cũng có khả năng nghiên cứu và kiểm tra các cấu thành của nó, theo AI & DATA của Quỹ Linux6.

Bảng 1. Các lớp MOF và các thành phần của nó


Bảng 2. Các giấy phép mở được khuyến nghị cho các thành phần của MOF


Trên thực tế, tồn tại cả các Mô hình AI nguồn mở, nguồn đóng và/hoặc mở một phần (không phải tất cả các thành phần của mô hình là mở)7. Sự khác biệt chính giữa các mô hình AI nguồn đóng và nguồn mở nằm ở 7 điểm sau8: (1) Khả năng tùy chỉnh; (2) Khả năng tiếp cận; (3) Sự cộng tác; (4) Chi phí; (5) Tính minh bạch; (6) Bảo mật; (7) Các bản cập nhật. Từng mô hình AI, dù là nguồn mở hay nguồn đóng, đều có những điểm mạnh và yếu khác nhau khi được so sánh với nhau9.

Công nghệ thông tin, công nghệ số đã trở thành nền tảng của kinh tế - xã hội. Cuộc di chuyển vĩ đại nhất trong lịch sử nhân loại là cuộc di chuyển từ thế giới thực sang thế giới số. Nhưng tất cả các quốc gia đều lo lắng về an ninh mạng. Niềm tin sẽ trở thành yếu tố quyết định cho sự thành công của cuộc di chuyển này. Các quốc gia chỉ có thể có niềm tin này khi công nghệ họ sử dụng là công nghệ mở. Công nghệ mở là để các quốc gia có thể làm chủ công nghệ mà mình sử dụng. Không còn như trước đây, chúng ta mua một "Black Box" từ một quốc gia khác và phó mặc số phận của quốc gia mình cho một quốc gia khác. Hiện nay, nhiều quốc gia đã tuyên bố chỉ mua công nghệ khi công nghệ là mở, nhất là khi các công nghệ đó dùng để xây dựng các hạ tầng nền tảng quốc gia như 5G, AI.”

Có lẽ Bộ trưởng đi lên từ giới quân sự nên có được sự nhạy cảm về niềm tin vào công nghệ mở, điều cũng đã được nêu trong các tài liệu nghiên cứu về ‘Phát triển công nghệ mở’ của Bộ Quốc phòng Mỹ từ khoảng 15 năm trước, nơi rút ra 15 điểm giúp phát triển công nghệ mở thành công10, với 2 điểm đầu là: “1. Cộng đồng trước, công nghệ sau; và 2. Mở là mặc định, đóng chỉ khi cần”. Các tác giả của tài liệu lập luận rằng, ngày nay, phần mềm được sử dụng để chế tạo vũ khí và điều khiển vũ khí; vì thế nó không thể là phần mềm nguồn đóng - bị phụ thuộc vào một nhà cung cấp, mà nên là phần mềm nguồn mở dựa vào cộng đồng, vì việc thắng hay thua trong một cuộc xung đột không thể bị phụ thuộc vào cái gật đầu hoặc lắc đầu của ông giám đốc một công ty, bất kỳ nó là to và mạnh tới đâu. Với phát triển công nghệ mở, các phần mềm được khuyến nghị sử dụng trong chính phủ là các phần mềm do cộng đồng duy trì (xem Hình 3) như: (1) phần mềm mở sử dụng được ngay của chính phủ - Open GOTS (Open Government Off The Self); và (2) phần mềm nguồn mở do cộng đồng duy trì (Community - Maintained OSS).


Hình 3. Phát triển công nghệ mở

Bộ trưởng nêu:

Dữ liệu là dầu mỏ. Trong tương lai, hầu hết các giá trị sẽ được tạo ra từ dữ liệu. Càng nhiều dữ liệu, nhất là càng nhiều loại dữ liệu khác nhau thì cơ hội tạo ra giá trị mới càng lớn. Người có dữ liệu và người tạo ra giá trị mới từ dữ liệu đó trong nhiều trường hợp không phải là một. Bởi vậy, việc mở dữ liệu và dữ liệu mở là quyết định trong việc tạo ra giá trị mới cho người dân, cho đất nước.

Với một nước đi sau như Việt Nam chúng ta mà muốn đi trước thì phải đứng trên vai những người khác. Việc lựa chọn phát triển công nghệ mở, lựa chọn phát triển phần mềm nguồn mở, lựa chọn mở dữ liệu để các cá nhân, doanh nghiệp tham gia sáng tạo giá trị mới là định hướng của chúng ta. Với định hướng này, Việt Nam sẽ phát triển thành quốc gia công nghệ, dựa trên và thừa hưởng tri thức nhân loại nhưng cũng đóng góp cho tri thức nhân loại.”

Với đa số các công ty công nghệ thông tin (CNTT) của Việt Nam là các công ty vừa và nhỏ (SME), thì “việc mở dữ liệu và dữ liệu mở là quyết định trong việc tạo ra giá trị mới cho người dân, cho đất nước” là không thể khác. Các nghiên cứu của thế giới chỉ ra cho thấy, nếu không có dữ liệu mở thì các SME sẽ không có khả năng để cạnh tranh với các đại gia công nghệ, chí ít là ở 2 khía cạnh: (1) SME không có đủ tiền để mua lượng dữ liệu lớn để sử dụng cho việc đào tạo các mô hình AI tạo sinh của họ; và (2) SME không đủ tiền để theo đuổi các vụ kiện sở hữu trí tuệ liên quan đến các dữ liệu không mở khi họ sử dụng chúng, ví dụ, để đào tạo các mô hình AI tạo sinh của họ. Vì điều này, cần thiết có sự can thiệp chính sách của chính phủ để đảm bảo các SME có được sự truy cập công bằng tới dữ liệu được sử dụng để đào tạo các mô hình AI đổi mới sáng tạo của họ, tốt nhất là dựa trên Dữ liệu Mở được phát triển/tạo ra ở bất cứ nơi nào, bất kỳ lĩnh vực nào có thể. Điều tương tự cũng xảy ra với cộng đồng các nhà nghiên cứu, đặc biệt ở các quốc gia đang phát triển như Việt Nam.

Câu hỏi đặt ra ở đây là, liệu định nghĩa dữ liệu mở trong Luật Dữ liệu 202411 của Việt Nam có được hiểu giống như định nghĩa thường thấy của nó trên thế giới hay không, hay liệu nó có tạo ra các rào cản đối với các SME khi họ sử dụng nó để đổi mới sáng tạo trong các mô hình/hệ thống/ứng dụng AI hoặc phần mềm hay không?

Khóa học cơ bản về Dữ liệu Mở trong chương trình học tập điện tử của Viện Dữ liệu Mở - ODI (Open Data Institute) trên Cổng dữ liệu châu Âu12, Định nghĩa Dữ liệu Mở như sau13:

Dữ liệu mở là dữ liệu mà bất kỳ ai cũng có thể truy cập, sử dụng và chia sẻ.

Dữ liệu mở trở nên có thể sử dụng được khi được cung cấp ở định dạng phổ biến, máy có thể đọc được.

Dữ liệu mở phải được cấp phép mở. Giấy phép của nó phải cho phép mọi người sử dụng dữ liệu đó theo bất kỳ cách gì họ muốn, bao gồm biến đổi, kết hợp và chia sẻ nó với những người khác, ngay cả với mục đích thương mại.

ODI cũng đưa ra phổ dữ liệu để người dùng dễ hình dung các loại dữ liệu khác nhau, như được minh họa trên Hình 4.


Hình 4. Phổ dữ liệu

Phổ dữ liệu như Hình 3 cho thấy, dữ liệu có thể là: (1) đóng hoàn toàn, như các hồ sơ y tế với các dữ liệu nhạy cảm hoặc các báo cáo bán hàng của công ty, chỉ truy cập được trong nội bộ tổ chức; (2) đóng và chỉ (những) người được trao quyền rõ ràng theo hợp đồng mới truy cập được, chẳng hạn như giấy phép lái xe của cá nhân; (3) dữ liệu mà (vài) nhóm người có quyền truy cập thông qua quá trình xác thực, chẳng hạn như dữ liệu nghiên cứu có nguồn gốc từ các hồ sơ y tế đã trải qua quá trình ẩn danh (anonymisation); (4) dữ liệu truy cập được công khai bằng (các) giấy phép hạn chế sử dụng, chẳng hạn như các đoạn tweet; và (5) dữ liệu mở mà bất kỳ ai cũng có quyền truy cập thông qua một giấy phép mở, chẳng hạn như giấy phép CC BY (https://creativecommons.org/licenses/by/4.0/deed.en) hoặc CC BY-SA (https://creativecommons.org/licenses/by-sa/4.0/deed.en), ví dụ như được gắn cho lịch chạy xe buýt, thậm chí cả cho các số liệu thống kê y tế có nguồn gốc từ các hồ sơ y tế đã trải qua quá trình ẩn danh.

Phổ dữ liệu cũng cho thấy đường đi của dữ liệu chuyển dần từ đóng sang mở có thể tương tự với đường đi của dữ liệu của cá nhân (đóng) chuyển dần qua dữ liệu thương mại (được chia sẻ, truy cập hạn chế và có điều kiện) rồi tiếp tục chuyển qua dữ liệu của chính phủ (truy cập được công khai và mở).

Về lượng dữ liệu, phổ dữ liệu cho thấy đường đi của dữ liệu chuyển từ nhỏ sang trung bình rồi sang lớn. Có thể thấy, càng nhiều dữ liệu công khai và/hoặc mở, thì cơ hội tạo ra giá trị mới càng lớn, đặc biệt đối với các SME.

Dữ liệu Mở phải được cấp phép mở”. Thường thấy, Dữ liệu Mở được cấp phép mở bằng các giấy phép từ 2 hệ thống giấy phép mở14 như được minh họa trên Hình 5. Điều này cũng cho thấy, Dữ liệu Mở có thể là dữ liệu: (1) Nằm trong phạm vi công cộng (hoặc hết thời hạn bảo hộ của Luật Sở hữu Trí tuệ, hoặc tác giả khước từ các quyền của mình và hiến tặng vào phạm vi công cộng, vì thế người dùng có toàn quyền sử dụng chúng miễn phí vì bất kỳ mục đích gì); (2) Được cấp phép mở, chẳng hạn như CC BY hoặc ODC - by, cho phép bất kỳ ai cũng có quyền miễn phí truy cập, sử dụng và chia sẻ, nhưng phải thừa nhận ghi công cho tác giả và bên nắm giữ bản quyền; (3) Được cấp phép mở, chẳng hạn như CC BY-SA hoặc OdbL, cho phép bất kỳ ai cũng có quyền miễn phí truy cập, sử dụng và chia sẻ, nhưng phải thừa nhận ghi công cho tác giả và bên nắm giữ bản quyền và nếu người dùng chỉnh sửa dữ liệu đó, thì bản chỉnh sửa đó bắt buộc phải mang giấy phép hệt như bản gốc của nó. Nói một cách khác, Dữ liệu Mở có nhiều sắc thái khác nhau về quyền và nghĩa vụ của người dùng chúng!


Hình 5. Các giấy phép mở thường được sử dụng cho Dữ liệu Mở

Ở phần kết bài phát biểu của mình, Bộ trưởng nêu:

Việt Nam cam kết phát triển và làm chủ công nghệ số dựa trên chuẩn mở, mã nguồn mở. Không chỉ là cam kết mà đây còn là chiến lược của chúng ta: Mở để phát triển và làm chủ công nghệ Việt Nam, để Make in Vietnam. Không chỉ là chiến lược mà đây còn là chương trình hành động của chúng ta. Mỗi cơ quan, doanh nghiệp hãy nhận lấy cho mình một công việc và cam kết hành động. Cơ quan nhà nước hãy hành động để xây dựng chính sách, chiến lược. Doanh nghiệp hãy hành động để phát triển các nền tảng. Các cơ sở đào tạo hãy hành động để nuôi dưỡng và phát triển cộng đồng mở.”

Trong bối cảnh cả nước đang góp ý cho Dự thảo Luật Chuyển đổi số cũng như Nghị định để triển khai Luật Dữ liệu số 60/2024/QH15 của Quốc hội năm 2024 dự kiến sẽ được ban hành trong thời gian tới, cũng như mong muốn từ lâu của nhiều doanh nghiệp công nghệ thông tin Việt Nam và nhiều thành viên của Câu lạc bộ Phần mềm Tự do Nguồn Mở Việt Nam (VFOSSA15) về một chiến lược quốc gia về Công nghệ Mở, hy vọng là toàn bộ nội dung bài phát biểu của Bộ trưởng và nhiều bình luận trong bài viết này sẽ được đưa vào trong nội dung các văn bản sắp được ban hành được nêu ở trên để tận dụng được mọi nguồn lực của quốc gia và sức sáng tạo của toàn dân, nhất là các cộng đồng nguồn mở, đồng thời góp phần vào việc từng bước hiện thực hóa cam kết chiến lược: Mở để phát triển và làm chủ công nghệ Việt Nam, để Make in Vietnam.

Tài liệu tham khảo

  1. Bộ Khoa học và Công nghệ (2025): 'Lợi thế của doanh nghiệp Việt là dữ liệu Việt, bài toán Việt': https://vnexpress.net/loi-the-cua-doanh-nghiep-viet-la-du-lieu-viet-bai-toan-viet-4929956.html

  2. Bozkurt, A., Xiao, J., Farrow, R., Bai, J. Y. H., Nerantzi, C., Moore, S., Dron, J., Stracke, C. M., Singh, L., Crompton, H., Koutropoulos, A., Terentev, E., Pazurek, A., Nichols, M., Sidorkin, A. M., Costello, E., Watson, S., Mulligan, D., Honeychurch, S., Hodges, C. B., Sharples, M., Swindell, A., Frumin, I., Tlili, A., Slagter van Tryon, P. J., Bond, M., Bali, M., Leng, J., Zhang, K., Cukurova, M., Chiu, T. K. F., Lee, K., Hrastinski, S., Garcia, M. B., Sharma, R. C., Alexander, B., Zawacki-Richter, O., Huijser, H., Jandrić, P., Zheng, C., Shea, P., Duart, J. M., Themeli, C., Vorochkov, A., Sani-Bozkurt, S., Moore, R. L., & Asino, T. I. (2024). The Manifesto for Teaching and Learning in a Time of Generative AI: A Critical Collective Stance to Better Navigate the Future. Open Praxis, 16(4), Pages 487–513: https://openpraxis.org/articles/10.55982/openpraxis.16.4.777. Bản dịch sang tiếng Việt: https://www.dropbox.com/scl/fi/3rwkmzqodszn7xxuf3dln/6749b446d17e9_Vi-10052025.pdf?rlkey=2dul6urx28xp46qibhpoqlms7&st=1xog04bw&dl=0, tr.10.

  3. UNESCO: CONCEPT NOTE: 3rd UNESCO World OER Congress 2024: Digital Public Goods: Open Solutions and AI forInclusive Access to Knowledge: https://unesdoc.unesco.org/ark:/48223/pf0000391562. Bản dịch sang tiếng Việt: https://www.dropbox.com/scl/fi/rjjt7cjr7tocvcbppmi9g/391562eng_Vi-18102024.pdf?rlkey=tzuuh2st89u6546wkw32y32nw&e=1&st=iwljik32&dl=0

  4. United Nation Office for Digital and Emerging Technologies (2024): Global Digital Compact, p.5: https://www.un.org/global-digital-compact/sites/default/files/2024-09/Global%20Digital%20Compact%20-%20English_0.pdf. Bản dịch sang tiếng Việt: https://doi.org/10.5281/zenodo.15042420, tr.9.

  5. Open Source Initiative (OSI): The Open Source AI Definition – 1.0: https://opensource.org/ai/open-source-ai-definition. Bản dịch sang tiếng Việt: https://giaoducmo.avnuc.vn/ai/dinh-nghia-ai-nguon-mo-v1-0-1374.html

  6. LF AI & DATA (Dec 17, 2024): The Model Openness Framework (MOF) Specification: https://lfaidata.foundation/wp-content/uploads/sites/3/2025/01/05_White_paper_MOF_Specification.pdf. Bản dịch sang tiếng Việt: https://www.dropbox.com/scl/fi/t25554np4o745vujtkph1/05_White_paper_MOF_Specification_Vi-21022025.pdf?rlkey=ejg41yluhlets5jeygmeysbys&e=1&st=4idhwi13&dl=0

  7. Aaron Linskens (2025): Beyond open vs. closed: Understanding the spectrum of AI transparency: https://www.sonatype.com/blog/beyond-open-vs.-closed-understanding-the-spectrum-of-ai-transparency. Bản dịch sang tiếng Việt: https://giaoducmo.avnuc.vn/ai/vuot-ra-ngoai-ranh-gioi-mo-va-dong-hieu-ve-pho-minh-bach-cua-ai-1501.html

  8. Multimodal (August 8, 2024): Open-Source AI vs. Closed-Source AI: What’s the Difference?: https://www.multimodal.dev/post/open-source-ai-vs-closed-source-ai. Bản dịch sang tiếng Việt: https://giaoducmo.avnuc.vn/ai/ai-nguon-mo-so-voi-ai-nguon-dong-dau-la-su-khac-biet-1499.html

  9. Index for Developers (July 8, 2025): Open-Source vs. Closed AI: Who Should You Trust?: https://www.index.dev/blog/open-source-vs-closed-ai-guide. Bản dịch sang tiếng Việt: https://giaoducmo.avnuc.vn/ai/ai-nguon-mo-so-voi-dong-ban-se-tin-ai-1500.html

  10. Bộ Quốc phòng Mỹ, 2011: Open Technology Development - Lessons Learned and Best Practices for Military Software: https://dodcio.defense.gov/Portals/0/Documents/FOSS/OTD-lessons-learned-military-signed.pdf, p. 38. Bản dịch sang tiếng Việt: https://www.dropbox.com/s/7dr3l68df0n8qkd/OTD-Lessons-Learned-And-Best-Practices-For-Military-Software-Vi.pdf, trang 42.

  11. Trang thông tin Chính phủ: Luật số 60/2024/QH15 của Quốc hội: Luật Dữ liệu: https://vanban.chinhphu.vn/?pageid=27160&docid=212488&classid=1&orggroupid=1

  12. data.europa.eu: The e-learning programme: https://data.europa.eu/elearning/en/#/id/co-01

  13. data.europa.eu: What is open data?: https://data.europa.eu/elearning/en/module1/#/id/co-01

  14. Leigh Dodds, Open Data Institute (2013): Publisher's Guide to Open Data Licensing: https://theodi.org/insights/guides/publishers-guide-to-open-data-licensing/. Bản dịch sang tiếng Việt: https://vnfoss.blogspot.com/2018/02/chi-dan-cua-nha-xuat-ban-ve-cap-phep-du.html

  15. VFOSSA: https://vfossa.vn/

(Bài viết cho hội thảo nhân sự kiện Security Bootcamp 2025 được tổ chức tại TP. Huế trong các ngày 12-13/09/2025)

Tự do tải về bài viết toàn văn định dạng PDF ở DOI: https://zenodo.org/records/17103251

Tự do tải về bài trình chiếu tại địa chỉ: https://www.dropbox.com/scl/fi/reutrzh6hd6ik2zwtqhtf/SBC2025-OpenTech_DPG_InTheAgeOf_AI.pdf?rlkey=fcjmh2etymtne7pnxcbnyfbna&st=4rggjj1h&dl=0

X(Tweet): https://x.com/nghiafoss/status/1966334924732190844

Xem thêm:


Chủ Nhật, 16 tháng 2, 2025

“Chúng tôi không có hào nước”: Sự đổi mới đột phá của AI nguồn mở


We Have No Moat”: Open Source AI's Breakneck Innovation


Jim Zemlin, Executive Director at Linux Foundation

Published Feb 7, 2025

Theo: https://www.linkedin.com/pulse/we-have-moat-open-source-ais-breakneck-innovation-jim-zemlin-fsrwc

Bài được đưa lên Internet ngày: 07/02/2025

Vào tháng 5 năm 2023, một bản ghi nhớ từ một kỹ sư AI giấu tên của Google đã bị rò rỉ và nhanh chóng lan truyền trên các trang tin công nghệ, thu hút hàng nghìn bình luận trên Hacker News. Bản ghi nhớ có tiêu đề "Chúng tôi không có hào nước... Và OpenAI cũng vậy". Nội dung chính của bài đăng là thế này — hãy ngừng tập trung vào việc xây dựng mô hình khổng lồ tiếp theo và bắt đầu làm việc với cộng đồng nguồn mở vì cuối cùng họ sẽ đánh bại chúng ta. "Chúng tôi đã nhìn lại OpenAI rất nhiều. Ai sẽ vượt qua cột mốc tiếp theo? Động thái tiếp theo sẽ là gì? Nhưng sự thật khó chịu là chúng tôi không ở vị thế để giành chiến thắng trong cuộc chạy đua vũ trang này và OpenAI cũng vậy. Trong khi chúng tôi đang cãi vã, một phe phái thứ ba đã âm thầm ăn bữa trưa của chúng tôi. Tất nhiên, tôi đang nói về nguồn mở. Nói một cách đơn giản, họ đang vượt qua chúng tôi. Những thứ mà chúng tôi coi là "vấn đề mở lớn" đã được giải quyết và nằm trong tay mọi người ngày nay."

Bài đăng này ban đầu là để phản hồi về việc Meta phát hành các mô hình Llama có khả năng đầu tiên, nhanh chóng tạo ra nhiều nhánh được điều chỉnh cho vô số mục đích cụ thể. Vào thời điểm đó, các mô hình nguồn mở tương đương có xu hướng tụt hậu so với các mô hình nguồn đóng trên nhiều mặt trận và cần một số tháng để đạt được sự ngang bằng. Tuy nhiên, ngay cả khi đó, chữ viết tay đã ở trên tường. Ngày nay, trong thời đại của các mô hình AI tức thời và DeepSeek, lợi thế nhỏ về thời gian đưa ra thị trường đó đã thu hẹp lại còn 24 giờ. AI nguồn mở không chỉ đang chiến thắng mà còn phát triển nhanh đến mức Sam Altman đã công khai thừa nhận rằng ông có thể cần theo đuổi một chiến lược nguồn mở chặt chẽ hơn (Tôi để lịch cho bạn, Sam!).

Khi tôi viết vào tuần trước về DeepSeek và lý do tại sao AI nguồn mở sẽ chiến thắng trong cả ngắn hạn và dài hạn, tôi đã dự đoán rằng các phương pháp mà DeepSeek nêu bật sẽ dẫn đến làn sóng đổi mới nhanh chóng trong các mô hình AI. Ngay cả khi đó, các công ty đang nghiên cứu các phiên bản đáng tin cậy hơn và khả thi về mặt thương mại hơn của mô hình nền tảng R1 của DeepSeek khiến cổ phiếu lao dốc. Sau đó, OpenAI đã phát hành dịch vụ nghiên cứu nâng cao của riêng mình, Deep Research, vài ngày sau đó. Dịch vụ này kết hợp một LLM (có thể được chọn từ danh sách LLM hiện tại do OpenAI, 4o, o1, o3, v.v. cung cấp) và một “khung tác nhân” để hướng dẫn LLM cách sử dụng các công cụ như tìm kiếm trên web hoặc cách suy nghĩ thông qua việc sắp xếp quy trình của mình thành các bước hợp lý và sử dụng các công cụ như tìm kiếm trên web và sắp xếp các hành động của mình theo từng bước. Nó được thiết kế để thực hiện lý luận nâng cao, hoạt động như một nhà phân tích nghiên cứu và cung cấp các phân tích phức tạp về các dự án bao gồm hầu hết mọi chủ đề. Các chuyên gia AI như Ethan Mollick đã ca ngợi nó và nhiều người khác trực tuyến đang ca ngợi nó là công cụ tổng hợp tốt nhất mà họ từng thấy.

Một ngày sau, HuggingFace đã phát hành phiên bản nguồn mở của Deep Research, mặc dù chưa thể so sánh được nhưng khá gần. ( HuggingFace cũng đã đạt được tiến bộ trong việc tái tạo các phần còn thiếu của R1, chẳng hạn như tập dữ liệu và mã đào tạo). Deep Research chắc chắn đã được hưởng lợi từ dữ liệu, mô hình nền tảng và đào tạo của DeepSeek và đặc biệt là mô hình R1 của nó. Đó chính xác là lý do tại sao AI nguồn mở lại nhanh nhẹn và mạnh mẽ như vậy. (Hãy xem Nathan Lambert của AI2 nói gì về điều này). Không có hào nước theo thiết kế và nó làm nổi tất cả các con thuyền theo thiết kế. Trong khi đó, trong cộng đồng, năm đối thủ cạnh tranh Deep Research nguồn mở khác đã nổi lên (dzhng, assafelovic, nickscamara, jina-aimshumecảm ơn HuggingFace đã tìm ra chúng). Vào thời điểm bạn đọc bài viết này, rất có thể nhiều nhà phát triển AI đã công bố các phiên bản mới hơn và được cải tiến hơn. Khả năng sao chép nhanh chóng các khả năng khiến nhiều người ngạc nhiên, nhưng không phải tôi. Đổi mới nguồn mở đã diễn ra nhanh hơn đáng kể so với đổi mới nguồn đóng trong nhiều thập kỷ nay. Chúng ta đã chứng kiến ​​điều này tại Linux Foundation khi phần mềm nguồn mở đã thống trị thế giới phần mềm. Nói rõ hơn, phần mềm nguồn mở không tự làm được gì cả. Nó chỉ là mã nguồn. Các nhà phát triển giỏi nhất thế giới, đóng góp và cộng tác trong một mô hình đánh giá ngang hàng khoa học, mở đã tạo ra phần mềm tốt hơn mà nhiều nhà phát triển khác đã chọn sử dụng vì phần mềm nguồn mở tốt hơn các giải pháp thay thế. Điểm mấu chốt của tất cả những điều này là gì? AI nguồn mở đang tăng tốc. Khả năng của cộng đồng trong việc nhanh chóng bắt kịp bất kỳ sự phát triển mới nào là sự xác nhận rõ ràng về tốc độ và sức mạnh của AI nguồn mở, được thúc đẩy bởi bộ não của một cộng đồng tài năng khổng lồ và đang phát triển trên toàn thế giới. Hơn nữa, việc giữ bất kỳ cải tiến AI nào bị khóa trong một cái chai sẽ là một thách thức vô cùng lớn. Những tiến bộ trong quá trình chưng cất mô hình - một quá trình mà một mô hình lớn hơn, phức tạp hơn được sử dụng để đào tạo một phiên bản nhỏ hơn, hiệu quả hơn - cho phép các nhà nghiên cứu phân tích các hệ thống AI có sẵn công khai hiệu quả hơn. Thông qua quá trình chưng cất, những hiểu biết sâu sắc về đào tạo quan trọng có thể được trích xuất, giúp khả thi để phát triển các mô hình tương đương hoặc thậm chí hiệu quả hơn. Khả năng này không chỉ đẩy nhanh quá trình nghiên cứu và phát triển mà còn mở rộng hệ sinh thái đổi mới bằng cách cho phép một cộng đồng rộng lớn hơn thử nghiệm và cải thiện các mô hình hiện có. DeepSeek đã sử dụng quá trình chưng cất để tăng cường khả năng suy luận của loạt mô hình Qwen và LLama, thực sự tăng cường hiệu suất của chúng trong các tác vụ suy luận. Gần như đúng lúc, một bài báo được công bố từ các nhà nghiên cứu Stanford trình bày một cách đơn giản để chuyển đổi LLM mở thành mô hình lý luận, chỉ sử dụng 26 phút thời gian đào tạo và tốn 30 đô la (rõ ràng, chi phí của mô hình cơ sở cao hơn nhiều). Bí quyết bí mật là gì? Cung cấp cho nó 1.000 ví dụ lý luận có cấu trúc tốt và mở rộng quy trình suy nghĩ của nó. Sử dụng phương pháp đơn giản này (và hiện đã được công khai), họ đã có thể gần như đạt được hiệu suất của GPT o1 trong các bài toán khớp nối.

Vì các khả năng AI cơ bản đang tăng tốc rất nhanh trong mã nguồn mở, nên giá trị sẽ tăng lên và chảy đến các nhà cung cấp có thể cung cấp bảo mật, tính dễ sử dụng và trải nghiệm tốt nhất cho nhà phát triển và người tiêu dùng. Đây nên được coi là một chiến thắng tuyệt vời. Chỉ một năm trước, nhiều người trong lĩnh vực công nghệ lo sợ rằng thế giới đang phân chia thành những người giàu GPU và những người nghèo GPU — những người có quyền truy cập vào AI mạnh mẽ và những người không có. Chúng ta có thể thấy rằng đó là một điểm gây tranh cãi và điều đó rất quan trọng. Quyền truy cập dân chủ vào các khả năng AI trên khắp các quốc gia, các công ty ở mọi quy mô và các tổ chức phi chính phủ sẽ là nền tảng cơ bản cho sự đổi mới trong nhiều năm tới, trên nhiều lĩnh vực. Mở ra những chiến thắng trong các công nghệ thúc đẩy lợi ích chung. Luôn luôn. Hãy kéo cầu xuống vì thủy triều đang dâng.

In May 2023, a memo from an unnamed Google AI engineer leaked and quickly made the rounds of the tech newsophere, racking up thousands of comments on Hacker News. The memo was titled “ We Have No Moat…And Neither Does OpenAI”. The gist of the post was this — stop focusing on building the next giant model and start working with the open source community because they will beat us in the end.

“We’ve done a lot of looking over our shoulders at OpenAI. Who will cross the next milestone? What will the next move be? But the uncomfortable truth is we aren’t positioned to win this arms race and neither is OpenAI. While we’ve been squabbling, a third faction has been quietly eating our lunch. I’m talking, of course, about open source. Plainly put, they are lapping us. Things we consider “major open problems” are solved and in people’s hands today.“

This post was initially in response to the release of the first capable Llama models by Meta, which quickly yielded numerous offshoots tuned for myriad specific purposes. Back then, comparable open source models tended to lag closed source models on a variety of fronts, and required a number of months to reach parity. However, the handwriting was on the wall even then. Today, in the age of Instant AI models and DeepSeek, that slight time-to-market advantage has shrunk to 24 hours. Open source AI is not only winning but it’s moving so fast that Sam Altman has publicly admitted he may need to pursue a more rigorous open source strategy (My calendar is open for you, Sam!). 

When I wrote last week about DeepSeek and why open source AI will win both in the short and long run, I predicted that the methods DeepSeek highlighted would lead to a wave of rapid innovation in AI models. Even then, companies were working on more reliable and commercially viable versions of DeepSeek’s R1 foundational model which sent stocks into a nosedive. Then, OpenAI released its own advanced research offering, Deep Research, a few days later. This combined an LLM (which can be selected from the current list of LLMs provided by OpenAI, 4o, o1, o3, etc.) and an “agentic framework” to instruct the LLM how to use tools like web searches or how to think through organizing its process into logical steps and to use tools like web search and organize its actions in steps.

It was designed to perform advanced reasoning, function like a research analyst, and deliver complex analyses on projects covering almost any topic. AI experts like Ethan Mollick raved about it, and many others online are singing its praises as the best general agentic tool they have seen. 

A day later, HuggingFace released an open source version of Deep Research that, while not yet comparable, was pretty close. (HuggingFace has also made progress towards recreating R1’s missing pieces, such as dataset, and training code). Deep Research undoubtedly benefitted from the data, foundational model and training of DeepSeek and its R1 model in particular. Which is exactly why open source AI is so nimble and powerful. (Check out what Nathan Lambert of AI2 has to say about this).  There are no moats by design, and it floats all boats by design.

Meanwhile, in the community, five other open source Deep Research competitors emerged (dzhng, assafelovic, nickscamara, jina-ai and mshumer — h/t to HuggingFace for finding them). By the time you read this, it’s entirely likely more AI developers have published newer and improved versions.  The fast replication of capabilities surprised many, but not me. Open source innovation has moved significantly faster than closed source innovation for decades now. We’ve witnessed this at the Linux Foundation as open source software has eaten the software world. To be clear, the open source software didn’t do anything itself. It’s just source code. The world’s best developers, contributing and collaborating in an open, scientific peer review-esque model produced better software that many other developers chose to use because the open source software was just better than alternatives.  

The bottom line of all this? Open source AI is accelerating. The ability of the community to quickly match any new development is clear validation of the velocity and power of open source AI, driven by the brains of a massive and growing community of talent all over the world. What’s more, keeping any AI innovation locked in a bottle is going to be incredibly challenging. Advances in model distillation—a process by which a larger, complex model is used to train a smaller, more efficient version—enable researchers to dissect publicly available AI systems more effectively. Through distillation, key training insights can be extracted, making it feasible to develop comparable or even more efficient models. This capability not only accelerates research and development but also broadens the ecosystem of innovation by allowing a wider community to experiment with and improve upon existing models. DeepSeek used distillation to enhance the reasoning capabilities of the Qwen and LLama series of models, effectively supercharging their performance on reasoning tasks. 

Almost on cue, a paper dropped from Stanford researchers demonstrating a simple way to transform an open LLM into a reasoning model, using only 26 minutes of training time and costing $30 (obviously, the cost of the base model was a lot more). The secret trick? Feeding it 1,000 well-structured reasoning examples and extending its thinking process. Using this simple  (and now publicly known) method, they were able to nearly match the performance of GPT o1 on match problems. 

Because foundational AI capabilities are accelerating so quickly in open source, the value will move up the stack and flow to providers who can deliver the best security, ease of use, and developer and consumer experiences. This should be viewed as an amazing victory. Only a year ago, many in the technology realm were fearful that the world was bifurcating into GPU richies and GPU poors — those who had access to powerful AI and those who didn’t. We can already see that’s a moot point and that’s important. Democratic access to AI capabilities across countries, companies of all sizes and NGOs will be a fundamental building block of innovation for many years to come, across many fields. Open wins in technologies that drive a shared benefit. Always. Pull down that drawbridge because the tide is rising.

Dịch: Lê Trung Nghĩa

letrungnghia.foss@gmail.com

Thứ Năm, 6 tháng 2, 2025

Nếu DeepSeek muốn trở thành một người phá vỡ thực sự, nó phải tiến xa hơn nữa về tính minh bạch của dữ liệu


If DeepSeek wants to be a real disruptor, it should go much further on data transparency

Thu Jan 30, 2025

Theo: https://theodi.org/news-and-events/blog/if-deepseek-wants-to-be-a-real-disruptor-it-should-go-much-further-on-data-transparency/

Bài được đưa lên Internet ngày: 30/01/2025

Chúng ta cần tính minh bạch nhiều hơn từ tất cả các nhà cung cấp mô hình.

Vào ngày 20/01/2025, công ty AI Trung Quốc DeepSeek đã phát hành một mô hình ngôn ngữ gọi là R1 đã gửi đi làn sóng gây sốc khắp thế giới AI trên toàn cầu. Cùng với việc phát hành là những tuyên bố ấn tượng về sự phát triển và khả năng của mô hình đó, với sự phát triển mô hình chỉ bằng 10% của chi phí được cho là của o1 của OpenAI và nhanh gần gấp đôi so với chuẩn mực. Điều đó là vì, theo báo cáo kỹ thuật, R1 ít dựa hơn vào việc gắn nhãn của con người và thay vào đó có khả năng sử dụng một dạng đào tạo được tự động hóa. Thế còn về dữ liệu thì sao? Nó tới từ đâu và nó được sử dụng như thế nào?

Chỉ số Minh bạch Dữ liệu AI

Tháng trước, Viện Dữ liệu Mở - ODI (Open Data Institute) đã phát hành Chỉ số Minh bạch Dữ liệu AI - AIDTI (AI Data Transparency Index), một khung mới để phân tích liệu các nhà cung cấp mô hình có chia sẻ thông tin cần thiết về tính minh bạch dữ liệu có ý nghĩa hay không. Với AIDTI, các nhà cung cấp mô hình được đánh giá theo 7 chiều, tìm kiếm sự minh bạch về những điều chẳng hạn như các nguồn của tập dữ liệu và các phương pháp thu thập, các hoạt động xử lý được triển khai, và liệu các tập dữ liệu đã được kiểm tra về dữ liệu có bản quyền hay dữ liệu cá nhân hay chưa.

Thông qua quá trình này, chúng tôi đã phân tích 22 mô hình từ khắp trên thế giới, bao gồm các mô hình mà cũng giống như DeepSeek đã tuyên bố là ‘nguồn mở’. Phân tích của chúng tôi đã xác định rằng:

  • Mức độ trưởng thành cao đã được 5 nhà cung cấp mô hình thể hiện, được đặc trưng bằng việc ghi thành tài liệu chi tiết, truy cập được, sử dụng nhất quán các công cụ minh bạch, và một cách tiếp cận chủ động tích cực cho các quyết định giải thích được tiến hành trong quá trình phát triển đó.

  • 6 nhà cung cấp mô hình đã đáp ứng một số tiêu chí minh bạch nhưng thiếu sự nhất quán đối với tất cả các chiều và vì thế đã được coi là có mức độ trưởng thành trung bình.

  • 11 nhà cung cấp mô hình đã thể hiện mức độ trưởng thành thấp với thông tin hạn chế hoặc chất lượng kém, gợi ý sự miễn cưỡng chung để trở thành mở.

Chúng tôi nghĩ có thể là cơ hội tốt để xem DeepSeek được so sánh như thế nào với các đối thủ cạnh tranh đã thanh danh của nó.

Hai nhà nghiên cứu của ODI đã độc lập lặp lại phương pháp Chỉ số Minh bạch Dữ liệu AI cho DeepSeek R1 và bạn có thể thấy kết quả đối sánh bên dưới.



DeepSeek và minh bạch dữ liệu

DeepSeek không may đã được xếp hạng ở mức trưởng thành thấp đối với tất cả ngoại trừ 1 trong số 7 chiều minh bạch của chúng tôi. Nhờ có tóm tắt khá chi tiết các hoạt động tiền xử lý và hậu đào tạo đã diễn ra trong quá trình phát triển DeepSeek R1, DeepSeekđã có điểm trung bình về mức độ trưởng thành đối với chiều này. Đối với các chiều còn lại, DeepSeek có điểm kém. Đã có danh sách không rõ ràng về các tập dữ liệu được sử dụng trong mô hình và cơ chế không minh bạch được sử dụng (chẳng hạn như các thẻ mô hình hay dữ liệu) để giúp làm cho các mô hình AI minh bạch hơn và truy cập được nhiều hơn. Đã không có các chi tiết được chia sẻ xem dữ liệu này có bao gồm các dữ liệu có bản quyền hay thông tin cá nhân hay không, cũng không có bất kỳ sự bảo vệ nào cho điều này. Cũng như thông tin chi tiết hơn về toàn bộ chuỗi cung ứng dữ liệu. Bất chấp một số tuyên bố ấn tượng về hiệu quả tính toán của các mô hình, toàn bộ chi phí môi trường của quá trình phát triển vẫn chưa được chia sẻ.

Tổng thể, mức độ trưởng thành minh bạch dữ liệu thấp của DeepSeek đặt nó ngang hàng với Inflection-2, tốt hơn một chút so với Grok 2 của X và Gemini 1.5 của Google, và khá tệ hơn so với GPT-4o của OpenAI. Tất cả các mô hình đó vẫn còn được coi là có mức độ trưởng thành thấp về minh bạch dữ liệu, và đứng xa phía sau so với Aya của Cohere và Pythia của EleutherAI. DeepSeek R1 không phải là mô hình nguồn mở, cũng không là một tiêu chuẩn mới về minh bạch dữ liệu.

Việc có mức độ trưởng thành thấp về minh bạch dữ liệu có nghĩa đối với những người dùng khác nhau rằng:

  • Chúng tôi không thể xác định liệu dữ liệu có được sử dụng từ đối thủ cạnh tranh của họ hay không vì OpenAI và Microsoft được cho là đang điều tra

  • Tính xác thực của các tuyên bố về chi phí của DeepSeek, vì nó phần lớn được khởi tạo từ một mô hình trước đó mà họ chưa công bố chi phí đào tạo

  • Tính xác thực của các tuyên bố về hiệu quả đào tạo của DeepSeek, mặc dù một số tính toán cho thấy chúng là sự thật

Kết luận

Mặc dù có nhiều tuyên bố về mô hình AI 'nguồn mở' của DeepSeek, nhưng thực tế thì nó không phải là nguồn mở. Mặc dù cả trọng số mô hình và kiến trúc mô hình đều được chia sẻ trong một bài báo kỹ thuật, nhưng cả mã lẫn dữ liệu đào tạo hoặc đánh giá đều không được chia sẻ công khai. Một nhà phân tích của Sáng kiến Nguồn Mở cũng xác nhận rằng Deepseek không phải là AI Nguồn Mở và không đáp ứng các yêu cầu của định nghĩa AI Nguồn M (bản dịch sang tiếng Việt). Nó tham gia cùng các mô hình khác tuyên bố là nguồn mở, nhưng lại có điểm kém về tính minh bạch dữ liệu.

Cuối cùng, điều này có nghĩa là nhiều tuyên bố ấn tượng của DeepSeek về phát triển mô hình hiệu quả cao không thể được xác thực. Để điều này thực sự là một sự kiện mang tính đột phá, DeepSeek sẽ phải trở nên trưởng thành hơn nhiều với thông tin về tính minh bạch dữ liệu mà họ chia sẻ.

Nhìn chung, tính minh bạch dữ liệu vẫn tiếp tục là một cơ chế có liên quan để đánh giá các mô hình và nhà cung cấp mới. Chúng ta cần nhiều tính minh bạch hơn, không chỉ từ DeepSeek vì một số người lo sợ về nguồn dữ liệu và rủi ro về quyền riêng tư đối với người dùng, mà còn từ tất cả các nhà cung cấp mô hình dù là người Mỹ hay người Trung Quốc, mở hay đóng, lớn hay nhỏ.

Xem thêm:

We need more transparency, from all model providers.

On January 20th, the Chinese AI company DeepSeek released a language model called R1 which sent shockwaves across the global AI world. Accompanying the release were impressive claims regarding the model's development and capability, with the development of a model that is 10% of the supposed cost of OpenAI’s o1 and nearly twice as fast on benchmarks. That’s because, according to the technical report, R1 was less reliant on human labelling and instead was able to use an automated form of training. But what about the data? Where did it come from and how is it used?

The AI Data Transparency Index

Last month, the ODI launched the AI Data Transparency Index, a new framework to analyse whether model providers were sharing the information needed for meaningful data transparency. With the AIDTI model providers are assessed across seven dimensions, looking for transparency on things such as dataset sources and collection methods, processing activities carried out, and whether the datasets have been checked for copyrighted or personal data.

Through this process, we analysed 22 models from around the world, including models that also, like DeepSeek claimed to be ‘open source’. Our analysis identified that:

  • High maturity was demonstrated by five model providers, characterised by detailed, accessible documentation, consistent use of transparency tools, and a proactive approach to explaining decisions made in the development process.

  • Six model providers met some transparency criteria but lacked consistency for all dimensions and were therefore considered medium maturity.

  • Eleven model providers demonstrated low maturity with limited or poor-quality information, suggesting a general reluctance to be open.

We thought it would be a good opportunity to see how DeepSeek compared to its established competitors.

Two ODI researchers independently repeated our AI Data Transparency Index methodology for DeepSeek R1 and you can see the comparative results below.

Deepseek and data transparency

DeepSeek was unfortunately ranked at low maturity for all but one of our seven transparency dimensions. Due to relatively detailed summaries of the pre-processing and post-training activities that took place in developing DeepSeek R1, DeepSeek was scored at medium maturity for this. For the rest of them, DeepSeek scored poorly. There was no clear list of datasets used in the model and no transparent mechanism used (such as model or data cards) which help to make AI models more transparent and accessible. There were no details shared on whether this data included copyrighted data or personal information, nor any protections for this in place. As was further information on the full data supply chain. Despite some impressive claims as to the models compute efficiency, full environmental costs of the development were not shared.

Overall, DeepSeek’s low data transparency maturity puts it on a par with Inflection-2, moderately better than X’s Grok 2 and Google’s Gemini 1.5, and marginally worse than OpenAI’s GPT-4o. All of these models are still considered low maturity in data transparency, and languish far behind the likes of Cohere’s Aya and EleutherAI’s Pythia. DeepSeek R1 is not an open source model, nor is it a new standard for data transparency.

Being low maturity for data transparency means for different users that:

  • We can’t identify whether data was used from their competitors as OpenAI and Microsoft are reportedly probing

  • The veracity of DeepSeek’s cost claims, as it was largely bootstrapped from a previous model that they haven’t released the training costs for

  • The veracity of DeepSeek’s training efficiency claims, although some calculations suggest there is truth to them

Conclusion

While there are multiple claims to DeepSeek’s ‘open source’ AI model, in reality it is not open source. While both the model weights and the model architecture were shared in a technical paper, neither the code nor the training or evaluation data were shared openly. An analyst for the Open Source Initiative also confirmed that Deepseek is not Open Source AI and doesn’t meet the requirements of the Open Source AI definition. It joins other models which claim to be open source, but score poorly on data transparency.

Ultimately, this means that many of DeepSeek’s impressive claims to highly-efficient model development cannot be validated. For this truly to be a disruptive event, DeepSeek will be required to become much more mature with the data transparency information they share.

Overall, data transparency continues to be a relevant mechanism for judging new models and providers.We need more transparency, not just from DeepSeek because some people are fearful over the sources of the data and privacy risks for users, but from all model providers whether American or Chinese, open or closed, massive or tiny.

Dịch: Lê Trung Nghĩa

letrungnghia.foss@gmail.com


Thứ Tư, 5 tháng 2, 2025

DeepSeek của Trung Quốc vừa cho mọi công ty công nghệ Mỹ thấy họ đang bắt kịp AI nhanh như thế nào


China's DeepSeek just showed every American tech company how quickly it's catching up in AI

Analysis by Hasan Chowdhury; Jan 27, 2025, 11:47 PM GMT+7

Theo: https://www.aol.com/chinese-startup-just-showed-every-105106877.html

Bài được đưa lên Internet ngày: 27/01/2025

CEO Sam Altman của OpenAI. Một mô hình AI mới từ DeepSeek của Trung Quốc cạnh tranh với o1 của OpenAI. JOEL SAGET/AFP via Getty Images

  • Một công ty khởi nghiệp AI tại Trung Quốc vừa cho thấy cách họ đang thu hẹp khoảng cách với các phòng thí nghiệm AI hàng đầu của Mỹ.

  • Công ty khởi nghiệp DeepSeek của Trung Quốc đã phát hành một mô hình AI mới vào thứ Hai tuần trước, dường như để cạnh tranh với o1 của OpenAI.

  • Khả năng lý luận của nó đã khiến các nhà nghiên cứu AI hàng đầu của Mỹ phải kinh ngạc.

Donald Trump đã bắt đầu nhiệm kỳ tổng thống mới của mình bằng tuyên bố rằng nước Mỹ phải dẫn đầu thế giới. Ông vừa nhận được một lời cảnh báo từ một nhóm chuyên gia AI tại Trung Quốc, những người sẵn sàng chứng minh rằng sự thống trị về công nghệ của Hoa Kỳ không phải là điều hiển nhiên.

Hãy gặp DeepSeek, một công ty khởi nghiệp của Trung Quốc tách ra từ một quỹ đầu cơ đã tồn tại trong một thập kỷ, chuyên tính toán các giao dịch khôn ngoan bằng AI và thuật toán. Bản phát hành mới nhất của công ty, ra mắt vào ngày Trump nhậm chức, đã khiến nhiều nhà nghiên cứu hàng đầu của ngành công nghiệp Hoa Kỳ sửng sốt.

Trong một bài báo được phát hành vào thứ Hai tuần trước, DeepSeek đã tiết lộ một mô hình AI hàng đầu mới có tên là R1, cho thấy một cấp độ "lý luận" mới. Lý do tại sao nó lại để lại ấn tượng lớn như vậy đối với các chuyên gia AI tại Hoa Kỳ là điều quan trọng.

Một số phòng thí nghiệm AI có nguồn lực tốt nhất của Thung lũng Silicon ngày càng chuyển sang "lý luận" như một ranh giới nghiên cứu có thể phát triển công nghệ của họ từ mức độ thông minh giống như của sinh viên sang thứ gì đó hoàn toàn vượt qua trí thông minh của con người.

Để thực hiện được điều này, OpenAI, Google, Anthropic và những công ty khác đã tập trung vào việc đảm bảo các mô hình dành nhiều thời gian hơn để suy nghĩ trước khi trả lời truy vấn của người dùng. Đây là một quá trình tốn kém, chuyên sâu đòi hỏi rất nhiều sức mạnh tính toán đang hoạt động bên dưới.

Xin nhắc lại, OpenAI đã phát hành đầy đủ o1 — "các mô hình được thiết kế để dành nhiều thời gian suy nghĩ hơn trước khi phản hồi" — và nhận được sự đón nhận nồng nhiệt vào tháng 12 sau lần phát hành đầu tiên vào tháng 9. R1 của DeepSeek cho thấy khả năng thu hẹp khoảng cách nhanh chóng như thế nào.

DeepSeek thu hẹp khoảng cách

R1 thực sự làm gì? Đầu tiên, DeepSeek cho biết R1 đạt được "hiệu suất tương đương với OpenAI o1 trong các tác vụ toán học, mã và lý luận".

Bài báo nghiên cứu của công ty cho biết điều này có thể thực hiện được nhờ "tăng cường thuần túy việc học", một kỹ thuật mà Jim Fan, giám đốc nghiên cứu cấp cao tại Nvidia, cho biết gợi nhớ đến bí mật đằng sau việc biến AlphaZero của Google DeepMind trở thành bậc thầy trong các trò chơi như cờ vây và cờ vua ngay từ đầu, "mà không cần bắt chước các nước đi của đại kiện tướng con người trước đó". Ông đã viết trên X rằng đây là "điểm đáng chú ý nhất từ bài báo".

DeepSeek, ra mắt vào năm 2023, cho biết trong bài báo của mình rằng họ làm như vậy vì mục tiêu của công ty là khám phá tiềm năng của AI để "phát triển khả năng lý luận mà không cần bất kỳ dữ liệu giám sát nào". Đây là một kỹ thuật phổ biến được các nhà nghiên cứu AI sử dụng. Công ty cũng cho biết phiên bản R1 trước đó có tên là R1-Zero đã mang đến cho họ "khoảnh khắc aha" trong đó AI "học cách phân bổ nhiều thời gian suy nghĩ hơn cho một vấn đề bằng cách đánh giá lại cách tiếp cận ban đầu của mình".

Kết quả cuối cùng cung cấp những gì mà giáo sư Ethan Mollick của Wharton mô tả là phản hồi từ R1 có nội dung "giống như con người đang suy nghĩ thành tiếng".

Đáng chú ý là mức độ minh bạch này trong quá trình phát triển AI rất khó có thể tìm thấy trong các ghi chú do các công ty như OpenAI công bố khi phát hành các mô hình có khả năng tương tự.

Nathan Lambert, một nhà khoa học nghiên cứu tại Viện Allen về AI, cho biết trên Substack rằng bài báo của R1 "là một bước chuyển đổi quan trọng trong sự không chắc chắn trong nghiên cứu mô hình lý luận" vì "cho đến nay, các mô hình lý luận vẫn là một lĩnh vực nghiên cứu công nghiệp chính mà không có tài liệu quan trọng rõ ràng".

Giữ đúng tinh thần mở, mô hình R1 của DeepSeek, quan trọng là, từng là nguồn mở hoàn toàn, mang giấy phép MIT — tiêu chuẩn công nghiệp về cấp phép phần mềm.

Cùng nhau, các yếu tố này của R1 gây ra sự phức tạp cho những người chơi Hoa Kỳ bị cuốn vào cuộc chạy đua vũ trang về AI với Trung Quốc — đối thủ địa chính trị chính của Trump — vì một số lý do.

Đầu tiên, nó cho thấy Trung Quốc có thể cạnh tranh với một số mô hình AI hàng đầu trong ngành và bắt kịp với những phát triển tiên tiến đến từ Thung lũng Silicon.

Thứ hai, AI nguồn mở tiên tiến cao độ cũng có thể thách thức các công ty đang tìm cách kiếm lợi nhuận khổng lồ bằng cách bán công nghệ của họ.

Ví dụ, OpenAI đã giới thiệu kế hoạch ChatGPT Pro vào tháng 12 với mức giá 200 USD một tháng. Điểm hấp dẫn của gói này là nó bao gồm "quyền truy cập không giới hạn" vào mô hình thông minh nhất của mình tại thời điểm đó, o1. Nếu một mô hình nguồn mở cung cấp các khả năng tương tự miễn phí, động lực mua gói đăng ký thuê bao phải trả phí đắt đỏ có thể giảm đi.

Fan của Nvidia đã mô tả tình huống như thế này trên X: "Chúng ta đang sống trong một dòng thời gian mà một công ty không phải của Hoa Kỳ đang duy trì sứ mệnh ban đầu của OpenAI — nghiên cứu thực sự mở, tiên phong trao quyền cho tất cả mọi người".

DeepSeek đã từng thể hiện bí quyết lập luận trước đây. Vào tháng 11, công ty đã phát hành "R1-lite-preview" (bản xem trước nhỏ) cho thấy "quy trình suy nghĩ minh bạch theo thời gian thực" của mình. Vào tháng 12, công ty đã phát hành một mô hình có tên là V3 để làm nền tảng mới, lớn hơn cho lập luận trong tương lai trong các mô hình.

Đây là lý do quan trọng khiến các nhà nghiên cứu Mỹ nhìn thấy sự cải thiện có ý nghĩa ở mô hình mới nhất R1.

Theo Browne, một nhà phát triển phần mềm đứng sau kênh YouTube phổ biến dành cho cộng đồng công nghệ, cho biết "mô hình DeepSeek R1 mới thật đáng kinh ngạc". Tanay Jaipuria, một đối tác đầu tư vào AI tại Wing VC của Thung lũng Silicon, cũng mô tả nó là "đáng kinh ngạc".

Awni Hannun, một nhà nghiên cứu về máy học tại Apple, cho biết một lợi thế chính của R1 là ít chuyên sâu hơn, cho thấy ngành công nghiệp này đang "tiến gần đến o1 mã nguồn mở, tại nhà, trên phần cứng của người tiêu dùng", ám chỉ đến mô hình lý luận của OpenAI được giới thiệu vào năm ngoái.

Mô hình này có thể được "chưng cất", nghĩa là các phiên bản nhỏ hơn nhưng cũng mạnh mẽ hơn có thể chạy trên phần cứng ít chuyên sâu hơn nhiều so với sức mạnh tính toán được tải vào máy chủ trong các trung tâm dữ liệu mà nhiều công ty công nghệ phụ thuộc vào để chạy các mô hình AI của họ.

Hannun đã chứng minh điều này bằng cách chia sẻ một đoạn clip trên X về phiên bản R1 có 671 tỷ tham số chạy trên hai chip Apple M2 Ultra, trả lời một cách hợp lý cho một lời nhắc hỏi rằng liệu một bộ bài thẳng hay một bộ bài đồng chất tốt hơn trong một ván bài Texas Hold'em. Hannun cho biết phản ứng của họ "nhanh hơn tốc độ đọc".

Kiểm duyệt AI

R1 dường như có một vấn đề chính. Cựu thành viên hội đồng quản trị OpenAI Helen Toner đã chỉ ra trên X rằng có những bản demo về R1 "tự tắt khi được hỏi về các chủ đề mà CCP không thích".

Tuy nhiên, Toner đã gợi ý rằng "rõ ràng là kiểm duyệt được thực hiện bởi một lớp trên cùng, chứ không phải bản thân mô hình". DeepSeek đã không trả lời ngay lập tức yêu cầu bình luận.

Tất nhiên, điều đáng chú ý là OpenAI đã giới thiệu một mô hình mới có tên là o3, được cho là phiên bản kế nhiệm của mô hình o1 mà DeepSeek đang cạnh tranh. Lambert cho biết trong bài đăng trên blog của mình rằng OpenAI "có khả năng vượt trội về mặt kỹ thuật", nhưng ông đã thêm vào cảnh báo quan trọng là mô hình o3 "không khả dụng nói chung" và thông tin cơ bản như "trọng số" của mô hình này sẽ không sớm có.

Với thành tích của DeepSeek cho đến nay, đừng ngạc nhiên nếu mô hình tiếp theo của công ty này ngang bằng với o3. Các nhà lãnh đạo công nghệ của Hoa Kỳ có thể đã gặp đối thủ của họ ở Trung Quốc.

OpenAI CEO Sam Altman. A new AI model from China's DeepSeek rivals OpenAI's o1. JOEL SAGET/AFP via Getty Images

  • An AI startup in China just showed how it's closing the gap with America's top AI labs.

  • The Chinese startup DeepSeek released a new AI model last Monday that appears to rival OpenAI's o1.

  • Its reasoning capabilities have stunned top American AI researchers.

Donald Trump started his new presidency by declaring America must lead the world. He just got a warning shot from an AI crack team in China that's ready to show that US technological supremacy is not a given.

Meet DeepSeek, a Chinese startup spun off from a decade-old hedge fund that calculates shrewd trades with AI and algorithms. Its latest release, which came on the day Trump was inaugurated, has left many of America's top industry researchers stunned.

In a paper released last Monday, DeepSeek unveiled a new flagship AI model called R1 that shows off a new level of "reasoning." Why it has left such a huge impression on AI experts in the US matters.

Some of Silicon Valley's best-resourced AI labs have increasingly turned to "reasoning" as a frontier of research that can evolve their technology from a student-like level of intelligence to something that eclipses human intelligence entirely.

To accomplish this, OpenAI, Google, Anthropic, and others have focused on ensuring models spend more time thinking before responding to a user query. It's an expensive, intensive process that demands a lot from the computing power buzzing underneath.

As a reminder, OpenAI fully released o1 — "models designed to spend more time thinking before they respond" — to a glowing reception in December after an initial release in September. DeepSeek's R1 shows just how quickly it can close the gap.

DeepSeek narrows the gap

What exactly does R1 do? For one, DeepSeek says R1 achieves "performance comparable to OpenAI o1 across math, code, and reasoning tasks."

Its research paper says this is possible thanks to "pure reinforcement learning," a technique that Jim Fan, a senior research manager at Nvidia, said was reminiscent of the secret behind making Google DeepMind's AlphaZero a master at games such as go and chess from scratch, "without imitating human grandmaster moves first." He wrote on X that this was "the most significant takeaway from the paper."

DeepSeek, which launched in 2023, said in its paper that it did this because its goal was to explore the potential of AI to "develop reasoning capabilities without any supervised data." This is a common technique used by AI researchers. The company also said that an earlier version of R1 called R1-Zero gave them an "aha moment" in which the AI "learns to allocate more thinking time to a problem by reevaluating its initial approach."

The end result offers what the Wharton professor Ethan Mollick described as responses from R1 that read "like a human thinking out loud."

Notably, this level of transparency into the development of AI has been hard to come by in the notes published by companies such as OpenAI when releasing models of a similar aptitude.

Nathan Lambert, a research scientist at the Allen Institute for AI, said on Substack that R1's paper "is a major transition point in the uncertainty in reasoning model research" as "until now, reasoning models have been a major area of industrial research without a clear seminal paper."

Staying true to the open spirit, DeepSeek's R1 model, critically, has been fully open-sourced, having obtained an MIT license — the industry standard for software licensing.

Together, these elements of R1 provide complications to US players caught up in an AI arms race with China — Trump's main geopolitical rival — for a few reasons.

First, it shows that China can rival some of the top AI models in the industry and keep pace with cutting-edge developments coming out of Silicon Valley.

Second, open-sourcing highly advanced AI could also challenge companies that are seeking to make huge profits by selling their technology.

OpenAI, for instance, introduced a ChatGPT Pro plan in December that costs $200 a month. Its selling point was that it included "unlimited access" to its smartest model at the time, o1. If an open-source model offers similar capabilities for free, the incentive to buy a costly paid subscription could diminish.

Nvidia's Fan described the situation like this on X: "We are living in a timeline where a non-US company is keeping the original mission of OpenAI alive — truly open, frontier research that empowers all."

DeepSeek has shown off reasoning know-how before. In November, the company released an "R1-lite-preview" that showed its "transparent thought process in real time." In December, it released a model called V3 to serve as a new, bigger foundation for future reasoning in models.

It's a big reason American researchers see a meaningful improvement in the latest model, R1.

Theo Browne, a software developer behind a popular YouTube channel for the tech community, said that "the new DeepSeek R1 model is incredible." Tanay Jaipuria, a partner investing in AI at Silicon Valley's Wing VC, also described it as "incredible."

Awni Hannun, a machine-learning researcher at Apple, said a key advantage of R1 was that it was less intensive, showing that the industry was "getting close to open-source o1, at home, on consumer hardware," referring to OpenAI's reasoning model introduced last year.

The model can be "distilled," meaning smaller but also powerful versions can run on hardware that's far less intensive than the computing power loaded into servers in data centers many tech companies depend on to run their AI models.

Hannun demonstrated this by sharing a clip on X of a 671 billion-parameter version of R1 running on two Apple M2 Ultra chips, responding with reason to a prompt asking whether a straight or a flush is better in a game of Texas Hold'em. Hannun said its response came "faster than reading speed."

AI censorship

R1 does appear to have one key problem. The former OpenAI board member Helen Toner pointed out on X that there were demos of R1 "shutting itself down when asked about topics the CCP doesn't like."

Toner did suggest, however, that "the censorship is obviously being done by a layer on top, not the model itself." DeepSeek didn't immediately respond to a request for comment.

It is worth noting, of course, that OpenAI has introduced a new model called o3 that's meant to be a successor to the o1 model DeepSeek is rivaling. Lambert said in his blog post that OpenAI was "likely technically ahead," but he added the key caveat that the o3 model was "not generally available," nor would basic information such as its "weights" be available anytime soon.

Given DeepSeek's track record so far, don't be surprised if its next model shows parity to o3. America's tech leaders may have met their match in China.

Dịch: Lê Trung Nghĩa

letrungnghia.foss@gmail.com