Hiển thị các bài đăng có nhãn events. Hiển thị tất cả bài đăng
Hiển thị các bài đăng có nhãn events. Hiển thị tất cả bài đăng

Thứ Năm, 7 tháng 8, 2025

Tập huấn về Tài nguyên Giáo dục Mở nhân sự kiện “Đại hội Đại biểu Liên Chi hội Thư viện Đại học phía Nam”, ngày 07/08/2025


Tài nguyên Giáo dục Mở là một trong các nội dung được trình bày trong sinh hoạt chuyên môn, học thuật và tập huấn nhân sự kiện “Đại hội Đại biểu Liên Chi hội Thư viện Đại học phía Nam” được tổ chức ngày 07/08/2025 tại TP. Hồ Chí Minh.


Tự do tải về bài trình chiếu tại hội thảo với tiêu đề: ‘Giới thiệu ngắn việc Tạo lập & Khai thác Tài nguyên Giáo dục Mở’, có tại địa chỉ: https://www.dropbox.com/scl/fi/ksrbpqyxhbeoa4stesspx/Creating_and_Exploiting_OER_ShortVersion.pdf?rlkey=cbobfei2506kv2dftwiwatayl&st=v0o6z5qr&dl=0

Tweet: https://x.com/nghiafoss/status/1953560065728033011

Xem thêm:

Blogger: Lê Trung Nghĩa

letrungnghia.foss@gmail.com

Chủ Nhật, 8 tháng 6, 2025

Blog “Phần mềm Tự do Nguồn mở cho Việt Nam” 18 năm tuổi


https://vnfoss.blogspot.com/

Tùy chỉnh ảnh nguồn: https://pixabay.com/vi/illustrations/b%E1%BA%AFn-ph%C3%A1o-hoa-t%C3%AAn-l%E1%BB%ADa-n%C4%83m-m%E1%BB%9Bi-4503892/, CC0

Blogger: Lê Trung Nghĩa

letrungnghia.foss@gmail.com

Chủ Nhật, 16 tháng 2, 2025

“Chúng tôi không có hào nước”: Sự đổi mới đột phá của AI nguồn mở


We Have No Moat”: Open Source AI's Breakneck Innovation


Jim Zemlin, Executive Director at Linux Foundation

Published Feb 7, 2025

Theo: https://www.linkedin.com/pulse/we-have-moat-open-source-ais-breakneck-innovation-jim-zemlin-fsrwc

Bài được đưa lên Internet ngày: 07/02/2025

Vào tháng 5 năm 2023, một bản ghi nhớ từ một kỹ sư AI giấu tên của Google đã bị rò rỉ và nhanh chóng lan truyền trên các trang tin công nghệ, thu hút hàng nghìn bình luận trên Hacker News. Bản ghi nhớ có tiêu đề "Chúng tôi không có hào nước... Và OpenAI cũng vậy". Nội dung chính của bài đăng là thế này — hãy ngừng tập trung vào việc xây dựng mô hình khổng lồ tiếp theo và bắt đầu làm việc với cộng đồng nguồn mở vì cuối cùng họ sẽ đánh bại chúng ta. "Chúng tôi đã nhìn lại OpenAI rất nhiều. Ai sẽ vượt qua cột mốc tiếp theo? Động thái tiếp theo sẽ là gì? Nhưng sự thật khó chịu là chúng tôi không ở vị thế để giành chiến thắng trong cuộc chạy đua vũ trang này và OpenAI cũng vậy. Trong khi chúng tôi đang cãi vã, một phe phái thứ ba đã âm thầm ăn bữa trưa của chúng tôi. Tất nhiên, tôi đang nói về nguồn mở. Nói một cách đơn giản, họ đang vượt qua chúng tôi. Những thứ mà chúng tôi coi là "vấn đề mở lớn" đã được giải quyết và nằm trong tay mọi người ngày nay."

Bài đăng này ban đầu là để phản hồi về việc Meta phát hành các mô hình Llama có khả năng đầu tiên, nhanh chóng tạo ra nhiều nhánh được điều chỉnh cho vô số mục đích cụ thể. Vào thời điểm đó, các mô hình nguồn mở tương đương có xu hướng tụt hậu so với các mô hình nguồn đóng trên nhiều mặt trận và cần một số tháng để đạt được sự ngang bằng. Tuy nhiên, ngay cả khi đó, chữ viết tay đã ở trên tường. Ngày nay, trong thời đại của các mô hình AI tức thời và DeepSeek, lợi thế nhỏ về thời gian đưa ra thị trường đó đã thu hẹp lại còn 24 giờ. AI nguồn mở không chỉ đang chiến thắng mà còn phát triển nhanh đến mức Sam Altman đã công khai thừa nhận rằng ông có thể cần theo đuổi một chiến lược nguồn mở chặt chẽ hơn (Tôi để lịch cho bạn, Sam!).

Khi tôi viết vào tuần trước về DeepSeek và lý do tại sao AI nguồn mở sẽ chiến thắng trong cả ngắn hạn và dài hạn, tôi đã dự đoán rằng các phương pháp mà DeepSeek nêu bật sẽ dẫn đến làn sóng đổi mới nhanh chóng trong các mô hình AI. Ngay cả khi đó, các công ty đang nghiên cứu các phiên bản đáng tin cậy hơn và khả thi về mặt thương mại hơn của mô hình nền tảng R1 của DeepSeek khiến cổ phiếu lao dốc. Sau đó, OpenAI đã phát hành dịch vụ nghiên cứu nâng cao của riêng mình, Deep Research, vài ngày sau đó. Dịch vụ này kết hợp một LLM (có thể được chọn từ danh sách LLM hiện tại do OpenAI, 4o, o1, o3, v.v. cung cấp) và một “khung tác nhân” để hướng dẫn LLM cách sử dụng các công cụ như tìm kiếm trên web hoặc cách suy nghĩ thông qua việc sắp xếp quy trình của mình thành các bước hợp lý và sử dụng các công cụ như tìm kiếm trên web và sắp xếp các hành động của mình theo từng bước. Nó được thiết kế để thực hiện lý luận nâng cao, hoạt động như một nhà phân tích nghiên cứu và cung cấp các phân tích phức tạp về các dự án bao gồm hầu hết mọi chủ đề. Các chuyên gia AI như Ethan Mollick đã ca ngợi nó và nhiều người khác trực tuyến đang ca ngợi nó là công cụ tổng hợp tốt nhất mà họ từng thấy.

Một ngày sau, HuggingFace đã phát hành phiên bản nguồn mở của Deep Research, mặc dù chưa thể so sánh được nhưng khá gần. ( HuggingFace cũng đã đạt được tiến bộ trong việc tái tạo các phần còn thiếu của R1, chẳng hạn như tập dữ liệu và mã đào tạo). Deep Research chắc chắn đã được hưởng lợi từ dữ liệu, mô hình nền tảng và đào tạo của DeepSeek và đặc biệt là mô hình R1 của nó. Đó chính xác là lý do tại sao AI nguồn mở lại nhanh nhẹn và mạnh mẽ như vậy. (Hãy xem Nathan Lambert của AI2 nói gì về điều này). Không có hào nước theo thiết kế và nó làm nổi tất cả các con thuyền theo thiết kế. Trong khi đó, trong cộng đồng, năm đối thủ cạnh tranh Deep Research nguồn mở khác đã nổi lên (dzhng, assafelovic, nickscamara, jina-aimshumecảm ơn HuggingFace đã tìm ra chúng). Vào thời điểm bạn đọc bài viết này, rất có thể nhiều nhà phát triển AI đã công bố các phiên bản mới hơn và được cải tiến hơn. Khả năng sao chép nhanh chóng các khả năng khiến nhiều người ngạc nhiên, nhưng không phải tôi. Đổi mới nguồn mở đã diễn ra nhanh hơn đáng kể so với đổi mới nguồn đóng trong nhiều thập kỷ nay. Chúng ta đã chứng kiến ​​điều này tại Linux Foundation khi phần mềm nguồn mở đã thống trị thế giới phần mềm. Nói rõ hơn, phần mềm nguồn mở không tự làm được gì cả. Nó chỉ là mã nguồn. Các nhà phát triển giỏi nhất thế giới, đóng góp và cộng tác trong một mô hình đánh giá ngang hàng khoa học, mở đã tạo ra phần mềm tốt hơn mà nhiều nhà phát triển khác đã chọn sử dụng vì phần mềm nguồn mở tốt hơn các giải pháp thay thế. Điểm mấu chốt của tất cả những điều này là gì? AI nguồn mở đang tăng tốc. Khả năng của cộng đồng trong việc nhanh chóng bắt kịp bất kỳ sự phát triển mới nào là sự xác nhận rõ ràng về tốc độ và sức mạnh của AI nguồn mở, được thúc đẩy bởi bộ não của một cộng đồng tài năng khổng lồ và đang phát triển trên toàn thế giới. Hơn nữa, việc giữ bất kỳ cải tiến AI nào bị khóa trong một cái chai sẽ là một thách thức vô cùng lớn. Những tiến bộ trong quá trình chưng cất mô hình - một quá trình mà một mô hình lớn hơn, phức tạp hơn được sử dụng để đào tạo một phiên bản nhỏ hơn, hiệu quả hơn - cho phép các nhà nghiên cứu phân tích các hệ thống AI có sẵn công khai hiệu quả hơn. Thông qua quá trình chưng cất, những hiểu biết sâu sắc về đào tạo quan trọng có thể được trích xuất, giúp khả thi để phát triển các mô hình tương đương hoặc thậm chí hiệu quả hơn. Khả năng này không chỉ đẩy nhanh quá trình nghiên cứu và phát triển mà còn mở rộng hệ sinh thái đổi mới bằng cách cho phép một cộng đồng rộng lớn hơn thử nghiệm và cải thiện các mô hình hiện có. DeepSeek đã sử dụng quá trình chưng cất để tăng cường khả năng suy luận của loạt mô hình Qwen và LLama, thực sự tăng cường hiệu suất của chúng trong các tác vụ suy luận. Gần như đúng lúc, một bài báo được công bố từ các nhà nghiên cứu Stanford trình bày một cách đơn giản để chuyển đổi LLM mở thành mô hình lý luận, chỉ sử dụng 26 phút thời gian đào tạo và tốn 30 đô la (rõ ràng, chi phí của mô hình cơ sở cao hơn nhiều). Bí quyết bí mật là gì? Cung cấp cho nó 1.000 ví dụ lý luận có cấu trúc tốt và mở rộng quy trình suy nghĩ của nó. Sử dụng phương pháp đơn giản này (và hiện đã được công khai), họ đã có thể gần như đạt được hiệu suất của GPT o1 trong các bài toán khớp nối.

Vì các khả năng AI cơ bản đang tăng tốc rất nhanh trong mã nguồn mở, nên giá trị sẽ tăng lên và chảy đến các nhà cung cấp có thể cung cấp bảo mật, tính dễ sử dụng và trải nghiệm tốt nhất cho nhà phát triển và người tiêu dùng. Đây nên được coi là một chiến thắng tuyệt vời. Chỉ một năm trước, nhiều người trong lĩnh vực công nghệ lo sợ rằng thế giới đang phân chia thành những người giàu GPU và những người nghèo GPU — những người có quyền truy cập vào AI mạnh mẽ và những người không có. Chúng ta có thể thấy rằng đó là một điểm gây tranh cãi và điều đó rất quan trọng. Quyền truy cập dân chủ vào các khả năng AI trên khắp các quốc gia, các công ty ở mọi quy mô và các tổ chức phi chính phủ sẽ là nền tảng cơ bản cho sự đổi mới trong nhiều năm tới, trên nhiều lĩnh vực. Mở ra những chiến thắng trong các công nghệ thúc đẩy lợi ích chung. Luôn luôn. Hãy kéo cầu xuống vì thủy triều đang dâng.

In May 2023, a memo from an unnamed Google AI engineer leaked and quickly made the rounds of the tech newsophere, racking up thousands of comments on Hacker News. The memo was titled “ We Have No Moat…And Neither Does OpenAI”. The gist of the post was this — stop focusing on building the next giant model and start working with the open source community because they will beat us in the end.

“We’ve done a lot of looking over our shoulders at OpenAI. Who will cross the next milestone? What will the next move be? But the uncomfortable truth is we aren’t positioned to win this arms race and neither is OpenAI. While we’ve been squabbling, a third faction has been quietly eating our lunch. I’m talking, of course, about open source. Plainly put, they are lapping us. Things we consider “major open problems” are solved and in people’s hands today.“

This post was initially in response to the release of the first capable Llama models by Meta, which quickly yielded numerous offshoots tuned for myriad specific purposes. Back then, comparable open source models tended to lag closed source models on a variety of fronts, and required a number of months to reach parity. However, the handwriting was on the wall even then. Today, in the age of Instant AI models and DeepSeek, that slight time-to-market advantage has shrunk to 24 hours. Open source AI is not only winning but it’s moving so fast that Sam Altman has publicly admitted he may need to pursue a more rigorous open source strategy (My calendar is open for you, Sam!). 

When I wrote last week about DeepSeek and why open source AI will win both in the short and long run, I predicted that the methods DeepSeek highlighted would lead to a wave of rapid innovation in AI models. Even then, companies were working on more reliable and commercially viable versions of DeepSeek’s R1 foundational model which sent stocks into a nosedive. Then, OpenAI released its own advanced research offering, Deep Research, a few days later. This combined an LLM (which can be selected from the current list of LLMs provided by OpenAI, 4o, o1, o3, etc.) and an “agentic framework” to instruct the LLM how to use tools like web searches or how to think through organizing its process into logical steps and to use tools like web search and organize its actions in steps.

It was designed to perform advanced reasoning, function like a research analyst, and deliver complex analyses on projects covering almost any topic. AI experts like Ethan Mollick raved about it, and many others online are singing its praises as the best general agentic tool they have seen. 

A day later, HuggingFace released an open source version of Deep Research that, while not yet comparable, was pretty close. (HuggingFace has also made progress towards recreating R1’s missing pieces, such as dataset, and training code). Deep Research undoubtedly benefitted from the data, foundational model and training of DeepSeek and its R1 model in particular. Which is exactly why open source AI is so nimble and powerful. (Check out what Nathan Lambert of AI2 has to say about this).  There are no moats by design, and it floats all boats by design.

Meanwhile, in the community, five other open source Deep Research competitors emerged (dzhng, assafelovic, nickscamara, jina-ai and mshumer — h/t to HuggingFace for finding them). By the time you read this, it’s entirely likely more AI developers have published newer and improved versions.  The fast replication of capabilities surprised many, but not me. Open source innovation has moved significantly faster than closed source innovation for decades now. We’ve witnessed this at the Linux Foundation as open source software has eaten the software world. To be clear, the open source software didn’t do anything itself. It’s just source code. The world’s best developers, contributing and collaborating in an open, scientific peer review-esque model produced better software that many other developers chose to use because the open source software was just better than alternatives.  

The bottom line of all this? Open source AI is accelerating. The ability of the community to quickly match any new development is clear validation of the velocity and power of open source AI, driven by the brains of a massive and growing community of talent all over the world. What’s more, keeping any AI innovation locked in a bottle is going to be incredibly challenging. Advances in model distillation—a process by which a larger, complex model is used to train a smaller, more efficient version—enable researchers to dissect publicly available AI systems more effectively. Through distillation, key training insights can be extracted, making it feasible to develop comparable or even more efficient models. This capability not only accelerates research and development but also broadens the ecosystem of innovation by allowing a wider community to experiment with and improve upon existing models. DeepSeek used distillation to enhance the reasoning capabilities of the Qwen and LLama series of models, effectively supercharging their performance on reasoning tasks. 

Almost on cue, a paper dropped from Stanford researchers demonstrating a simple way to transform an open LLM into a reasoning model, using only 26 minutes of training time and costing $30 (obviously, the cost of the base model was a lot more). The secret trick? Feeding it 1,000 well-structured reasoning examples and extending its thinking process. Using this simple  (and now publicly known) method, they were able to nearly match the performance of GPT o1 on match problems. 

Because foundational AI capabilities are accelerating so quickly in open source, the value will move up the stack and flow to providers who can deliver the best security, ease of use, and developer and consumer experiences. This should be viewed as an amazing victory. Only a year ago, many in the technology realm were fearful that the world was bifurcating into GPU richies and GPU poors — those who had access to powerful AI and those who didn’t. We can already see that’s a moot point and that’s important. Democratic access to AI capabilities across countries, companies of all sizes and NGOs will be a fundamental building block of innovation for many years to come, across many fields. Open wins in technologies that drive a shared benefit. Always. Pull down that drawbridge because the tide is rising.

Dịch: Lê Trung Nghĩa

letrungnghia.foss@gmail.com

Thứ Ba, 11 tháng 2, 2025

DeepSeek chứng minh: Nguồn mở là bí quyết thống trị thị trường công nghệ (và Phố Wall đã sai)


DeepSeek Proves It: Open Source is the Secret to Dominating Tech Markets (and Wall Street has it wrong)


Jim Zemlin
, Giám đốc Điều hành tại Quỹ Linux Foundation

Theo: https://www.linkedin.com/pulse/deepseek-proves-open-source-secret-dominating-tech-markets-jim-zemlin-f1lic/

Bài được đưa lên Internet ngày: 28/01/2025

Tôi hiếm khi viết blog hoặc đăng bài trên mạng xã hội nhưng tôi viết bản tin riêng hàng tuần cho nhân viên và ban quản trị của chúng tôi và trong vài tuần liên tiếp đã viết về DeepSeek. Điều tôi không cân nhắc là phản ứng của báo chí và thị trường trong tuần này. Những người tốt như Ben Thompson, Pat Gellisnger, Tomasz Tunguz đều đã bình luận. Với việc cổ phiếu AI bị đánh tơi tả và những lo ngại nghiêm trọng nổi lên về tác động của mô hình R1 của DeepSeek đối với tương lai của AI, rõ ràng là nỗi sợ hãi về DeepSeek đã chạm sâu đến dây thần kinh. Phản ứng lớn đó xứng đáng được xem xét và giải thích.

Ngắn gọn, những gì thị trường phản ứng là khả năng của DeepSeek trong việc xây dựng một mô hình có thể sánh ngang với mô hình lý luận o1 tinh vi của OpenAI và mô hình Sonnet của Anthropic với chi phí chỉ bằng một phần nhỏ của việc tính toán. Có vẻ như DeepSeek đã thực hiện điều này bằng các kỹ thuật nổi tiếng. Không có đột phá thuật toán lớn nào, chỉ là kỹ thuật rất thông minh. Nhóm vừa quay lại với Nguyên tắc đầu tiên, đặt những câu hỏi cơ bản và xếp chồng các kỹ thuật hiện có theo những cách mới lạ để đạt được kết quả vượt trội bằng cách sử dụng Học tăng cường – RL (Reinforcement Learning) và nhiều giai đoạn tinh chỉnh khác nhau. Không có phép thuật nào ở đây — chỉ là sự xáo trộn rất thông minh các thẻ hiện có tạo ra kết quả tinh tế và hiệu quả hơn.

Một số nhà quan sát cáo buộc DeepSeek "ăn theo" công trình của những nhà sản xuất mô hình lớn khác như Meta (Llama) và AliBaba (Qwen). Tuy nhiên, quan điểm này phản ánh sự hiểu lầm về cách thức hoạt động của các hệ thống nguồn mở. Nguyên tắc cơ bản của đổi mới nguồn mở là kỳ vọng rằng những người khác sẽ xây dựng dựa trên công trình trước đó để thúc đẩy tiến trình.

Trong trường hợp của DeepSeek, họ đã chứng minh điều này bằng cách chắt lọc mô hình lý luận cơ bản của họ, DeepSeek-R1—một sự phát triển của mô hình DeepSeek-V3-Base nguồn mở trước đó của họ —và tinh chỉnh các mô hình nhỏ hơn từ loạt mô hình Llama 3 và Qwen 2.5 bằng cách sử dụng dữ liệu lý luận do mô hình cơ sở của họ tạo ra. Quá trình này làm nổi bật cách DeepSeek tận dụng các đổi mới mở hiện có, không chỉ sao chép mà còn chứng minh những cải tiến đáng kể về hiệu suất của mô hình ngôn ngữ nhỏ. Sau đó, DeepSeek đã phát hành lại các mô hình đó trở lại cộng đồng AI nguồn mở.

Đây là Điểm chính. Những gì mà tin tức và bình luận bỏ lỡ là cơ hội to lớn mà DeepSeek đã mở ra cho nguồn mở và rộng hơn là toàn bộ phong trào mở. Quá nhiều cuộc trò chuyện được định hình là Hoa Kỳ so với Trung Quốc và cuộc đua giành quyền tối cao về AI. Quá nhiều cuộc trò chuyện được định hình trên ý tưởng rằng DeepSeek đào tạo một mô hình mạnh mẽ trên một phần nhỏ của tính toán với một phần nhỏ chi phí có nghĩa là tất cả các công ty lớn chi nhiều tiền cho thiết bị và đào tạo NVIDIA sẽ bị cắt giảm.

Theo quan điểm (thiên vị) của tôi, đổi mới nguồn mở sẽ chiến thắng và điều này thực sự sẽ tốt cho tất cả mọi người — Trung Quốc, Hoa Kỳ, Big Tech, Chủ quyền kỹ thuật số châu Âu, NVIDIA, v.v. Một số nhà đầu tư mạo hiểm đặt cược vào các công ty khởi nghiệp AI ban đầu đã trở thành các tính năng bên trong các dịch vụ AI lớn hơn có thể bị xóa sổ, nhưng điều đó xảy ra trong bất kỳ giai đoạn chuyển đổi công nghệ nào. Điều mà DeepSeek chứng minh là chúng ta cần hàng nghìn con mắt nhìn vào vấn đề để đưa ra các giải pháp tốt hơn nhằm biến trí thông minh trở nên gần với miễn phí nhất có thể. Một nhóm nhỏ ở Trung Quốc đã xem xét lại một vấn đề và đưa ra một cách tiếp cận mới giúp giảm chi phí suy luận theo chuỗi suy nghĩ xuống 50 lần (nếu các bài đăng của DeepSeek là chính xác) và sau đó xuất bản một bài báo mô tả đầy đủ về quy trình của họ, cho phép cộng đồng được hưởng lợi từ những bài học kinh nghiệm của họ. Chúng ta cần NHIỀU hơn nữa tiến bộ này, chứ không phải ít hơn. Đây không phải là cuộc chạy đua vũ trang giữa Hoa Kỳ và Trung Quốc. Đây là cuộc đấu tranh giành thị trường mở giữa các lực lượng mở và các lực lượng đóng. Các chính phủ có thể nghĩ rằng họ có thể kiểm soát được điều này, nhưng lịch sử cho thấy công nghệ mở, một khi được phát hiện và đưa vào tay cộng đồng, thì giống như mưa. Bạn không thể tạm dừng hoặc ngăn chặn nó. Việc ngăn chặn sự phát triển khoa học một cách giả tạo chưa bao giờ có hiệu quả trong bất kỳ thời hạn dài nào và khoa học máy tính và AI cũng không ngoại lệ.

Vào tháng 3 năm 2013, thế giới nguồn mở đã giới thiệu một cách nhẹ nhàng, chuẩn hóa để đóng gói và chạy các ứng dụng với tất cả các phụ thuộc của chúng, đảm bảo tính nhất quán trên các môi trường khác nhau. Không giống như các máy ảo truyền thống, các container Docker sử dụng các môi trường biệt lập trên một hệ điều hành cơ bản duy nhất để thực hiện ảo hóa. Các container Docker nhanh hơn, khả chuyển hơn và hiệu quả hơn bằng cách chia sẻ hạt nhân của hệ thống máy chủ trong khi cô lập các quy trình. Docker đã tổ chức lại nhiều khả năng ảo hóa và container nguồn mở hiện có như cgroups, LXC, không gian tên, v.v. Việc tổ chức lại đó hoặc xáo trộn các thẻ hiện có đã thay đổi trò chơi. Máy ảo đã hoạt động tốt trong nhiều năm, nhưng các container Docker tốt hơn nhiều đối với nhiều tải công việc. Tính mở của sự thay đổi công nghệ đó đã giúp thúc đẩy làn sóng mới áp dụng điện toán bẩm sinh đám mây.

Một hiểu lầm cơ bản khác là DeepSeek sẽ yêu cầu ít đầu tư vào cơ sở hạ tầng AI hơn. Tuy nhiên, có một nhu cầu vô hạn đối với trí thông minh. Chúng ta thậm chí còn chưa khám phá hết bề mặt và đang ở giai đoạn đầu khai thác các ứng dụng hỗ trợ AI.

Những cải tiến gần đây hơn trong các mô hình AI đã chuyển mối liên hệ của lý luận từ các cải tiến trước khi đào tạo và sau khi đào tạo sang tính toán thời gian thử nghiệm hiện nay, cho phép các mô hình "lý luận" thông qua phản hồi của chúng (chuỗi suy nghĩ). Điều này không có nghĩa là chúng ta cần ít tính toán hơn. Trên thực tế, nó có nghĩa là chúng ta cần nhiều tính toán hơn, khi lớp suy luận hoạt động giống như bộ não con người hơn — luôn suy nghĩ, xem xét lại, giải quyết nhiều nhiệm vụ cùng một lúc và phát triển để đáp ứng nhu cầu về các hoạt động trí tuệ mới. Điều này giống như điện hơn — một loại hàng hóa. Làm cho nó rẻ hơn để có thể ứng dụng nhiều hơn (như VC Tomasz Tungus giải thích rõ ràng tại đây) và nhiều người sẽ sử dụng nó hơn.

Đối với nguồn mở, điều này mở ra một ranh giới mới to lớn. Nếu nguồn mở chiến thắng trong AI và trở thành mô hình đổi mới và phát triển thống trị, thì chúng ta có cơ hội định hình lại cách thế giới hoạt động ở cấp độ cơ bản. DeepSeek là một ví dụ về việc cung cấp lý luận sẵn sàng cho nhiều người dùng và ứng dụng hơn. AI nguồn mở có thể là con đường để cung cấp tính tương hợp và các tiêu chuẩn thực sự giữa các ứng dụng và ngăn xếp ứng dụng.

AI là siêu lớp (Meta-Layer) mà chúng ta có thể xây dựng kỳ vọng mới về tính tương hợp, một thực tế mới mà Satya Nadela đã ám chỉ khi ông phát biểu tại nhiều diễn đàn về cách AI có thể phá vỡ các ứng dụng Phần mềm như một Dịch vụ – SaaS (Software as a Service) bằng cách cho phép các tổ chức kết nối các phần phụ trợ và nguồn dữ liệu khác nhau với các máy (công cụ) AI. Nói cách khác, AI nguồn mở mang đến cho thế giới cơ hội viết lại các quy tắc có lợi cho bất kỳ điều gì mở, ở mọi nơi có thể. Trong thế giới này, quyền lực thuộc về cộng đồng và những người bảo trì.

Tất nhiên, có rất nhiều sắc thái xung quanh nguồn mở và cách thức hoạt động của nó. Nhưng qua lăng kính này, tôi tin rằng bài học của DeepSeek là về sự bùng nổ AI sắp tới và cách nó có thể mang lại lợi ích cho mọi người và thúc đẩy tiến bộ kinh tế và công nghệ vượt xa những gì thị trường nhận thức — nếu chúng ta giữ cho nó là mở.

Bạn không tin tôi sao? Linux hiện đã ba mươi bốn tuổi và một nhóm các nhà nghiên cứu tại Đại học Waterloo làm việc trong môi trường mở đã chứng minh, chỉ mới tuần trước, rằng "thay đổi 30 dòng mã trong Linux có thể cắt giảm mức sử dụng năng lượng tại một số trung tâm dữ liệu tới 30 phần trăm". Hãy đoán xem tất cả các khối lượng công việc AI đó chạy trên hệ điều hành nào?

Cuối cùng, tôi sẽ đưa ra một dự đoán nhỏ cho tất cả những người phản đối thiếu hiểu biết "con ngựa thành Troy". Một công ty hoặc phòng nghiên cứu khác sẽ có một mô hình tương tự sử dụng phương pháp này với tỷ lệ hiệu suất trên chi phí đáng kinh ngạc trong vài tuần tới. Hãy thoải mái đoán xem ai trong phần bình luận.

Jim Zemlin, Executive Director at Linux Foundation

January 28, 2025

I rarely blog or post on social media but I do write a private weekly newsletter for our staff and board and for a couple of weeks in a row have been writing about DeepSeek. What I didn’t consider is the reaction this week in the press and markets. Good folks like Ben Thompson, Pat Gellisnger, Tomasz Tunguz have all been commenting. With AI stocks getting pummeled and grave concerns surfacing about the impact of DeepSeek’s R1 model on the future of AI, it’s clear that fears of DeepSeek struck a deep nerve. That huge reaction merits both examination and explanation.

In short, what the markets reacted to was DeepSeek’s ability to build a model that rivaled OpenAI’s sophisticated o1 reasoning model and Anthropic’s Sonnet model for pennies on the dollar on a fraction of the compute. It also appears that DeepSeek did this using well-known techniques. There were no massive algorithmic breakthroughs, just very clever engineering. The team just went back to First Principles, asked basic questions and stacked up existing techniques in novel ways to achieve outsized results using Reinforcement Learning (RL) and various stages of fine-tuning. There’s no magic here — just a very smart reshuffling of the existing cards that produced a more refined and efficient result.

Some observers accused DeepSeek of “free riding” on work done by other large model makers like Meta (Llama) and AliBaba (Qwen). However, this perspective reflects a misunderstanding of how open-source systems function. The foundational principle of open-source innovation is the expectation that others will build upon prior work to drive progress. In the case of DeepSeek, they demonstrated this by distilling their base reasoning model, DeepSeek-R1—an evolution of their earlier open source DeepSeek-V3-Base model —and fine-tuning smaller models from the Llama 3 and Qwen 2.5 series of models using reasoning data generated by their base model. This process highlights how DeepSeek leveraged existing open innovations, not merely for replication, but to demonstrate significant improvements in small language model performance. DeepSeek then re-released those models back to the open source AI community.

Here’s the Big Takeaway. What the news and commentariat are missing is the massive opportunity that DeepSeek has opened for open source and, more broadly, the entire open movement. Too much of the conversation is framed as U.S. vs China and the race for AI supremacy. Too much of the conversation is framed on the idea that DeepSeek training a powerful model on a fraction of the compute for a fraction of the cost means all the large companies spending big bucks on NVIDIA gear and training will be undercut.

In my (biased) view, open source innovation will win and that this will actually be good for everyone — China, the U.S., Big Tech, European Digital Sovereignty, NVIDIA, and more. Some venture investors who bet on early AI startups that have become features inside of larger AI offerings might get wiped out, but that happens in any technology phase shift. What DeepSeek proves is that we need thousands of eyes on the problem to come up with better solutions to make intelligence as close to free as possible. A small team in China took a fresh look at a problem and came up with a novel approach that reduced the cost of chain-of-thought reasoning by 50x (if DeepSeek’s postings are accurate) and then published a paper fully describing their process, allowing the community to benefit from their learnings. We need MORE of this progress, not less. This is not an arm’s race between the U.S. and China. It is a struggle over open markets between the forces of open and the forces of closed. Governments may think they can control this, but history shows that open technology, once discovered and put in the hands of the community, is like rain. You can’t pause or stop it. Artificially halting scientific development has never worked in any long-run term, and computer science and AI are no different.

In March 2013, the open source world was introduced to a lightweight, standardized way to package and run applications with all their dependencies, ensuring consistency across different environments. Unlike traditional virtual machines, Docker containers used isolated environments on a single underlying operating system to do virtualization. Docker containers were faster, more portable, and more efficient by sharing the host system's kernel while isolating processes. Docker reorganized many existing open source virtualization and container capabilities like cgroups, LXC, namespaces and more. That reorganization, or shuffling of the then-existing cards, changed the game. Virtual machines had worked well for years, but Docker containers were far better for many workloads. The openness of that technology shift helped power a new wave of cloud-native computing adoption.

Another fundamental misunderstanding is that DeepSeek will require less AI infrastructure investment. Yet, there is a boundless appetite for intelligence. We haven’t even scratched the surface and are in the very early stages of tapping into AI-powered applications.

More recent improvements in AI models have shifted the nexus of reasoning from pre-training and post-training enhancements to now test-time compute, allowing models to “reason” through their responses (chain-of-thought). This doesn’t mean we need less compute. It actually means we need more compute, when the inference layer acts more like a human brain — always thinking, reconsidering, tackling multiple tasks at once, and evolving to fill the need for new intelligence activities. This is more like electricity — a commodity. Make it cheaper so more applications are possible (as VC Tomasz Tungus explains neatly here), and more people will use it.

For open source, this opens a massive new frontier. If open source wins in AI and becomes the dominant innovation and development model, then we have an opportunity to reshape the way the world works at fundamental levels. DeepSeek is one example of making reasoning available to a much wider array of users and applications. Open source AI could be a path to deliver true interoperability and standards between applications and application stacks.

AI is the meta-layer upon which we could build a new expectation for interoperability, a new reality that Satya Nadela hinted at when he spoke in multiple forums about how AI could disrupt SaaS apps by allowing organizations to hook up different back-ends and data sources to AI engines. In other words, open source AI gives the world a chance to rewrite the rules to favor open everything, everywhere possible. In this world, power goes to the community and the maintainers.

There is, of course, a lot of nuance around open source and how it works. But through this lens, I believe the lesson of DeepSeek is about the coming AI boom and how it can benefit everyone and drive economic and technological progress far exceeding what markets perceive — if we keep it open.

Don’t believe me? Linux is now thirty-four years old and a group of researchers at the University of Waterloo working in the open demonstrated, just last week, that “changing 30 lines of code in Linux could cut energy use at some data centers by up to 30 percent” Guess what OS all those AI workloads run on?

Finally, I will throw out a small prediction for all the “trojan horse” uninformed naysayers. Another firm or research lab will have a similar model using this method with amazing performance to cost ratio in the next few weeks. Feel free to guess who in the comments.

Dịch: Lê Trung Nghĩa

letrungnghia.foss@gmail.com

Thứ Năm, 6 tháng 2, 2025

Nếu DeepSeek muốn trở thành một người phá vỡ thực sự, nó phải tiến xa hơn nữa về tính minh bạch của dữ liệu


If DeepSeek wants to be a real disruptor, it should go much further on data transparency

Thu Jan 30, 2025

Theo: https://theodi.org/news-and-events/blog/if-deepseek-wants-to-be-a-real-disruptor-it-should-go-much-further-on-data-transparency/

Bài được đưa lên Internet ngày: 30/01/2025

Chúng ta cần tính minh bạch nhiều hơn từ tất cả các nhà cung cấp mô hình.

Vào ngày 20/01/2025, công ty AI Trung Quốc DeepSeek đã phát hành một mô hình ngôn ngữ gọi là R1 đã gửi đi làn sóng gây sốc khắp thế giới AI trên toàn cầu. Cùng với việc phát hành là những tuyên bố ấn tượng về sự phát triển và khả năng của mô hình đó, với sự phát triển mô hình chỉ bằng 10% của chi phí được cho là của o1 của OpenAI và nhanh gần gấp đôi so với chuẩn mực. Điều đó là vì, theo báo cáo kỹ thuật, R1 ít dựa hơn vào việc gắn nhãn của con người và thay vào đó có khả năng sử dụng một dạng đào tạo được tự động hóa. Thế còn về dữ liệu thì sao? Nó tới từ đâu và nó được sử dụng như thế nào?

Chỉ số Minh bạch Dữ liệu AI

Tháng trước, Viện Dữ liệu Mở - ODI (Open Data Institute) đã phát hành Chỉ số Minh bạch Dữ liệu AI - AIDTI (AI Data Transparency Index), một khung mới để phân tích liệu các nhà cung cấp mô hình có chia sẻ thông tin cần thiết về tính minh bạch dữ liệu có ý nghĩa hay không. Với AIDTI, các nhà cung cấp mô hình được đánh giá theo 7 chiều, tìm kiếm sự minh bạch về những điều chẳng hạn như các nguồn của tập dữ liệu và các phương pháp thu thập, các hoạt động xử lý được triển khai, và liệu các tập dữ liệu đã được kiểm tra về dữ liệu có bản quyền hay dữ liệu cá nhân hay chưa.

Thông qua quá trình này, chúng tôi đã phân tích 22 mô hình từ khắp trên thế giới, bao gồm các mô hình mà cũng giống như DeepSeek đã tuyên bố là ‘nguồn mở’. Phân tích của chúng tôi đã xác định rằng:

  • Mức độ trưởng thành cao đã được 5 nhà cung cấp mô hình thể hiện, được đặc trưng bằng việc ghi thành tài liệu chi tiết, truy cập được, sử dụng nhất quán các công cụ minh bạch, và một cách tiếp cận chủ động tích cực cho các quyết định giải thích được tiến hành trong quá trình phát triển đó.

  • 6 nhà cung cấp mô hình đã đáp ứng một số tiêu chí minh bạch nhưng thiếu sự nhất quán đối với tất cả các chiều và vì thế đã được coi là có mức độ trưởng thành trung bình.

  • 11 nhà cung cấp mô hình đã thể hiện mức độ trưởng thành thấp với thông tin hạn chế hoặc chất lượng kém, gợi ý sự miễn cưỡng chung để trở thành mở.

Chúng tôi nghĩ có thể là cơ hội tốt để xem DeepSeek được so sánh như thế nào với các đối thủ cạnh tranh đã thanh danh của nó.

Hai nhà nghiên cứu của ODI đã độc lập lặp lại phương pháp Chỉ số Minh bạch Dữ liệu AI cho DeepSeek R1 và bạn có thể thấy kết quả đối sánh bên dưới.



DeepSeek và minh bạch dữ liệu

DeepSeek không may đã được xếp hạng ở mức trưởng thành thấp đối với tất cả ngoại trừ 1 trong số 7 chiều minh bạch của chúng tôi. Nhờ có tóm tắt khá chi tiết các hoạt động tiền xử lý và hậu đào tạo đã diễn ra trong quá trình phát triển DeepSeek R1, DeepSeekđã có điểm trung bình về mức độ trưởng thành đối với chiều này. Đối với các chiều còn lại, DeepSeek có điểm kém. Đã có danh sách không rõ ràng về các tập dữ liệu được sử dụng trong mô hình và cơ chế không minh bạch được sử dụng (chẳng hạn như các thẻ mô hình hay dữ liệu) để giúp làm cho các mô hình AI minh bạch hơn và truy cập được nhiều hơn. Đã không có các chi tiết được chia sẻ xem dữ liệu này có bao gồm các dữ liệu có bản quyền hay thông tin cá nhân hay không, cũng không có bất kỳ sự bảo vệ nào cho điều này. Cũng như thông tin chi tiết hơn về toàn bộ chuỗi cung ứng dữ liệu. Bất chấp một số tuyên bố ấn tượng về hiệu quả tính toán của các mô hình, toàn bộ chi phí môi trường của quá trình phát triển vẫn chưa được chia sẻ.

Tổng thể, mức độ trưởng thành minh bạch dữ liệu thấp của DeepSeek đặt nó ngang hàng với Inflection-2, tốt hơn một chút so với Grok 2 của X và Gemini 1.5 của Google, và khá tệ hơn so với GPT-4o của OpenAI. Tất cả các mô hình đó vẫn còn được coi là có mức độ trưởng thành thấp về minh bạch dữ liệu, và đứng xa phía sau so với Aya của Cohere và Pythia của EleutherAI. DeepSeek R1 không phải là mô hình nguồn mở, cũng không là một tiêu chuẩn mới về minh bạch dữ liệu.

Việc có mức độ trưởng thành thấp về minh bạch dữ liệu có nghĩa đối với những người dùng khác nhau rằng:

  • Chúng tôi không thể xác định liệu dữ liệu có được sử dụng từ đối thủ cạnh tranh của họ hay không vì OpenAI và Microsoft được cho là đang điều tra

  • Tính xác thực của các tuyên bố về chi phí của DeepSeek, vì nó phần lớn được khởi tạo từ một mô hình trước đó mà họ chưa công bố chi phí đào tạo

  • Tính xác thực của các tuyên bố về hiệu quả đào tạo của DeepSeek, mặc dù một số tính toán cho thấy chúng là sự thật

Kết luận

Mặc dù có nhiều tuyên bố về mô hình AI 'nguồn mở' của DeepSeek, nhưng thực tế thì nó không phải là nguồn mở. Mặc dù cả trọng số mô hình và kiến trúc mô hình đều được chia sẻ trong một bài báo kỹ thuật, nhưng cả mã lẫn dữ liệu đào tạo hoặc đánh giá đều không được chia sẻ công khai. Một nhà phân tích của Sáng kiến Nguồn Mở cũng xác nhận rằng Deepseek không phải là AI Nguồn Mở và không đáp ứng các yêu cầu của định nghĩa AI Nguồn M (bản dịch sang tiếng Việt). Nó tham gia cùng các mô hình khác tuyên bố là nguồn mở, nhưng lại có điểm kém về tính minh bạch dữ liệu.

Cuối cùng, điều này có nghĩa là nhiều tuyên bố ấn tượng của DeepSeek về phát triển mô hình hiệu quả cao không thể được xác thực. Để điều này thực sự là một sự kiện mang tính đột phá, DeepSeek sẽ phải trở nên trưởng thành hơn nhiều với thông tin về tính minh bạch dữ liệu mà họ chia sẻ.

Nhìn chung, tính minh bạch dữ liệu vẫn tiếp tục là một cơ chế có liên quan để đánh giá các mô hình và nhà cung cấp mới. Chúng ta cần nhiều tính minh bạch hơn, không chỉ từ DeepSeek vì một số người lo sợ về nguồn dữ liệu và rủi ro về quyền riêng tư đối với người dùng, mà còn từ tất cả các nhà cung cấp mô hình dù là người Mỹ hay người Trung Quốc, mở hay đóng, lớn hay nhỏ.

Xem thêm:

We need more transparency, from all model providers.

On January 20th, the Chinese AI company DeepSeek released a language model called R1 which sent shockwaves across the global AI world. Accompanying the release were impressive claims regarding the model's development and capability, with the development of a model that is 10% of the supposed cost of OpenAI’s o1 and nearly twice as fast on benchmarks. That’s because, according to the technical report, R1 was less reliant on human labelling and instead was able to use an automated form of training. But what about the data? Where did it come from and how is it used?

The AI Data Transparency Index

Last month, the ODI launched the AI Data Transparency Index, a new framework to analyse whether model providers were sharing the information needed for meaningful data transparency. With the AIDTI model providers are assessed across seven dimensions, looking for transparency on things such as dataset sources and collection methods, processing activities carried out, and whether the datasets have been checked for copyrighted or personal data.

Through this process, we analysed 22 models from around the world, including models that also, like DeepSeek claimed to be ‘open source’. Our analysis identified that:

  • High maturity was demonstrated by five model providers, characterised by detailed, accessible documentation, consistent use of transparency tools, and a proactive approach to explaining decisions made in the development process.

  • Six model providers met some transparency criteria but lacked consistency for all dimensions and were therefore considered medium maturity.

  • Eleven model providers demonstrated low maturity with limited or poor-quality information, suggesting a general reluctance to be open.

We thought it would be a good opportunity to see how DeepSeek compared to its established competitors.

Two ODI researchers independently repeated our AI Data Transparency Index methodology for DeepSeek R1 and you can see the comparative results below.

Deepseek and data transparency

DeepSeek was unfortunately ranked at low maturity for all but one of our seven transparency dimensions. Due to relatively detailed summaries of the pre-processing and post-training activities that took place in developing DeepSeek R1, DeepSeek was scored at medium maturity for this. For the rest of them, DeepSeek scored poorly. There was no clear list of datasets used in the model and no transparent mechanism used (such as model or data cards) which help to make AI models more transparent and accessible. There were no details shared on whether this data included copyrighted data or personal information, nor any protections for this in place. As was further information on the full data supply chain. Despite some impressive claims as to the models compute efficiency, full environmental costs of the development were not shared.

Overall, DeepSeek’s low data transparency maturity puts it on a par with Inflection-2, moderately better than X’s Grok 2 and Google’s Gemini 1.5, and marginally worse than OpenAI’s GPT-4o. All of these models are still considered low maturity in data transparency, and languish far behind the likes of Cohere’s Aya and EleutherAI’s Pythia. DeepSeek R1 is not an open source model, nor is it a new standard for data transparency.

Being low maturity for data transparency means for different users that:

  • We can’t identify whether data was used from their competitors as OpenAI and Microsoft are reportedly probing

  • The veracity of DeepSeek’s cost claims, as it was largely bootstrapped from a previous model that they haven’t released the training costs for

  • The veracity of DeepSeek’s training efficiency claims, although some calculations suggest there is truth to them

Conclusion

While there are multiple claims to DeepSeek’s ‘open source’ AI model, in reality it is not open source. While both the model weights and the model architecture were shared in a technical paper, neither the code nor the training or evaluation data were shared openly. An analyst for the Open Source Initiative also confirmed that Deepseek is not Open Source AI and doesn’t meet the requirements of the Open Source AI definition. It joins other models which claim to be open source, but score poorly on data transparency.

Ultimately, this means that many of DeepSeek’s impressive claims to highly-efficient model development cannot be validated. For this truly to be a disruptive event, DeepSeek will be required to become much more mature with the data transparency information they share.

Overall, data transparency continues to be a relevant mechanism for judging new models and providers.We need more transparency, not just from DeepSeek because some people are fearful over the sources of the data and privacy risks for users, but from all model providers whether American or Chinese, open or closed, massive or tiny.

Dịch: Lê Trung Nghĩa

letrungnghia.foss@gmail.com


Thứ Tư, 5 tháng 2, 2025

DeepSeek của Trung Quốc vừa cho mọi công ty công nghệ Mỹ thấy họ đang bắt kịp AI nhanh như thế nào


China's DeepSeek just showed every American tech company how quickly it's catching up in AI

Analysis by Hasan Chowdhury; Jan 27, 2025, 11:47 PM GMT+7

Theo: https://www.aol.com/chinese-startup-just-showed-every-105106877.html

Bài được đưa lên Internet ngày: 27/01/2025

CEO Sam Altman của OpenAI. Một mô hình AI mới từ DeepSeek của Trung Quốc cạnh tranh với o1 của OpenAI. JOEL SAGET/AFP via Getty Images

  • Một công ty khởi nghiệp AI tại Trung Quốc vừa cho thấy cách họ đang thu hẹp khoảng cách với các phòng thí nghiệm AI hàng đầu của Mỹ.

  • Công ty khởi nghiệp DeepSeek của Trung Quốc đã phát hành một mô hình AI mới vào thứ Hai tuần trước, dường như để cạnh tranh với o1 của OpenAI.

  • Khả năng lý luận của nó đã khiến các nhà nghiên cứu AI hàng đầu của Mỹ phải kinh ngạc.

Donald Trump đã bắt đầu nhiệm kỳ tổng thống mới của mình bằng tuyên bố rằng nước Mỹ phải dẫn đầu thế giới. Ông vừa nhận được một lời cảnh báo từ một nhóm chuyên gia AI tại Trung Quốc, những người sẵn sàng chứng minh rằng sự thống trị về công nghệ của Hoa Kỳ không phải là điều hiển nhiên.

Hãy gặp DeepSeek, một công ty khởi nghiệp của Trung Quốc tách ra từ một quỹ đầu cơ đã tồn tại trong một thập kỷ, chuyên tính toán các giao dịch khôn ngoan bằng AI và thuật toán. Bản phát hành mới nhất của công ty, ra mắt vào ngày Trump nhậm chức, đã khiến nhiều nhà nghiên cứu hàng đầu của ngành công nghiệp Hoa Kỳ sửng sốt.

Trong một bài báo được phát hành vào thứ Hai tuần trước, DeepSeek đã tiết lộ một mô hình AI hàng đầu mới có tên là R1, cho thấy một cấp độ "lý luận" mới. Lý do tại sao nó lại để lại ấn tượng lớn như vậy đối với các chuyên gia AI tại Hoa Kỳ là điều quan trọng.

Một số phòng thí nghiệm AI có nguồn lực tốt nhất của Thung lũng Silicon ngày càng chuyển sang "lý luận" như một ranh giới nghiên cứu có thể phát triển công nghệ của họ từ mức độ thông minh giống như của sinh viên sang thứ gì đó hoàn toàn vượt qua trí thông minh của con người.

Để thực hiện được điều này, OpenAI, Google, Anthropic và những công ty khác đã tập trung vào việc đảm bảo các mô hình dành nhiều thời gian hơn để suy nghĩ trước khi trả lời truy vấn của người dùng. Đây là một quá trình tốn kém, chuyên sâu đòi hỏi rất nhiều sức mạnh tính toán đang hoạt động bên dưới.

Xin nhắc lại, OpenAI đã phát hành đầy đủ o1 — "các mô hình được thiết kế để dành nhiều thời gian suy nghĩ hơn trước khi phản hồi" — và nhận được sự đón nhận nồng nhiệt vào tháng 12 sau lần phát hành đầu tiên vào tháng 9. R1 của DeepSeek cho thấy khả năng thu hẹp khoảng cách nhanh chóng như thế nào.

DeepSeek thu hẹp khoảng cách

R1 thực sự làm gì? Đầu tiên, DeepSeek cho biết R1 đạt được "hiệu suất tương đương với OpenAI o1 trong các tác vụ toán học, mã và lý luận".

Bài báo nghiên cứu của công ty cho biết điều này có thể thực hiện được nhờ "tăng cường thuần túy việc học", một kỹ thuật mà Jim Fan, giám đốc nghiên cứu cấp cao tại Nvidia, cho biết gợi nhớ đến bí mật đằng sau việc biến AlphaZero của Google DeepMind trở thành bậc thầy trong các trò chơi như cờ vây và cờ vua ngay từ đầu, "mà không cần bắt chước các nước đi của đại kiện tướng con người trước đó". Ông đã viết trên X rằng đây là "điểm đáng chú ý nhất từ bài báo".

DeepSeek, ra mắt vào năm 2023, cho biết trong bài báo của mình rằng họ làm như vậy vì mục tiêu của công ty là khám phá tiềm năng của AI để "phát triển khả năng lý luận mà không cần bất kỳ dữ liệu giám sát nào". Đây là một kỹ thuật phổ biến được các nhà nghiên cứu AI sử dụng. Công ty cũng cho biết phiên bản R1 trước đó có tên là R1-Zero đã mang đến cho họ "khoảnh khắc aha" trong đó AI "học cách phân bổ nhiều thời gian suy nghĩ hơn cho một vấn đề bằng cách đánh giá lại cách tiếp cận ban đầu của mình".

Kết quả cuối cùng cung cấp những gì mà giáo sư Ethan Mollick của Wharton mô tả là phản hồi từ R1 có nội dung "giống như con người đang suy nghĩ thành tiếng".

Đáng chú ý là mức độ minh bạch này trong quá trình phát triển AI rất khó có thể tìm thấy trong các ghi chú do các công ty như OpenAI công bố khi phát hành các mô hình có khả năng tương tự.

Nathan Lambert, một nhà khoa học nghiên cứu tại Viện Allen về AI, cho biết trên Substack rằng bài báo của R1 "là một bước chuyển đổi quan trọng trong sự không chắc chắn trong nghiên cứu mô hình lý luận" vì "cho đến nay, các mô hình lý luận vẫn là một lĩnh vực nghiên cứu công nghiệp chính mà không có tài liệu quan trọng rõ ràng".

Giữ đúng tinh thần mở, mô hình R1 của DeepSeek, quan trọng là, từng là nguồn mở hoàn toàn, mang giấy phép MIT — tiêu chuẩn công nghiệp về cấp phép phần mềm.

Cùng nhau, các yếu tố này của R1 gây ra sự phức tạp cho những người chơi Hoa Kỳ bị cuốn vào cuộc chạy đua vũ trang về AI với Trung Quốc — đối thủ địa chính trị chính của Trump — vì một số lý do.

Đầu tiên, nó cho thấy Trung Quốc có thể cạnh tranh với một số mô hình AI hàng đầu trong ngành và bắt kịp với những phát triển tiên tiến đến từ Thung lũng Silicon.

Thứ hai, AI nguồn mở tiên tiến cao độ cũng có thể thách thức các công ty đang tìm cách kiếm lợi nhuận khổng lồ bằng cách bán công nghệ của họ.

Ví dụ, OpenAI đã giới thiệu kế hoạch ChatGPT Pro vào tháng 12 với mức giá 200 USD một tháng. Điểm hấp dẫn của gói này là nó bao gồm "quyền truy cập không giới hạn" vào mô hình thông minh nhất của mình tại thời điểm đó, o1. Nếu một mô hình nguồn mở cung cấp các khả năng tương tự miễn phí, động lực mua gói đăng ký thuê bao phải trả phí đắt đỏ có thể giảm đi.

Fan của Nvidia đã mô tả tình huống như thế này trên X: "Chúng ta đang sống trong một dòng thời gian mà một công ty không phải của Hoa Kỳ đang duy trì sứ mệnh ban đầu của OpenAI — nghiên cứu thực sự mở, tiên phong trao quyền cho tất cả mọi người".

DeepSeek đã từng thể hiện bí quyết lập luận trước đây. Vào tháng 11, công ty đã phát hành "R1-lite-preview" (bản xem trước nhỏ) cho thấy "quy trình suy nghĩ minh bạch theo thời gian thực" của mình. Vào tháng 12, công ty đã phát hành một mô hình có tên là V3 để làm nền tảng mới, lớn hơn cho lập luận trong tương lai trong các mô hình.

Đây là lý do quan trọng khiến các nhà nghiên cứu Mỹ nhìn thấy sự cải thiện có ý nghĩa ở mô hình mới nhất R1.

Theo Browne, một nhà phát triển phần mềm đứng sau kênh YouTube phổ biến dành cho cộng đồng công nghệ, cho biết "mô hình DeepSeek R1 mới thật đáng kinh ngạc". Tanay Jaipuria, một đối tác đầu tư vào AI tại Wing VC của Thung lũng Silicon, cũng mô tả nó là "đáng kinh ngạc".

Awni Hannun, một nhà nghiên cứu về máy học tại Apple, cho biết một lợi thế chính của R1 là ít chuyên sâu hơn, cho thấy ngành công nghiệp này đang "tiến gần đến o1 mã nguồn mở, tại nhà, trên phần cứng của người tiêu dùng", ám chỉ đến mô hình lý luận của OpenAI được giới thiệu vào năm ngoái.

Mô hình này có thể được "chưng cất", nghĩa là các phiên bản nhỏ hơn nhưng cũng mạnh mẽ hơn có thể chạy trên phần cứng ít chuyên sâu hơn nhiều so với sức mạnh tính toán được tải vào máy chủ trong các trung tâm dữ liệu mà nhiều công ty công nghệ phụ thuộc vào để chạy các mô hình AI của họ.

Hannun đã chứng minh điều này bằng cách chia sẻ một đoạn clip trên X về phiên bản R1 có 671 tỷ tham số chạy trên hai chip Apple M2 Ultra, trả lời một cách hợp lý cho một lời nhắc hỏi rằng liệu một bộ bài thẳng hay một bộ bài đồng chất tốt hơn trong một ván bài Texas Hold'em. Hannun cho biết phản ứng của họ "nhanh hơn tốc độ đọc".

Kiểm duyệt AI

R1 dường như có một vấn đề chính. Cựu thành viên hội đồng quản trị OpenAI Helen Toner đã chỉ ra trên X rằng có những bản demo về R1 "tự tắt khi được hỏi về các chủ đề mà CCP không thích".

Tuy nhiên, Toner đã gợi ý rằng "rõ ràng là kiểm duyệt được thực hiện bởi một lớp trên cùng, chứ không phải bản thân mô hình". DeepSeek đã không trả lời ngay lập tức yêu cầu bình luận.

Tất nhiên, điều đáng chú ý là OpenAI đã giới thiệu một mô hình mới có tên là o3, được cho là phiên bản kế nhiệm của mô hình o1 mà DeepSeek đang cạnh tranh. Lambert cho biết trong bài đăng trên blog của mình rằng OpenAI "có khả năng vượt trội về mặt kỹ thuật", nhưng ông đã thêm vào cảnh báo quan trọng là mô hình o3 "không khả dụng nói chung" và thông tin cơ bản như "trọng số" của mô hình này sẽ không sớm có.

Với thành tích của DeepSeek cho đến nay, đừng ngạc nhiên nếu mô hình tiếp theo của công ty này ngang bằng với o3. Các nhà lãnh đạo công nghệ của Hoa Kỳ có thể đã gặp đối thủ của họ ở Trung Quốc.

OpenAI CEO Sam Altman. A new AI model from China's DeepSeek rivals OpenAI's o1. JOEL SAGET/AFP via Getty Images

  • An AI startup in China just showed how it's closing the gap with America's top AI labs.

  • The Chinese startup DeepSeek released a new AI model last Monday that appears to rival OpenAI's o1.

  • Its reasoning capabilities have stunned top American AI researchers.

Donald Trump started his new presidency by declaring America must lead the world. He just got a warning shot from an AI crack team in China that's ready to show that US technological supremacy is not a given.

Meet DeepSeek, a Chinese startup spun off from a decade-old hedge fund that calculates shrewd trades with AI and algorithms. Its latest release, which came on the day Trump was inaugurated, has left many of America's top industry researchers stunned.

In a paper released last Monday, DeepSeek unveiled a new flagship AI model called R1 that shows off a new level of "reasoning." Why it has left such a huge impression on AI experts in the US matters.

Some of Silicon Valley's best-resourced AI labs have increasingly turned to "reasoning" as a frontier of research that can evolve their technology from a student-like level of intelligence to something that eclipses human intelligence entirely.

To accomplish this, OpenAI, Google, Anthropic, and others have focused on ensuring models spend more time thinking before responding to a user query. It's an expensive, intensive process that demands a lot from the computing power buzzing underneath.

As a reminder, OpenAI fully released o1 — "models designed to spend more time thinking before they respond" — to a glowing reception in December after an initial release in September. DeepSeek's R1 shows just how quickly it can close the gap.

DeepSeek narrows the gap

What exactly does R1 do? For one, DeepSeek says R1 achieves "performance comparable to OpenAI o1 across math, code, and reasoning tasks."

Its research paper says this is possible thanks to "pure reinforcement learning," a technique that Jim Fan, a senior research manager at Nvidia, said was reminiscent of the secret behind making Google DeepMind's AlphaZero a master at games such as go and chess from scratch, "without imitating human grandmaster moves first." He wrote on X that this was "the most significant takeaway from the paper."

DeepSeek, which launched in 2023, said in its paper that it did this because its goal was to explore the potential of AI to "develop reasoning capabilities without any supervised data." This is a common technique used by AI researchers. The company also said that an earlier version of R1 called R1-Zero gave them an "aha moment" in which the AI "learns to allocate more thinking time to a problem by reevaluating its initial approach."

The end result offers what the Wharton professor Ethan Mollick described as responses from R1 that read "like a human thinking out loud."

Notably, this level of transparency into the development of AI has been hard to come by in the notes published by companies such as OpenAI when releasing models of a similar aptitude.

Nathan Lambert, a research scientist at the Allen Institute for AI, said on Substack that R1's paper "is a major transition point in the uncertainty in reasoning model research" as "until now, reasoning models have been a major area of industrial research without a clear seminal paper."

Staying true to the open spirit, DeepSeek's R1 model, critically, has been fully open-sourced, having obtained an MIT license — the industry standard for software licensing.

Together, these elements of R1 provide complications to US players caught up in an AI arms race with China — Trump's main geopolitical rival — for a few reasons.

First, it shows that China can rival some of the top AI models in the industry and keep pace with cutting-edge developments coming out of Silicon Valley.

Second, open-sourcing highly advanced AI could also challenge companies that are seeking to make huge profits by selling their technology.

OpenAI, for instance, introduced a ChatGPT Pro plan in December that costs $200 a month. Its selling point was that it included "unlimited access" to its smartest model at the time, o1. If an open-source model offers similar capabilities for free, the incentive to buy a costly paid subscription could diminish.

Nvidia's Fan described the situation like this on X: "We are living in a timeline where a non-US company is keeping the original mission of OpenAI alive — truly open, frontier research that empowers all."

DeepSeek has shown off reasoning know-how before. In November, the company released an "R1-lite-preview" that showed its "transparent thought process in real time." In December, it released a model called V3 to serve as a new, bigger foundation for future reasoning in models.

It's a big reason American researchers see a meaningful improvement in the latest model, R1.

Theo Browne, a software developer behind a popular YouTube channel for the tech community, said that "the new DeepSeek R1 model is incredible." Tanay Jaipuria, a partner investing in AI at Silicon Valley's Wing VC, also described it as "incredible."

Awni Hannun, a machine-learning researcher at Apple, said a key advantage of R1 was that it was less intensive, showing that the industry was "getting close to open-source o1, at home, on consumer hardware," referring to OpenAI's reasoning model introduced last year.

The model can be "distilled," meaning smaller but also powerful versions can run on hardware that's far less intensive than the computing power loaded into servers in data centers many tech companies depend on to run their AI models.

Hannun demonstrated this by sharing a clip on X of a 671 billion-parameter version of R1 running on two Apple M2 Ultra chips, responding with reason to a prompt asking whether a straight or a flush is better in a game of Texas Hold'em. Hannun said its response came "faster than reading speed."

AI censorship

R1 does appear to have one key problem. The former OpenAI board member Helen Toner pointed out on X that there were demos of R1 "shutting itself down when asked about topics the CCP doesn't like."

Toner did suggest, however, that "the censorship is obviously being done by a layer on top, not the model itself." DeepSeek didn't immediately respond to a request for comment.

It is worth noting, of course, that OpenAI has introduced a new model called o3 that's meant to be a successor to the o1 model DeepSeek is rivaling. Lambert said in his blog post that OpenAI was "likely technically ahead," but he added the key caveat that the o3 model was "not generally available," nor would basic information such as its "weights" be available anytime soon.

Given DeepSeek's track record so far, don't be surprised if its next model shows parity to o3. America's tech leaders may have met their match in China.

Dịch: Lê Trung Nghĩa

letrungnghia.foss@gmail.com