Thứ Năm, 13 tháng 2, 2025

Alibaba phát hành mô hình AI mà họ cho là vượt trội hơn DeepSeek


Alibaba releases AI model it says surpasses DeepSeek

By Eduardo Baptista

January 29, 202511:21 PM GMT+7

Theo: https://www.reuters.com/technology/artificial-intelligence/alibaba-releases-ai-model-it-claims-surpasses-deepseek-v3-2025-01-29/

Bài được đưa lên Internet ngày: 29/01/2025

BẮC KINH, 29/01 (Theo Reuters) - Hôm thứ Tư, công ty công nghệ Trung Quốc Alibaba (9988.HK) đã phát hành phiên bản mới của mô hình trí tuệ nhân tạo Qwen 2.5 mà họ tuyên bố là vượt trội hơn so với DeepSeek-V3 vốn được đánh giá cao.

Thời điểm phát hành Qwen 2.5-Max bất thường, vào ngày đầu tiên của Tết Nguyên đán khi hầu hết người dân Trung Quốc nghỉ làm và ở bên gia đình, cho thấy áp lực mà công ty khởi nghiệp AI Trung Quốc DeepSeek phải chịu trong ba tuần qua không chỉ đối với các đối thủ nước ngoài mà còn đối với cả đối thủ trong nước.

"Qwen 2.5-Max vượt trội hơn ... hầu như trên mọi phương diện so với GPT-4o, DeepSeek-V3 và Llama-3.1-405B", đơn vị đám mây của Alibaba cho biết trong một thông báo được đăng trên tài khoản WeChat chính thức của mình, đề cập đến các mô hình AI nguồn mở tiên tiến nhất của OpenAI và Meta.

Việc phát hành trợ lý AI của DeepSeek vào ngày 10 tháng 1, được hỗ trợ bởi mô hình DeepSeek-V3, cũng như việc phát hành mô hình R1 vào ngày 20 tháng 1, đã gây sốc cho Thung lũng Silicon và khiến cổ phiếu công nghệ lao dốc, với chi phí phát triển và sử dụng được cho là thấp của công ty khởi nghiệp Trung Quốc này khiến các nhà đầu tư đặt câu hỏi về kế hoạch chi tiêu khổng lồ của các công ty AI hàng đầu tại Hoa Kỳ.

Nhưng thành công của DeepSeek cũng dẫn đến một cuộc chạy đua giữa các đối thủ cạnh tranh trong nước để nâng cấp các mô hình AI của riêng họ.

Hai ngày sau khi phát hành DeepSeek-R1, chủ sở hữu TikTok là ByteDance đã phát hành bản cập nhật cho mô hình AI hàng đầu của mình, được cho là vượt trội hơn o1 của OpenAI do Microsoft hậu thuẫn trong AIME, một bài kiểm tra chuẩn mực đo lường mức độ hiểu và phản hồi của các mô hình AI đối với các hướng dẫn phức tạp.

Điều này lặp lại tuyên bố của DeepSeek rằng mô hình R1 của họ đã cạnh tranh với o1 của OpenAI trên một số chuẩn mực hiệu suất.

Tiền thân của mô hình V3 của DeepSeek, DeepSeek-V2, đã gây ra một cuộc chiến giá thành mô hình AI ở Trung Quốc sau khi được phát hành vào tháng 5 năm ngoái.

Thực tế là DeepSeek-V2 là mã nguồn mở và rẻ chưa từng có, chỉ 1 nhân dân tệ (0,14 đô la) cho 1 triệu mã thông báo - hoặc các đơn vị dữ liệu được mô hình AI xử lý - đã khiến đơn vị đám mây của Alibaba tuyên bố giảm giá tới 97% cho một loạt các mô hình.

Các công ty công nghệ Trung Quốc khác cũng làm theo, bao gồm Baidu (9888.HK), công ty đã phát hành phiên bản tương đương đầu tiên của Trung Quốc với ChatGPT vào tháng 3 năm 2023 và công ty internet có giá trị nhất của đất nước này là Tencent (0700.HK).

Liang Wenfeng, người sáng lập bí ẩn của DeepSeek, cho biết trong một cuộc phỏng vấn hiếm hoi với hãng truyền thông Trung Quốc Waves vào tháng 7 rằng công ty khởi nghiệp này "không quan tâm" đến cuộc chiến giá cả và mục tiêu chính của họ là đạt được trí tuệ nhân tạo tổng quát - AGI (Artificial General Intelligence).

OpenAI định nghĩa AGI là các hệ thống tự động vượt qua con người trong hầu hết các nhiệm vụ có giá trị kinh tế.

Trong khi các công ty công nghệ lớn của Trung Quốc như Alibaba có hàng trăm nghìn nhân viên, DeepSeek hoạt động như một phòng thí nghiệm nghiên cứu, chủ yếu có nhân viên là những sinh viên mới tốt nghiệp và nghiên cứu sinh tiến sĩ từ các trường đại học hàng đầu Trung Quốc.

Liang cho biết trong cuộc phỏng vấn vào tháng 7 rằng ông tin rằng các công ty công nghệ lớn nhất Trung Quốc có thể không phù hợp với tương lai của ngành công nghiệp AI, đối lập với chi phí cao và cấu trúc theo chiều từ trên xuống (top-down) của họ so với hoạt động tinh gọn và phong cách quản lý lỏng lẻo của DeepSeek.

"Các mô hình nền tảng lớn đòi hỏi sự đổi mới liên tục, khả năng của các công ty công nghệ khổng lồ có giới hạn của chúng", ông nói.

Bản tin tóm tắt hàng ngày của Reuters cung cấp mọi tin tức bạn cần để bắt đầu ngày mới. Đăng ký tại đây.

Báo cáo của Eduardo Baptista; Biên tập bởi Christian Schmollinger

Tiêu chuẩn của chúng tôi: Nguyên tắc tin cậy của Thomson Reuters.

BEIJING, Jan 29 (Reuters) - Chinese tech company Alibaba (9988.HK) on Wednesday released a new version of its Qwen 2.5 artificial intelligence model that it claimed surpassed the highly-acclaimed DeepSeek-V3.

The unusual timing of the Qwen 2.5-Max's release, on the first day of the Lunar New Year when most Chinese people are off work and with their families, points to the pressure Chinese AI startup DeepSeek's meteoric rise in the past three weeks has placed on not just overseas rivals, but also its domestic competition.

"Qwen 2.5-Max outperforms ... almost across the board GPT-4o, DeepSeek-V3 and Llama-3.1-405B," Alibaba's cloud unit said in an announcement posted on its official WeChat account, referring to OpenAI and Meta's most advanced open-source AI models.

The Jan. 10 release of DeepSeek's AI assistant, powered by the DeepSeek-V3 model, as well as the Jan. 20 release of its R1 model, has shocked Silicon Valley and caused tech shares to plunge, with the Chinese startup's purportedly low development and usage costs prompting investors to question huge spending plans by leading AI firms in the United States.

But DeepSeek's success has also led to a scramble among its domestic competitors to upgrade their own AI models.

Two days after the release of DeepSeek-R1, TikTok owner ByteDance released an update to its flagship AI model, which it claimed outperformed Microsoft-backed OpenAI's o1 in AIME, a benchmark test that measures how well AI models understand and respond to complex instructions.

This echoed DeepSeek's claim that its R1 model rivalled OpenAI's o1 on several performance benchmarks.

The predecessor of DeepSeek's V3 model, DeepSeek-V2, triggered an AI model price war in China after it was released last May.

The fact that DeepSeek-V2 was open-source and unprecedentedly cheap, only 1 yuan ($0.14) per 1 million tokens - or units of data processed by the AI model - led to Alibaba's cloud unit announcing price cuts of up to 97% on a range of models.

Other Chinese tech companies followed suit, including Baidu (9888.HK) , which released China's first equivalent to ChatGPT in March 2023, and the country's most valuable internet company Tencent (0700.HK).

Liang Wenfeng, DeepSeek's enigmatic founder, said in a rare interview with Chinese media outlet Waves in July that the startup "did not care" about price wars and that achieving AGI (artificial general intelligence) was its main goal.

OpenAI defines AGI as autonomous systems that surpass humans in most economically valuable tasks.

While large Chinese tech companies like Alibaba have hundreds of thousands of employees, DeepSeek operates like a research lab, staffed mainly by young graduates and doctorate students from top Chinese universities.

Liang said in his July interview that he believed China's largest tech companies might not be well suited to the future of the AI industry, contrasting their high costs and top-down structures with DeepSeek's lean operation and loose management style.

"Large foundational models require continued innovation, tech giants' capabilities have their limits," he said.

The Reuters Daily Briefing newsletter provides all the news you need to start your day. Sign up here.

Reporting by Eduardo Baptista; Editing by Christian Schmollinger

Our Standards: The Thomson Reuters Trust Principles.

Dịch: Lê Trung Nghĩa

letrungnghia.foss@gmail.com

Thứ Tư, 12 tháng 2, 2025

DeepSeek sẽ làm đảo lộn ngành công nghiệp AI như thế nào — và mở ra cơ hội cạnh tranh

Credit: Shutterstock/Rokas Tenys

How DeepSeek will upend the AI industry — and open it to competition

News Analysis; Jan 30, 20256 mins

Theo: https://www.computerworld.com/article/3812701/how-deepseek-will-upend-the-ai-industry-and-open-it-to-competition.html

Bài được đưa lên Internet ngày: 30/01/2025

Các kỹ thuật tiết kiệm chi phí của công ty khởi nghiệp Trung Quốc DeepSeek để đào tạo và cung cấp các mô hình AI tạo sinh (genAI) có thể dân chủ hóa toàn bộ ngành bằng cách hạ thấp rào cản lối vào cho các công ty AI mới.

DeepSeek đã tạo nên làn sóng trong tuần này khi chatbot của công ty đã vượt qua lượt tải xuống ChatGPT trên Apple và Google App Store. Tác động của mô hình AI nguồn mở này nằm ở việc phù hợp với hiệu suất của các mô hình hàng đầu của Hoa Kỳ với chi phí chỉ bằng một phần nhỏ bằng cách sử dụng tài nguyên tính toán và bộ nhớ hiệu quả hơn.

DeepSeek không chỉ là "ChatGPT" của Trung Quốc; mà còn là một bước tiến lớn cho AI toàn cầu bằng cách giúp việc xây dựng mô hình rẻ hơn, nhanh hơn và dễ tiếp cận hơn, theo Forrester Research. Mặc dù các mô hình ngôn ngữ lớn (LLM) không phải là con đường duy nhất dẫn đến AI tiên tiến, nhưng những đổi mới của DeepSeek nên được "tôn vinh như một cột mốc cho sự tiến bộ của AI", công ty nghiên cứu cho biết.

Hiệu quả của phương pháp luận AI của DeepSeek có nghĩa là nó yêu cầu ít năng lực tính toán hơn nhiều để chạy; điều đó có nghĩa là nó cũng có thể ảnh hưởng đến ngành công nghiệp chip, vốn đang tận dụng làn sóng mua phần cứng tăng tốc GPU và AI của các công ty đang xây dựng các trung tâm dữ liệu khổng lồ.

Ví dụ, Meta đang có kế hoạch chi 65 tỷ đô la để xây dựng một trung tâm dữ liệu có diện tích gần bằng Manhattan. Dự kiến sẽ đi vào hoạt động vào cuối năm nay, trung tâm dữ liệu này sẽ chứa 1,3 triệu GPU để cung cấp năng lượng cho công nghệ AI được Facebook và các liên doanh khác của Meta sử dụng.

Rita Sallam, phó chủ tịch phân tích nổi tiếng tại Gartner Research cho biết: "Chi phí của nhà cung cấp hàng đầu hiện tại và các mô hình định giá kết quả chuyển chi phí đổi mới và phát triển, đào tạo và vận hành LLM cao đã khiến chỉ những công ty lớn nhất, được tài trợ tốt nhất và có nhiều tiền nhất mới có thể phát triển LLM".

Sallam cho biết chi phí cao đã cản trở việc áp dụng GenAI, dẫn đến lợi nhuận đầu tư âm cho nhiều trường hợp sử dụng của tổ chức ở quy mô lớn. Điều đó, đến lượt nó, đã kìm hãm sự đổi mới, ngay cả khi có trợ cấp của nhà cung cấp. Bà cho biết cách tiếp cận của DeepSeek cắt giảm chi phí phần cứng và tính toán, cho phép các công ty nhỏ hơn cạnh tranh trong quá trình phát triển LLM và thúc đẩy đổi mới GenAI mới.

Bây giờ khi các kỹ thuật của DeepSeek đã được biết đến, các nhà xây dựng mô hình khác, bao gồm cả những người dẫn đầu, sẽ nhanh chóng làm theo, giảm chi phí LLM trong ngắn hạn đến trung hạn. Tuy nhiên, các bộ xử lý và bộ tăng tốc mạnh mẽ vẫn sẽ thúc đẩy chi phí R&D và tính toán cao cho các mô hình tiên tiến, sẽ được chuyển cho những người áp dụng sớm. Sallam lưu ý rằng việc giảm chi phí ban đầu đó sẽ thúc đẩy việc áp dụng và đổi mới GenAI rộng rãi hơn.

Brendan Englot, giáo sư và chuyên gia AI tại Viện Công nghệ Stevens ở New Jersey, cho biết thực tế là các mô hình của DeepSeek cũng là mã nguồn mở cũng sẽ giúp các công ty khởi nghiệp AI khác dễ dàng cạnh tranh hơn với các công ty công nghệ lớn. Englot, cũng là giám đốc của Viện Trí tuệ nhân tạo Stevens (SIAI), cho biết: "Công nghệ của DeepSeek là một ví dụ tuyệt vời về cách các công cụ mới mang tính đột phá và sáng tạo có thể được xây dựng nhanh hơn với sự hỗ trợ của phần mềm nguồn mở".

Sự xuất hiện của DeepSeek đã làm giảm giá cổ phiếu của nhà cung cấp GPU hàng đầu Nvidia, vì các nhà đầu tư nhận ra tác động của các quy trình hiệu quả hơn đối với doanh số bán bộ xử lý và bộ tăng tốc AI.

"DeepThink" là một tính năng trong chatbot AI DeepSeek tận dụng mô hình R1 để cung cấp khả năng suy luận nâng cao, sử dụng các kỹ thuật tiên tiến để chia nhỏ các truy vấn phức tạp thành các tác vụ nhỏ hơn, dễ quản lý hơn.

Nhờ những loại tối ưu hóa đó, DeepThink (R1) chỉ tốn khoảng 5,5 triệu đô la để đào tạo — ít hơn hàng chục triệu đô la so với các mô hình tương tự. Mặc dù điều này có thể làm giảm nhu cầu ngắn hạn đối với Nvidia, nhưng chi phí thấp hơn có thể sẽ thúc đẩy nhiều công ty khởi nghiệp và doanh nghiệp tạo ra các mô hình hơn, thúc đẩy nhu cầu dài hạn, Forrester Research cho biết.

Và, trong khi chi phí đào tạo các mô hình AI vừa giảm đáng kể với DeepThink, chi phí để hỗ trợ suy luận vẫn sẽ đòi hỏi khả năng tính toán và lưu trữ đáng kể, Forrester cho biết. "Sự thay đổi này cho thấy các nhà cung cấp mô hình AI cốt lõi sẽ không đủ, mở rộng hơn nữa thị trường AI", công ty cho biết trong một lưu ý nghiên cứu. "Đừng khóc cho Nvidia và các công ty siêu quy mô ngay bây giờ. Ngoài ra, có thể có cơ hội để Intel giành lại vị thế của mình".

Englot đồng ý, nói rằng hiện tại có rất nhiều sự cạnh tranh và đầu tư để sản xuất phần mềm và phần cứng AI hữu ích, "và điều đó có khả năng mang lại nhiều đột phá hơn nữa trong tương lai rất gần".

Công nghệ cơ sở DeepSeek không phải là công nghệ tiên phong. Ngược lại, bài báo nghiên cứu mới công bố của công ty cho thấy mô hình Llama của Meta và Qwen của Alibaba đóng vai trò quan trọng trong việc phát triển DeepSeek-R1 và DeepSeek-R1-Zero — hai mô hình đầu tiên của công ty, Englot lưu ý.

Trên thực tế, Englot không tin rằng bước tiến của DeepSeek gây ra nhiều mối đe dọa cho ngành công nghiệp bán dẫn như sự sụt giảm cổ phiếu trong tuần này cho thấy. Các công cụ GenAI vẫn sẽ dựa vào GPU và bước đột phá của DeepSeek chỉ cho thấy một số tính toán có thể được thực hiện hiệu quả hơn.

"Nếu có bất kỳ điều gì, thì sự tiến bộ này là tin tốt mà tất cả các nhà phát triển công nghệ AI đều có thể tận dụng", Englot cho biết. "Những gì chúng ta thấy vào đầu tuần này chỉ là một dấu hiệu cho thấy cần ít phần cứng máy tính hơn để đào tạo và triển khai một mô hình ngôn ngữ mạnh mẽ hơn so với chúng ta đã nghĩ ban đầu. Điều này có thể cho phép những người đổi mới AI tiến lên phía trước và dành nhiều sự chú ý hơn cho các nguồn lực cần thiết cho AI đa phương thức và các ứng dụng tiên tiến ngoài các bot trò chuyện".

Những người khác đồng ý.

Mel Morris, Giám đốc điều hành của công ty khởi nghiệp Corpora.ai, cho biết khả năng chi trả và mô hình nguồn mở của DeepSeek cho phép các nhà phát triển tùy chỉnh và đổi mới một cách rẻ và tự do. Ông cho biết nó cũng sẽ thách thức bối cảnh cạnh tranh và thúc đẩy các công ty lớn như OpenAI — nhà phát triển ChatGPT — thích ứng nhanh chóng.

Morris cho biết: “Ý tưởng về sự cạnh tranh thúc đẩy đổi mới đặc biệt có liên quan ở đây, vì sự hiện diện của DeepSeek có khả năng thúc đẩy những tiến bộ nhanh hơn trong công nghệ AI, dẫn đến các giải pháp hiệu quả và dễ tiếp cận hơn để đáp ứng nhu cầu ngày càng tăng”. “Ngoài ra, mô hình nguồn mở trao quyền cho các nhà phát triển tinh chỉnh và thử nghiệm hệ thống, thúc đẩy tính linh hoạt và đổi mới cao hơn”.

Forrester cảnh báo rằng, theo chính sách bảo mật của mình, DeepSeek nêu rõ rằng họ có thể thu thập “văn bản hoặc đầu vào âm thanh, lời nhắc, tệp đã tải lên, phản hồi, lịch sử trò chuyện hoặc nội dung khác của bạn” và sử dụng cho mục đích đào tạo. Họ cũng nêu rõ rằng họ có thể chia sẻ thông tin này với các cơ quan thực thi pháp luật [và] các cơ quan công quyền theo quyết định của mình.

Những cảnh báo đó có thể gây lo ngại cho các doanh nghiệp đã vội vàng áp dụng các công cụ genAI nhưng lại lo ngại về quyền riêng tư dữ liệu, đặc biệt là khi liên quan đến thông tin nhạy cảm của công ty.

Forrester cho biết: “Hãy giáo dục và thông báo cho nhân viên của bạn về hậu quả của việc sử dụng công nghệ này và nhập thông tin cá nhân và công ty vào đó”. “Đồng ý với các nhà lãnh đạo sản phẩm về việc liệu các nhà phát triển có nên thử nghiệm tính năng này hay không và liệu sản phẩm có nên hỗ trợ việc triển khai tính năng này mà không cần các yêu cầu về quyền riêng tư chặt chẽ hơn hay không.”

--------------------------


Lucas Mearian

Phóng viên cao cấp

1. Theo dõi Lucas Mearian trên X

Phóng viên cao cấp Lucas Mearian đưa tin về AI trong doanh nghiệp, các vấn đề về Tương lai của công việc, CNTT chăm sóc sức khỏe và FinTech.

Chinese start-up DeepSeek’s cost-saving techniques for training and delivering generative AI (genAI) models could democratize the entire industry by lowering entry barriers for new AI companies.

DeepSeek made waves this week as its chatbot overtook ChatGPT downloads on the Apple and Google App Stores. The open-source AI model’s impact lies in matching leading US models’ performance at a fraction of the cost by using compute and memory resources more efficiently.

DeepSeek is more than China’s “ChatGPT”; it’s a major step forward for global AI by making model building cheaper, faster, and more accessible, according to Forrester Research. While large language models (LLMs) aren’t the only route to advanced AI, DeepSeek’s innovations should be “celebrated as a milestone for AI progress,” the research firm said.

The efficiencies of DeepSeek’s AI methodology means it requires vastly less compute capacity on which to run; that means it could also affect the chip industry, which has been riding a wave of GPU and AI accelerator hardware purchases by companies building out massive data centers.

For example, Meta is planning to spend $65 billion to build a data center with a footprint that’s almost as large as Manhattan. Expected to come online at the end of this year, the data center would house 1.3 million GPUs to power AI tech used by Facebook and other Meta ventures.

“Current leading vendor costs and resulting pricing models that pass on the high cost of innovation and developing, training and running LLMs have resulted in only the largest most well-funded companies with the deepest pockets being able to develop LLMs, said Rita Sallam, a distinguished vice president analys at Gartner Research.

High costs have hindered GenAI adoption, leading to negative returns on investments for many organization’s use cases at scale, Sallam said. That, in turn, has stifled innovation, even with vendor subsidies. DeepSeek’s approach cuts hardware and computational costs, allowing smaller companies to compete in LLM development and drive new GenAI innovation, she said.

Now that DeepSeek’s techniques are known, other model builders, including leaders, will quickly follow, reducing LLM costs in the short to mid-term. However, powerful processors and accelerators will still drive high R&D and compute costs for advanced models, which will be passed to early adopters. Those initial cost reductions will spark broader GenAI adoption and innovation, Sallam noted.

Brendan Englot, a professor and AI expert at Stevens Institute of Technology in New Jersey, said the fact that DeepSeek’s models are also open source will also help make it easier for other AI start-ups to compete against large tech companies. “DeepSeek’s technology provides an excellent example of how disruptive and innovative new tools can be built faster with the aid of open source software,” said Englot, who is also director of the Stevens Institute for Artificial Intelligence (SIAI).

DeepSeek’s arrival on the scene tanked GPU-leading provider Nvidia’s stock, as investors realized the impact the more efficient processes would have on AI processor and accelerator sales.

“DeepThink” a feature within the DeepSeek AI chatbot that leverages the R1 model to provide enhanced reasoning capabilities, uses advanced techniques to break down complex queries into smaller, manageable tasks.

Thanks to those kinds of optimizations, DeepThink (R1) only cost about $5.5 million to train — tens of millions of dollars less than similar models. While this could reduce short-term demand for Nvidia, the lower cost will likely drive more startups and enterprises to create models, boosting demand long-term, Forrester Research said.

And, while the costs to train AI models have just declined significantly with DeepThink, the cost to support inferencing will still require significant compute and storage, Forrester said. “This shift shows that core AI model providers won’t be enough, further opening the AI market,” the firm said in a research note. “Don’t cry for Nvidia and the hyperscalers just yet. Also, there might be an opportunity for Intel to claw its way back to relevance.”

Englot agreed, saying there is a lot of competition and investment right now to produce useful AI software and hardware, “and that is likely to yield many more breakthroughs in the very near future.”

DeepSeek base technology isn’t pioneering. On the contrary, the company’s recently published research paper shows that Meta’s Llama and Alibaba’s Qwen models were key to developing DeepSeek-R1 and DeepSeek-R1-Zero — its first two models, Englot noted.

In fact, Englot doesn’t believe DeepSeek’s advance poses as much of a threat to the semiconductor industry as this week’s stock slide suggests. GenAI tools will still rely on GPUs, and DeepSeek’s breakthrough just shows some computing can be done more efficiently.

“If anything, this advancement is good news that all developers of AI technology can take advantage of,” Englot said. “What we saw earlier this week was just an indication that less computing hardware is needed to train and deploy a powerful language model than we originally assumed. This can permit AI innovators to forge ahead and devote more attention to the resources needed for multi-modal AI and advanced applications beyond chat-bots.”

Others agreed.

Mel Morris, CEO of startup Corpora.ai, said DeepSeek’s affordability and open-source model allows developers to customize and innovate cheaply and freely. It will also challenge the competitive landscape and push major players like OpenAI — the developer of ChatGPT — to adapt quickly, he said.

“The idea that competition drives innovation is particularly relevant here, as DeepSeek’s presence is likely to spur faster advancements in AI technology, leading to more efficient and accessible solutions to meet the growing demand,” Morris said. “Additionally, the open-source model empowers developers to fine-tune and experiment with the system, fostering greater flexibility and innovation.”

Forrester cautioned that, according to its privacy policy, DeepSeek explicitly says it can collect “your text or audio input, prompt, uploaded files, feedback, chat history, or other content” and use it for training purposes. It also states it can share this information with law enforcement agencies [and] public authorities at its discretion.

Those caveats could be of concern to enterprises who have rushed to embrace genAI tools but have been concerned about data privacy, especially when it involves sensitive corporate information.

“Educate and inform your employees on the ramifications of using this technology and inputting personal and company information into it,” Forrester said. “Align with product leaders on whether developers should be experimenting with it and whether the product should support its implementation without stricter privacy requirements.”

--------------------------

by Lucas Mearian

Senior Reporter

  1. Follow Lucas Mearian on X

Senior Reporter Lucas Mearian covers AI in the enterprise, Future of Work issues, healthcare IT and FinTech.

Dịch: Lê Trung Nghĩa

letrungnghia.foss@gmail.com

Thứ Ba, 11 tháng 2, 2025

DeepSeek chứng minh: Nguồn mở là bí quyết thống trị thị trường công nghệ (và Phố Wall đã sai)


DeepSeek Proves It: Open Source is the Secret to Dominating Tech Markets (and Wall Street has it wrong)


Jim Zemlin
, Giám đốc Điều hành tại Quỹ Linux Foundation

Theo: https://www.linkedin.com/pulse/deepseek-proves-open-source-secret-dominating-tech-markets-jim-zemlin-f1lic/

Bài được đưa lên Internet ngày: 28/01/2025

Tôi hiếm khi viết blog hoặc đăng bài trên mạng xã hội nhưng tôi viết bản tin riêng hàng tuần cho nhân viên và ban quản trị của chúng tôi và trong vài tuần liên tiếp đã viết về DeepSeek. Điều tôi không cân nhắc là phản ứng của báo chí và thị trường trong tuần này. Những người tốt như Ben Thompson, Pat Gellisnger, Tomasz Tunguz đều đã bình luận. Với việc cổ phiếu AI bị đánh tơi tả và những lo ngại nghiêm trọng nổi lên về tác động của mô hình R1 của DeepSeek đối với tương lai của AI, rõ ràng là nỗi sợ hãi về DeepSeek đã chạm sâu đến dây thần kinh. Phản ứng lớn đó xứng đáng được xem xét và giải thích.

Ngắn gọn, những gì thị trường phản ứng là khả năng của DeepSeek trong việc xây dựng một mô hình có thể sánh ngang với mô hình lý luận o1 tinh vi của OpenAI và mô hình Sonnet của Anthropic với chi phí chỉ bằng một phần nhỏ của việc tính toán. Có vẻ như DeepSeek đã thực hiện điều này bằng các kỹ thuật nổi tiếng. Không có đột phá thuật toán lớn nào, chỉ là kỹ thuật rất thông minh. Nhóm vừa quay lại với Nguyên tắc đầu tiên, đặt những câu hỏi cơ bản và xếp chồng các kỹ thuật hiện có theo những cách mới lạ để đạt được kết quả vượt trội bằng cách sử dụng Học tăng cường – RL (Reinforcement Learning) và nhiều giai đoạn tinh chỉnh khác nhau. Không có phép thuật nào ở đây — chỉ là sự xáo trộn rất thông minh các thẻ hiện có tạo ra kết quả tinh tế và hiệu quả hơn.

Một số nhà quan sát cáo buộc DeepSeek "ăn theo" công trình của những nhà sản xuất mô hình lớn khác như Meta (Llama) và AliBaba (Qwen). Tuy nhiên, quan điểm này phản ánh sự hiểu lầm về cách thức hoạt động của các hệ thống nguồn mở. Nguyên tắc cơ bản của đổi mới nguồn mở là kỳ vọng rằng những người khác sẽ xây dựng dựa trên công trình trước đó để thúc đẩy tiến trình.

Trong trường hợp của DeepSeek, họ đã chứng minh điều này bằng cách chắt lọc mô hình lý luận cơ bản của họ, DeepSeek-R1—một sự phát triển của mô hình DeepSeek-V3-Base nguồn mở trước đó của họ —và tinh chỉnh các mô hình nhỏ hơn từ loạt mô hình Llama 3 và Qwen 2.5 bằng cách sử dụng dữ liệu lý luận do mô hình cơ sở của họ tạo ra. Quá trình này làm nổi bật cách DeepSeek tận dụng các đổi mới mở hiện có, không chỉ sao chép mà còn chứng minh những cải tiến đáng kể về hiệu suất của mô hình ngôn ngữ nhỏ. Sau đó, DeepSeek đã phát hành lại các mô hình đó trở lại cộng đồng AI nguồn mở.

Đây là Điểm chính. Những gì mà tin tức và bình luận bỏ lỡ là cơ hội to lớn mà DeepSeek đã mở ra cho nguồn mở và rộng hơn là toàn bộ phong trào mở. Quá nhiều cuộc trò chuyện được định hình là Hoa Kỳ so với Trung Quốc và cuộc đua giành quyền tối cao về AI. Quá nhiều cuộc trò chuyện được định hình trên ý tưởng rằng DeepSeek đào tạo một mô hình mạnh mẽ trên một phần nhỏ của tính toán với một phần nhỏ chi phí có nghĩa là tất cả các công ty lớn chi nhiều tiền cho thiết bị và đào tạo NVIDIA sẽ bị cắt giảm.

Theo quan điểm (thiên vị) của tôi, đổi mới nguồn mở sẽ chiến thắng và điều này thực sự sẽ tốt cho tất cả mọi người — Trung Quốc, Hoa Kỳ, Big Tech, Chủ quyền kỹ thuật số châu Âu, NVIDIA, v.v. Một số nhà đầu tư mạo hiểm đặt cược vào các công ty khởi nghiệp AI ban đầu đã trở thành các tính năng bên trong các dịch vụ AI lớn hơn có thể bị xóa sổ, nhưng điều đó xảy ra trong bất kỳ giai đoạn chuyển đổi công nghệ nào. Điều mà DeepSeek chứng minh là chúng ta cần hàng nghìn con mắt nhìn vào vấn đề để đưa ra các giải pháp tốt hơn nhằm biến trí thông minh trở nên gần với miễn phí nhất có thể. Một nhóm nhỏ ở Trung Quốc đã xem xét lại một vấn đề và đưa ra một cách tiếp cận mới giúp giảm chi phí suy luận theo chuỗi suy nghĩ xuống 50 lần (nếu các bài đăng của DeepSeek là chính xác) và sau đó xuất bản một bài báo mô tả đầy đủ về quy trình của họ, cho phép cộng đồng được hưởng lợi từ những bài học kinh nghiệm của họ. Chúng ta cần NHIỀU hơn nữa tiến bộ này, chứ không phải ít hơn. Đây không phải là cuộc chạy đua vũ trang giữa Hoa Kỳ và Trung Quốc. Đây là cuộc đấu tranh giành thị trường mở giữa các lực lượng mở và các lực lượng đóng. Các chính phủ có thể nghĩ rằng họ có thể kiểm soát được điều này, nhưng lịch sử cho thấy công nghệ mở, một khi được phát hiện và đưa vào tay cộng đồng, thì giống như mưa. Bạn không thể tạm dừng hoặc ngăn chặn nó. Việc ngăn chặn sự phát triển khoa học một cách giả tạo chưa bao giờ có hiệu quả trong bất kỳ thời hạn dài nào và khoa học máy tính và AI cũng không ngoại lệ.

Vào tháng 3 năm 2013, thế giới nguồn mở đã giới thiệu một cách nhẹ nhàng, chuẩn hóa để đóng gói và chạy các ứng dụng với tất cả các phụ thuộc của chúng, đảm bảo tính nhất quán trên các môi trường khác nhau. Không giống như các máy ảo truyền thống, các container Docker sử dụng các môi trường biệt lập trên một hệ điều hành cơ bản duy nhất để thực hiện ảo hóa. Các container Docker nhanh hơn, khả chuyển hơn và hiệu quả hơn bằng cách chia sẻ hạt nhân của hệ thống máy chủ trong khi cô lập các quy trình. Docker đã tổ chức lại nhiều khả năng ảo hóa và container nguồn mở hiện có như cgroups, LXC, không gian tên, v.v. Việc tổ chức lại đó hoặc xáo trộn các thẻ hiện có đã thay đổi trò chơi. Máy ảo đã hoạt động tốt trong nhiều năm, nhưng các container Docker tốt hơn nhiều đối với nhiều tải công việc. Tính mở của sự thay đổi công nghệ đó đã giúp thúc đẩy làn sóng mới áp dụng điện toán bẩm sinh đám mây.

Một hiểu lầm cơ bản khác là DeepSeek sẽ yêu cầu ít đầu tư vào cơ sở hạ tầng AI hơn. Tuy nhiên, có một nhu cầu vô hạn đối với trí thông minh. Chúng ta thậm chí còn chưa khám phá hết bề mặt và đang ở giai đoạn đầu khai thác các ứng dụng hỗ trợ AI.

Những cải tiến gần đây hơn trong các mô hình AI đã chuyển mối liên hệ của lý luận từ các cải tiến trước khi đào tạo và sau khi đào tạo sang tính toán thời gian thử nghiệm hiện nay, cho phép các mô hình "lý luận" thông qua phản hồi của chúng (chuỗi suy nghĩ). Điều này không có nghĩa là chúng ta cần ít tính toán hơn. Trên thực tế, nó có nghĩa là chúng ta cần nhiều tính toán hơn, khi lớp suy luận hoạt động giống như bộ não con người hơn — luôn suy nghĩ, xem xét lại, giải quyết nhiều nhiệm vụ cùng một lúc và phát triển để đáp ứng nhu cầu về các hoạt động trí tuệ mới. Điều này giống như điện hơn — một loại hàng hóa. Làm cho nó rẻ hơn để có thể ứng dụng nhiều hơn (như VC Tomasz Tungus giải thích rõ ràng tại đây) và nhiều người sẽ sử dụng nó hơn.

Đối với nguồn mở, điều này mở ra một ranh giới mới to lớn. Nếu nguồn mở chiến thắng trong AI và trở thành mô hình đổi mới và phát triển thống trị, thì chúng ta có cơ hội định hình lại cách thế giới hoạt động ở cấp độ cơ bản. DeepSeek là một ví dụ về việc cung cấp lý luận sẵn sàng cho nhiều người dùng và ứng dụng hơn. AI nguồn mở có thể là con đường để cung cấp tính tương hợp và các tiêu chuẩn thực sự giữa các ứng dụng và ngăn xếp ứng dụng.

AI là siêu lớp (Meta-Layer) mà chúng ta có thể xây dựng kỳ vọng mới về tính tương hợp, một thực tế mới mà Satya Nadela đã ám chỉ khi ông phát biểu tại nhiều diễn đàn về cách AI có thể phá vỡ các ứng dụng Phần mềm như một Dịch vụ – SaaS (Software as a Service) bằng cách cho phép các tổ chức kết nối các phần phụ trợ và nguồn dữ liệu khác nhau với các máy (công cụ) AI. Nói cách khác, AI nguồn mở mang đến cho thế giới cơ hội viết lại các quy tắc có lợi cho bất kỳ điều gì mở, ở mọi nơi có thể. Trong thế giới này, quyền lực thuộc về cộng đồng và những người bảo trì.

Tất nhiên, có rất nhiều sắc thái xung quanh nguồn mở và cách thức hoạt động của nó. Nhưng qua lăng kính này, tôi tin rằng bài học của DeepSeek là về sự bùng nổ AI sắp tới và cách nó có thể mang lại lợi ích cho mọi người và thúc đẩy tiến bộ kinh tế và công nghệ vượt xa những gì thị trường nhận thức — nếu chúng ta giữ cho nó là mở.

Bạn không tin tôi sao? Linux hiện đã ba mươi bốn tuổi và một nhóm các nhà nghiên cứu tại Đại học Waterloo làm việc trong môi trường mở đã chứng minh, chỉ mới tuần trước, rằng "thay đổi 30 dòng mã trong Linux có thể cắt giảm mức sử dụng năng lượng tại một số trung tâm dữ liệu tới 30 phần trăm". Hãy đoán xem tất cả các khối lượng công việc AI đó chạy trên hệ điều hành nào?

Cuối cùng, tôi sẽ đưa ra một dự đoán nhỏ cho tất cả những người phản đối thiếu hiểu biết "con ngựa thành Troy". Một công ty hoặc phòng nghiên cứu khác sẽ có một mô hình tương tự sử dụng phương pháp này với tỷ lệ hiệu suất trên chi phí đáng kinh ngạc trong vài tuần tới. Hãy thoải mái đoán xem ai trong phần bình luận.

Jim Zemlin, Executive Director at Linux Foundation

January 28, 2025

I rarely blog or post on social media but I do write a private weekly newsletter for our staff and board and for a couple of weeks in a row have been writing about DeepSeek. What I didn’t consider is the reaction this week in the press and markets. Good folks like Ben Thompson, Pat Gellisnger, Tomasz Tunguz have all been commenting. With AI stocks getting pummeled and grave concerns surfacing about the impact of DeepSeek’s R1 model on the future of AI, it’s clear that fears of DeepSeek struck a deep nerve. That huge reaction merits both examination and explanation.

In short, what the markets reacted to was DeepSeek’s ability to build a model that rivaled OpenAI’s sophisticated o1 reasoning model and Anthropic’s Sonnet model for pennies on the dollar on a fraction of the compute. It also appears that DeepSeek did this using well-known techniques. There were no massive algorithmic breakthroughs, just very clever engineering. The team just went back to First Principles, asked basic questions and stacked up existing techniques in novel ways to achieve outsized results using Reinforcement Learning (RL) and various stages of fine-tuning. There’s no magic here — just a very smart reshuffling of the existing cards that produced a more refined and efficient result.

Some observers accused DeepSeek of “free riding” on work done by other large model makers like Meta (Llama) and AliBaba (Qwen). However, this perspective reflects a misunderstanding of how open-source systems function. The foundational principle of open-source innovation is the expectation that others will build upon prior work to drive progress. In the case of DeepSeek, they demonstrated this by distilling their base reasoning model, DeepSeek-R1—an evolution of their earlier open source DeepSeek-V3-Base model —and fine-tuning smaller models from the Llama 3 and Qwen 2.5 series of models using reasoning data generated by their base model. This process highlights how DeepSeek leveraged existing open innovations, not merely for replication, but to demonstrate significant improvements in small language model performance. DeepSeek then re-released those models back to the open source AI community.

Here’s the Big Takeaway. What the news and commentariat are missing is the massive opportunity that DeepSeek has opened for open source and, more broadly, the entire open movement. Too much of the conversation is framed as U.S. vs China and the race for AI supremacy. Too much of the conversation is framed on the idea that DeepSeek training a powerful model on a fraction of the compute for a fraction of the cost means all the large companies spending big bucks on NVIDIA gear and training will be undercut.

In my (biased) view, open source innovation will win and that this will actually be good for everyone — China, the U.S., Big Tech, European Digital Sovereignty, NVIDIA, and more. Some venture investors who bet on early AI startups that have become features inside of larger AI offerings might get wiped out, but that happens in any technology phase shift. What DeepSeek proves is that we need thousands of eyes on the problem to come up with better solutions to make intelligence as close to free as possible. A small team in China took a fresh look at a problem and came up with a novel approach that reduced the cost of chain-of-thought reasoning by 50x (if DeepSeek’s postings are accurate) and then published a paper fully describing their process, allowing the community to benefit from their learnings. We need MORE of this progress, not less. This is not an arm’s race between the U.S. and China. It is a struggle over open markets between the forces of open and the forces of closed. Governments may think they can control this, but history shows that open technology, once discovered and put in the hands of the community, is like rain. You can’t pause or stop it. Artificially halting scientific development has never worked in any long-run term, and computer science and AI are no different.

In March 2013, the open source world was introduced to a lightweight, standardized way to package and run applications with all their dependencies, ensuring consistency across different environments. Unlike traditional virtual machines, Docker containers used isolated environments on a single underlying operating system to do virtualization. Docker containers were faster, more portable, and more efficient by sharing the host system's kernel while isolating processes. Docker reorganized many existing open source virtualization and container capabilities like cgroups, LXC, namespaces and more. That reorganization, or shuffling of the then-existing cards, changed the game. Virtual machines had worked well for years, but Docker containers were far better for many workloads. The openness of that technology shift helped power a new wave of cloud-native computing adoption.

Another fundamental misunderstanding is that DeepSeek will require less AI infrastructure investment. Yet, there is a boundless appetite for intelligence. We haven’t even scratched the surface and are in the very early stages of tapping into AI-powered applications.

More recent improvements in AI models have shifted the nexus of reasoning from pre-training and post-training enhancements to now test-time compute, allowing models to “reason” through their responses (chain-of-thought). This doesn’t mean we need less compute. It actually means we need more compute, when the inference layer acts more like a human brain — always thinking, reconsidering, tackling multiple tasks at once, and evolving to fill the need for new intelligence activities. This is more like electricity — a commodity. Make it cheaper so more applications are possible (as VC Tomasz Tungus explains neatly here), and more people will use it.

For open source, this opens a massive new frontier. If open source wins in AI and becomes the dominant innovation and development model, then we have an opportunity to reshape the way the world works at fundamental levels. DeepSeek is one example of making reasoning available to a much wider array of users and applications. Open source AI could be a path to deliver true interoperability and standards between applications and application stacks.

AI is the meta-layer upon which we could build a new expectation for interoperability, a new reality that Satya Nadela hinted at when he spoke in multiple forums about how AI could disrupt SaaS apps by allowing organizations to hook up different back-ends and data sources to AI engines. In other words, open source AI gives the world a chance to rewrite the rules to favor open everything, everywhere possible. In this world, power goes to the community and the maintainers.

There is, of course, a lot of nuance around open source and how it works. But through this lens, I believe the lesson of DeepSeek is about the coming AI boom and how it can benefit everyone and drive economic and technological progress far exceeding what markets perceive — if we keep it open.

Don’t believe me? Linux is now thirty-four years old and a group of researchers at the University of Waterloo working in the open demonstrated, just last week, that “changing 30 lines of code in Linux could cut energy use at some data centers by up to 30 percent” Guess what OS all those AI workloads run on?

Finally, I will throw out a small prediction for all the “trojan horse” uninformed naysayers. Another firm or research lab will have a similar model using this method with amazing performance to cost ratio in the next few weeks. Feel free to guess who in the comments.

Dịch: Lê Trung Nghĩa

letrungnghia.foss@gmail.com

Thứ Hai, 10 tháng 2, 2025

Mark Zuckerberg: DeepSeek cho thấy vì sao nước Mỹ phải là ‘tiêu chuẩn nguồn mở toàn cầu’ của AI; không có lý do gì để suy nghĩ lại về việc chi tiêu

Đồng sáng lập và CEO của Meta Mark Zuckerberg · Fortune · JULIA DEMAREE NIKHINSON—AFP/Getty Images

Mark Zuckerberg: DeepSeek shows why U.S. must be AI’s ‘global open-source standard’; no reason to rethink spending

Alexei Oreskovic; Updated Thu, January 30, 2025 at 10:59 PM GMT+7 3 min read

Theo: https://finance.yahoo.com/news/mark-zuckerberg-deepseek-shows-why-003121571.html

Bài được đưa lên Internet ngày: 30/01/2025

Mark Zuckerberg nghĩ các mô hình DeepSeek AI của Trung Quốc có vài đổi mới “mới lạ” mà ông hy vọng sẽ noi theo. Nhưng điều đó không khiến ông phải suy nghĩ lại về sứ mệnh đầu tư hàng trăm tỷ đô la vào cơ sở hạ tầng AI của Meta.

“Tôi vẫn nghĩ rằng việc đầu tư mạnh vào capex [chi phí vốn] và cơ sở hạ tầng sẽ là một lợi thế chiến lược theo thời gian”, CEO và đồng sáng lập của Meta cho biết trong cuộc gọi công bố thu nhập quý 4 của công ty vào thứ Tư.

Meta đã tái khẳng định kế hoạch chi từ 60 đến 65 tỷ USD cho chi tiêu vốn trong năm nay, tăng từ 39 tỷ USD vào năm 2024, khi công ty chạy đua để xây dựng các trung tâm dữ liệu đắt tiền cần thiết để cung cấp năng lượng cho các loại dịch vụ AI mới, bao gồm "trợ lý cực kỳ thông minh và được cá nhân hóa". Zuckerberg cho biết về lâu dài, Meta sẽ chi "hàng trăm tỷ đô la" cho cơ sở hạ tầng AI.

Sự ra đời của AI tạo sinh, chẳng hạn như ChatGPT của OpenAI, đã thúc đẩy một cuộc chạy đua vũ trang giữa các công ty công nghệ như Meta, Microsoft và Alphabet, tất cả đều tin rằng việc sở hữu các tài nguyên điện toán để chạy các mô hình AI tiên tiến nhất là rất quan trọng đối với triển vọng kinh doanh trong tương lai của họ. Đầu tháng này, OpenAI, Oracle và SoftBank đã công bố kế hoạch đầu tư 500 tỷ đô la trong bốn năm vào cái gọi là trung tâm dữ liệu AI Stargate.

Quan niệm đó gần đây đã bị đặt dấu hỏi khi DeepSeek, một công ty khởi nghiệp của Trung Quốc, phát hành các mô hình AI mới cạnh tranh với các dịch vụ AI tiên tiến nhất do các công ty Hoa Kỳ phát triển. Nhưng theo DeepSeek, chúng được đào tạo với chi phí chỉ bằng một phần nhỏ. Trong khi một số nhà quan sát trong ngành tỏ ra nghi ngờ về tuyên bố của DeepSeek liên quan đến chi phí, thì khả năng của các mô hình AI của công ty này vẫn nhận được lời khen ngợi.

Zuckerberg cho biết có một số điều mới lạ mà DeepSeek đã làm "mà chúng tôi vẫn đang tiếp thu" và ông hy vọng sẽ triển khai một số tiến bộ đó vào công nghệ AI của riêng Meta. Và ông lưu ý rằng thực tế là mô hình của DeepSeek là nguồn mở là bằng chứng cho thấy quyết định của Meta khi biến công nghệ AI Llama của mình thành nguồn mở là động thái đúng đắn.

“Sẽ có một tiêu chuẩn nguồn mở trên toàn cầu và tôi nghĩ rằng vì lợi ích quốc gia của chúng ta, điều quan trọng là tiêu chuẩn đó phải là tiêu chuẩn của Mỹ”, Zuckerberg cho biết. “Những tin tức gần đây chỉ củng cố thêm niềm tin của chúng tôi rằng đây là điều đúng đắn cần tập trung vào”.

Mặc dù Zuckerberg đã lưu ý rằng những thay đổi trong cách các mô hình AI tiên tiến được đào tạo và chạy có thể tại một số thời điểm sẽ thay đổi phép tính cho đầu tư cơ sở hạ tầng, nhưng ông cho biết vẫn còn “quá sớm để thực sự có ý kiến mạnh mẽ” về điều này chỉ dựa trên DeepSeek.

Kết quả tài chính chung của Meta trong ba tháng cuối năm 2024 đã vượt qua kỳ vọng của các nhà phân tích, với doanh thu là 48,4 tỷ USD, tăng 21% so với cùng kỳ năm ngoái và vượt mức 46,99 tỷ USD mà Phố Wall kỳ vọng. Công ty đã công bố thu nhập ròng là 20,8 tỷ USD, tương đương 8,02 USD cho mỗi cổ phiếu so với mức EPS là 6,76 USD mà các nhà phân tích kỳ vọng.

Câu chuyện này ban đầu được đăng trên Fortune.com

Meta cofounder and CEO Mark Zuckerberg · Fortune · JULIA DEMAREE NIKHINSON—AFP/Getty Images

Mark Zuckerberg thinks China’s DeepSeek AI models have some “novel” innovations he hopes to emulate. But it hasn’t given him second thoughts about his mission to plow hundreds of billions of dollars into Meta’s AI infrastructure.

“I continue to think that investing very heavily in capex [capital expenditure] and infrastructure is going to be a strategic advantage over time,” the Meta CEO and cofounder said during the company’s Q4 earnings call on Wednesday.

Meta reaffirmed its plan Wednesday to spend between $60 billion and $65 billion in capital expenditures this year, up from $39 billion in 2024, as the company races to build the expensive data centers necessary to power new types of AI services, including a “highly intelligent and personalized assistant.” Over the long term, Zuckerberg said, Meta will spend “hundreds of billions of dollars” on AI infrastructure.

The advent of generative AI, such as OpenAI’s ChatGPT, has spurred an arms race among tech companies like Meta, Microsoft, and Alphabet, which all believe that owning the computing resources to run the most advanced AI models is critical to their future business prospects. Earlier this month, OpenAI, Oracle, and SoftBank announced plans to invest $500 billion over four years into the so-called Stargate AI data centers.

That notion was recently called into question when DeepSeek, a Chinese startup, released new AI models that rivaled the most advanced AI offerings developed by U.S. companies. But, according to DeepSeek, they were trained at a fraction of the cost. While some industry observers are skeptical about DeepSeek’s claims regarding costs, the capabilities of its AI models have nonetheless earned praise.

Zuckerberg said there were a number of novel things DeepSeek did “that we’re still digesting” and that he hoped to implement some of those advances into Meta’s own AI technology. And he noted that the fact that DeepSeek’s model is open-source is proof that Meta’s decision to make its Llama AI technology open-source was the right move.

“There’s going to be an open-source standard globally, and I think that for our own national advantage it’s important that it’s an American standard,” Zuckerberg said. “The recent news has only strengthened our conviction that this is the right thing to be focused on.”

While Zuckerberg did note that changes in the way advanced AI models are trained and run might at some point change the calculus for infrastructure investment, he said that it was still “too early to really have a strong opinion” on this based simply on DeepSeek.

Meta’s overall financial results for the last three months of 2024 beat analysts’ expectations, with revenue of $48.4 billion, up 21% year over year and ahead of the $46.99 billion expected by Wall Street. The company posted net income of $20.8 billion, or $8.02 per share versus the $6.76 EPS expected by analysts.

This story was originally featured on Fortune.com

Dịch: Lê Trung Nghĩa

letrungnghia.foss@gmail.com


Chủ Nhật, 9 tháng 2, 2025

Mark Zuckerberg nói Meta có kế hoạch chi hơn 60 tỷ USD khi Thung lũng silicon hoảng loạn về sự cạnh tranh của AI Trung Quốc


Mark Zuckerberg says Meta plans to spend over $60 billion as Silicon Valley panics over Chinese AI competition

Katie Balevic; Jan 24, 2025, 11:08 PM GMT+7

Theo: https://www.businessinsider.com/mark-zuckerberg-meta-ai-investment-capital-expenditure-datacenter-deepseek-2025-1

Bài được đưa lên Internet ngày: 24/01/2025

Mark Zuckerberg nói Meta sẽ đầu tư mạnh vào AI trong năm 2025. liên minh ảnh/Getty Images

  • Mark Zuckerberg nói Meta có kế hoạch chi thêm 60 tỷ USD trong năm 2025 để tăng cường đầu tư vào AI.

  • Zuckerberg nói trung tâm dữ liệu của công ty ở Louisiana sẽ gần với kích cỡ của Manhattan.

  • Thung lũng Silicon bất an sau khi DeepSeek, một tay chơi mới của Trung Quốc gần đây đã công bố mô hình AI mới của nó

Mark Zuckerberg đã cảnh báo các nhà đầu tư vào tháng 10 rằng Meta có kế hoạch chi nhiều hơn bao giờ hết vì công ty đã học được trong cuộc đua AI.

Bây giờ, họ đã biết chính xác là bao nhiêu.

Zuckerberg nói trong một bài đăng trên phương tiện xã hội vào ngày thứ sáu rằng 2025 sẽ là “năm quyết định cho AI” và đã công bố kế hoạch chi 60 tỷ đến 65 tỷ USD vốn đầu tư bổ sung cho năm nay.

Trong bài đăng trên Threads, Zuckerberg cũng ca ngợi kế hoạch của công ty về trung tâm dữ liệu 2 GW tại Louisiana, nơi mà ông cho biết sẽ "lớn đến mức có thể bao phủ một phần đáng kể của Manhattan".

Ông cũng đã dự báo rằng Meta AI sẽ trở thành “người trợ giúp hàng đầu”, phục vụ cho hơn 1 tỷ người dùng.

“Chúng tôi sẽ mang lên trực tuyến ~1GW tính toán trong năm 25 và chúng tôi sẽ kết thúc năm với hơn 1,3 triệu GPU”, ông nói. “Chúng tôi có kế hoạch đầu từ 60-65 tỷ USD vốn đầu tư năm nay trong khi cũng gia tăng đáng kể các nhóm AI của chúng tôi, và chúng tôi có vốn để tiếp tục đầu tư trong những năm tới.”

Cổ phiếu của Meta đã giảm vào sáng thứ Sáu sau thông báo của Zuckerberg, nhưng đã nhanh chóng phục hồi.

Trong cuộc gọi thu nhập Quý 3, Meta cho biết họ dự đoán "chi tiêu vốn sẽ tăng đáng kể vào năm 2025" khi Zuckerberg giải thích rằng ông rất vui khi tiếp tục chi tiêu mạnh tay cho AI.

AI đã "có tác động tích cực đến hầu hết mọi khía cạnh công việc của chúng tôi", ông nói vào thời điểm đó, lưu ý rằng ông đã thấy "rất nhiều cơ hội mới để sử dụng những tiến bộ mới của AI để thúc đẩy hoạt động kinh doanh cốt lõi của chúng tôi".

Thông báo của Zuckerberg được đưa ra khi Thung lũng Silicon xử lý tin tức rằng DeepSeek, một công ty Trung Quốc, đã phát triển một mô hình AI nguồn mở vượt trội hơn một số mô hình Meta, OpenAI và Anthropic theo các chuẩn mực của bên thứ ba.

AI và Trung Quốc là chủ đề thảo luận chính tại Diễn đàn Kinh tế Thế giới tuần này ở Davos, Thụy Sĩ.

"Chúng ta nên xem xét những diễn biến ở Trung Quốc một cách rất, rất nghiêm túc", Satya Nadella, CEO của Microsoft, nhà đầu tư lớn nhất của OpenAI, cho biết.

Mark Zuckerberg says Meta will invest heavily in AI in 2025. picture alliance/Getty Images

  • Mark Zuckerberg says Meta plans to spend another $60 billion in 2025 as it doubles down on AI.

  • Zuckerberg said the company's data center in Louisiana will be near the size of Manhattan.

  • Silicon Valley is nervous after DeepSeek, a Chinese newcomer, recently revealed its new AI model.

Mark Zuckerberg warned investors in October that Meta planned to spend more than ever as the company leaned into the AI race.

Now, they know just how much.

Zuckerberg said in a Friday social media post that 2025 will be a "defining year for AI" and announced plans for $60 billion to $65 billion in additional capital investment for the year.

In a post on Threads, Zuckerberg also touted the company's plans for its 2 GW data center in Louisiana, which he said would be "so large it would cover a significant part of Manhattan."

He also predicted that Meta AI would become "the leading assistant," serving over 1 billion users.

"We'll bring online ~1GW of compute in '25 and we'll end the year with more than 1.3 million GPUs," he said. "We're planning to invest $60-65B in capex this year while also growing our AI teams significantly, and we have the capital to continue investing in the years ahead."

Meta's stock dipped Friday morning after Zuckerberg's announcement, but it quickly recovered.

In its Q3 earnings call, Meta said it anticipated "significant capital expenditures growth in 2025" as Zuckerberg explained that he's happy to keep up heavy spending on AI.

AI had "a positive impact on nearly all aspects of our work," he said at the time, noting that he saw "a lot of new opportunities to use new AI advances to accelerate our core business."

Zuckerberg's announcement came as Silicon Valley processes news that DeepSeek, a Chinese company, has developed an open-source AI model that outperformed some Meta, OpenAI, and Anthropic models in third-party benchmarks.

AI and China was a major topic of conversation at this week's World Economic Forum in Davos, Switzerland.

"We should take the developments out of China very, very seriously," said Satya Nadella, the CEO of Microsoft, which is OpenAI's largest investor.

Dịch: Lê Trung Nghĩa

letrungnghia.foss@gmail.com

Thứ Năm, 6 tháng 2, 2025

Nếu DeepSeek muốn trở thành một người phá vỡ thực sự, nó phải tiến xa hơn nữa về tính minh bạch của dữ liệu


If DeepSeek wants to be a real disruptor, it should go much further on data transparency

Thu Jan 30, 2025

Theo: https://theodi.org/news-and-events/blog/if-deepseek-wants-to-be-a-real-disruptor-it-should-go-much-further-on-data-transparency/

Bài được đưa lên Internet ngày: 30/01/2025

Chúng ta cần tính minh bạch nhiều hơn từ tất cả các nhà cung cấp mô hình.

Vào ngày 20/01/2025, công ty AI Trung Quốc DeepSeek đã phát hành một mô hình ngôn ngữ gọi là R1 đã gửi đi làn sóng gây sốc khắp thế giới AI trên toàn cầu. Cùng với việc phát hành là những tuyên bố ấn tượng về sự phát triển và khả năng của mô hình đó, với sự phát triển mô hình chỉ bằng 10% của chi phí được cho là của o1 của OpenAI và nhanh gần gấp đôi so với chuẩn mực. Điều đó là vì, theo báo cáo kỹ thuật, R1 ít dựa hơn vào việc gắn nhãn của con người và thay vào đó có khả năng sử dụng một dạng đào tạo được tự động hóa. Thế còn về dữ liệu thì sao? Nó tới từ đâu và nó được sử dụng như thế nào?

Chỉ số Minh bạch Dữ liệu AI

Tháng trước, Viện Dữ liệu Mở - ODI (Open Data Institute) đã phát hành Chỉ số Minh bạch Dữ liệu AI - AIDTI (AI Data Transparency Index), một khung mới để phân tích liệu các nhà cung cấp mô hình có chia sẻ thông tin cần thiết về tính minh bạch dữ liệu có ý nghĩa hay không. Với AIDTI, các nhà cung cấp mô hình được đánh giá theo 7 chiều, tìm kiếm sự minh bạch về những điều chẳng hạn như các nguồn của tập dữ liệu và các phương pháp thu thập, các hoạt động xử lý được triển khai, và liệu các tập dữ liệu đã được kiểm tra về dữ liệu có bản quyền hay dữ liệu cá nhân hay chưa.

Thông qua quá trình này, chúng tôi đã phân tích 22 mô hình từ khắp trên thế giới, bao gồm các mô hình mà cũng giống như DeepSeek đã tuyên bố là ‘nguồn mở’. Phân tích của chúng tôi đã xác định rằng:

  • Mức độ trưởng thành cao đã được 5 nhà cung cấp mô hình thể hiện, được đặc trưng bằng việc ghi thành tài liệu chi tiết, truy cập được, sử dụng nhất quán các công cụ minh bạch, và một cách tiếp cận chủ động tích cực cho các quyết định giải thích được tiến hành trong quá trình phát triển đó.

  • 6 nhà cung cấp mô hình đã đáp ứng một số tiêu chí minh bạch nhưng thiếu sự nhất quán đối với tất cả các chiều và vì thế đã được coi là có mức độ trưởng thành trung bình.

  • 11 nhà cung cấp mô hình đã thể hiện mức độ trưởng thành thấp với thông tin hạn chế hoặc chất lượng kém, gợi ý sự miễn cưỡng chung để trở thành mở.

Chúng tôi nghĩ có thể là cơ hội tốt để xem DeepSeek được so sánh như thế nào với các đối thủ cạnh tranh đã thanh danh của nó.

Hai nhà nghiên cứu của ODI đã độc lập lặp lại phương pháp Chỉ số Minh bạch Dữ liệu AI cho DeepSeek R1 và bạn có thể thấy kết quả đối sánh bên dưới.



DeepSeek và minh bạch dữ liệu

DeepSeek không may đã được xếp hạng ở mức trưởng thành thấp đối với tất cả ngoại trừ 1 trong số 7 chiều minh bạch của chúng tôi. Nhờ có tóm tắt khá chi tiết các hoạt động tiền xử lý và hậu đào tạo đã diễn ra trong quá trình phát triển DeepSeek R1, DeepSeekđã có điểm trung bình về mức độ trưởng thành đối với chiều này. Đối với các chiều còn lại, DeepSeek có điểm kém. Đã có danh sách không rõ ràng về các tập dữ liệu được sử dụng trong mô hình và cơ chế không minh bạch được sử dụng (chẳng hạn như các thẻ mô hình hay dữ liệu) để giúp làm cho các mô hình AI minh bạch hơn và truy cập được nhiều hơn. Đã không có các chi tiết được chia sẻ xem dữ liệu này có bao gồm các dữ liệu có bản quyền hay thông tin cá nhân hay không, cũng không có bất kỳ sự bảo vệ nào cho điều này. Cũng như thông tin chi tiết hơn về toàn bộ chuỗi cung ứng dữ liệu. Bất chấp một số tuyên bố ấn tượng về hiệu quả tính toán của các mô hình, toàn bộ chi phí môi trường của quá trình phát triển vẫn chưa được chia sẻ.

Tổng thể, mức độ trưởng thành minh bạch dữ liệu thấp của DeepSeek đặt nó ngang hàng với Inflection-2, tốt hơn một chút so với Grok 2 của X và Gemini 1.5 của Google, và khá tệ hơn so với GPT-4o của OpenAI. Tất cả các mô hình đó vẫn còn được coi là có mức độ trưởng thành thấp về minh bạch dữ liệu, và đứng xa phía sau so với Aya của Cohere và Pythia của EleutherAI. DeepSeek R1 không phải là mô hình nguồn mở, cũng không là một tiêu chuẩn mới về minh bạch dữ liệu.

Việc có mức độ trưởng thành thấp về minh bạch dữ liệu có nghĩa đối với những người dùng khác nhau rằng:

  • Chúng tôi không thể xác định liệu dữ liệu có được sử dụng từ đối thủ cạnh tranh của họ hay không vì OpenAI và Microsoft được cho là đang điều tra

  • Tính xác thực của các tuyên bố về chi phí của DeepSeek, vì nó phần lớn được khởi tạo từ một mô hình trước đó mà họ chưa công bố chi phí đào tạo

  • Tính xác thực của các tuyên bố về hiệu quả đào tạo của DeepSeek, mặc dù một số tính toán cho thấy chúng là sự thật

Kết luận

Mặc dù có nhiều tuyên bố về mô hình AI 'nguồn mở' của DeepSeek, nhưng thực tế thì nó không phải là nguồn mở. Mặc dù cả trọng số mô hình và kiến trúc mô hình đều được chia sẻ trong một bài báo kỹ thuật, nhưng cả mã lẫn dữ liệu đào tạo hoặc đánh giá đều không được chia sẻ công khai. Một nhà phân tích của Sáng kiến Nguồn Mở cũng xác nhận rằng Deepseek không phải là AI Nguồn Mở và không đáp ứng các yêu cầu của định nghĩa AI Nguồn Mở (bản dịch sang tiếng Việt). Nó tham gia cùng các mô hình khác tuyên bố là nguồn mở, nhưng lại có điểm kém về tính minh bạch dữ liệu.

Cuối cùng, điều này có nghĩa là nhiều tuyên bố ấn tượng của DeepSeek về phát triển mô hình hiệu quả cao không thể được xác thực. Để điều này thực sự là một sự kiện mang tính đột phá, DeepSeek sẽ phải trở nên trưởng thành hơn nhiều với thông tin về tính minh bạch dữ liệu mà họ chia sẻ.

Nhìn chung, tính minh bạch dữ liệu vẫn tiếp tục là một cơ chế có liên quan để đánh giá các mô hình và nhà cung cấp mới. Chúng ta cần nhiều tính minh bạch hơn, không chỉ từ DeepSeek vì một số người lo sợ về nguồn dữ liệu và rủi ro về quyền riêng tư đối với người dùng, mà còn từ tất cả các nhà cung cấp mô hình dù là người Mỹ hay người Trung Quốc, mở hay đóng, lớn hay nhỏ.

Xem thêm:

We need more transparency, from all model providers.

On January 20th, the Chinese AI company DeepSeek released a language model called R1 which sent shockwaves across the global AI world. Accompanying the release were impressive claims regarding the model's development and capability, with the development of a model that is 10% of the supposed cost of OpenAI’s o1 and nearly twice as fast on benchmarks. That’s because, according to the technical report, R1 was less reliant on human labelling and instead was able to use an automated form of training. But what about the data? Where did it come from and how is it used?

The AI Data Transparency Index

Last month, the ODI launched the AI Data Transparency Index, a new framework to analyse whether model providers were sharing the information needed for meaningful data transparency. With the AIDTI model providers are assessed across seven dimensions, looking for transparency on things such as dataset sources and collection methods, processing activities carried out, and whether the datasets have been checked for copyrighted or personal data.

Through this process, we analysed 22 models from around the world, including models that also, like DeepSeek claimed to be ‘open source’. Our analysis identified that:

  • High maturity was demonstrated by five model providers, characterised by detailed, accessible documentation, consistent use of transparency tools, and a proactive approach to explaining decisions made in the development process.

  • Six model providers met some transparency criteria but lacked consistency for all dimensions and were therefore considered medium maturity.

  • Eleven model providers demonstrated low maturity with limited or poor-quality information, suggesting a general reluctance to be open.

We thought it would be a good opportunity to see how DeepSeek compared to its established competitors.

Two ODI researchers independently repeated our AI Data Transparency Index methodology for DeepSeek R1 and you can see the comparative results below.

Deepseek and data transparency

DeepSeek was unfortunately ranked at low maturity for all but one of our seven transparency dimensions. Due to relatively detailed summaries of the pre-processing and post-training activities that took place in developing DeepSeek R1, DeepSeek was scored at medium maturity for this. For the rest of them, DeepSeek scored poorly. There was no clear list of datasets used in the model and no transparent mechanism used (such as model or data cards) which help to make AI models more transparent and accessible. There were no details shared on whether this data included copyrighted data or personal information, nor any protections for this in place. As was further information on the full data supply chain. Despite some impressive claims as to the models compute efficiency, full environmental costs of the development were not shared.

Overall, DeepSeek’s low data transparency maturity puts it on a par with Inflection-2, moderately better than X’s Grok 2 and Google’s Gemini 1.5, and marginally worse than OpenAI’s GPT-4o. All of these models are still considered low maturity in data transparency, and languish far behind the likes of Cohere’s Aya and EleutherAI’s Pythia. DeepSeek R1 is not an open source model, nor is it a new standard for data transparency.

Being low maturity for data transparency means for different users that:

  • We can’t identify whether data was used from their competitors as OpenAI and Microsoft are reportedly probing

  • The veracity of DeepSeek’s cost claims, as it was largely bootstrapped from a previous model that they haven’t released the training costs for

  • The veracity of DeepSeek’s training efficiency claims, although some calculations suggest there is truth to them

Conclusion

While there are multiple claims to DeepSeek’s ‘open source’ AI model, in reality it is not open source. While both the model weights and the model architecture were shared in a technical paper, neither the code nor the training or evaluation data were shared openly. An analyst for the Open Source Initiative also confirmed that Deepseek is not Open Source AI and doesn’t meet the requirements of the Open Source AI definition. It joins other models which claim to be open source, but score poorly on data transparency.

Ultimately, this means that many of DeepSeek’s impressive claims to highly-efficient model development cannot be validated. For this truly to be a disruptive event, DeepSeek will be required to become much more mature with the data transparency information they share.

Overall, data transparency continues to be a relevant mechanism for judging new models and providers.We need more transparency, not just from DeepSeek because some people are fearful over the sources of the data and privacy risks for users, but from all model providers whether American or Chinese, open or closed, massive or tiny.

Dịch: Lê Trung Nghĩa

letrungnghia.foss@gmail.com