Là bản dịch sang tiếng Việt tài liệu do tác giả Paul Keller biên soạn, các tổ chức OPEN FUTURE & europeana @2025 xuất bản với giấy phép mở CC BY 4.0.
“Mục đích của Không gian chung dữ liệu sách châu Âu - EBDC (European Books Data Commons)
Về cốt lõi, Không gian chung dữ liệu sách châu Âu (EBDC) là một phần của cơ sở hạ tầng kỹ thuật số công cộng tồn tại để cung cấp quyền truy cập vào các bộ dữ liệu lớn, chất lượng cao về quét sách và toàn văn. Các bộ dữ liệu này được cung cấp miễn phí cho nhiều mục đích sử dụng khác nhau, bao gồm cả ở dạng được tối ưu hóa để đào tạo mô hình AI. EBDC sẽ cung cấp một giao diện tập trung để truy cập dữ liệu, có thể được lưu trữ theo kiểu tập trung hoặc phân tán.
Là một phần của việc này, EBDC sẽ tham gia vào việc làm sạch dữ liệu, ghi nhãn dữ liệu và các hình thức xử lý dữ liệu khác, nhưng sẽ không tham gia vào việc quản lý dữ liệu. Việc quản lý dữ liệu xảy ra ở cấp độ nhà cung cấp dữ liệu (thư viện) hoặc ở cấp độ người dùng EBDC.”
Tự do tải về bản dịch sang tiếng Việt của tài liệu có 12 trang tại địa chỉ:
Là tài liệu của Nhóm Chuyên gia Độc lập về Trí tuệ Nhân tạo và Văn hóa (CULTAI), do UNESCO triệu tập, gồm: Mercedez Bunz, Brendan Ciecko, Salim Dada, Kim Jeong Han, Lethabo Huma, Joe Kallas, Octavio Kulesz, Roman Lipski, Ramon López de Mantaras, Alejandra López Gabrielidis, Ojoma Ochai, và Shrey Maurya, biên tập, được UNESCO & MONDIACULT 25 ESPANA xuất bản năm 2025.
“Tóm tắt:
Nhóm Chuyên gia Độc lập về Trí tuệ Nhân tạo và Văn hóa (CULTAI), do UNESCO thành lập, đã xem xét cách thức AI đang định hình lại sự sáng tạo, di sản và các hệ sinh thái văn hóa trên toàn cầu. Phân tích của Nhóm làm nổi bật một thực tế cấp bách: trí tuệ nhân tạo đang phát triển nhanh hơn so với công tác quản trị văn hóa, làm gia tăng khoảng cách và nảy sinh những rủi ro mới, đồng thời cũng mang lại những cơ hội mạnh mẽ để củng cố sự đổi mới và khả năng thích ứng của văn hóa.
AI đang làm thay đổi cách thức văn hóa được tạo ra, chia sẻ và bảo tồn. Công nghệ này có thể mở rộng khả năng tiếp cận, bảo vệ di sản, khuếch đại các tiếng nói đa dạng và mở ra những khả năng sáng tạo mới. Tuy nhiên, nó cũng có thể làm trầm trọng thêm tình trạng bất bình đẳng, gia tăng định kiến, đẩy nhanh quá trình đồng nhất hóa văn hóa và làm tăng các chi phí môi trường.
Báo cáo chỉ ra các thách thức cốt lõi:
Tốc độ phát triển vượt xa khả năng quản trị: sự tăng tốc của AI vượt quá khả năng thích ứng của các hệ sinh thái văn hóa, đe dọa chủ quyền, tính đa nguyên và sự giám sát dân chủ;
Củng cố định kiến và sự đồng nhất hóa: dữ liệu huấn luyện thiếu cân bằng và cơ chế cá nhân hóa bằng thuật toán làm tái diễn các khuôn mẫu định kiến và thúc đẩy văn hóa đơn nhất;
Xâm phạm quyền văn hóa: thông qua việc khai thác dữ liệu văn hóa không được bảo hộ mà thiếu sự đồng ý, ghi nhận nguồn gốc hay đền bù, cũng như gạt bỏ các nền văn hóa thiểu số ra bên lề; và
Làm suy giảm khả năng sáng tạo và các kỹ năng: sự phụ thuộc quá mức vào AI làm suy yếu khả năng sáng tạo và năng lực tư duy của con người.
Báo cáo cũng nêu bật các cơ hội, đáng chú ý là:
Mở rộng khả năng sáng tạo và tiếp cận: bằng cách giảm bớt rào cản gia nhập và tạo điều kiện cho các hình thức sáng tạo mới;
Bảo vệ di sản văn hóa: thông qua các hoạt động phục dựng, bảo tồn, ứng phó sau thảm họa và gìn giữ các ngôn ngữ đang có nguy cơ mai một;
Tăng cường các ngành công nghiệp văn hóa và sáng tạo: việc tự động hóa các tác vụ thường nhật giúp giảm chi phí và nâng cao năng lực cạnh tranh cho các doanh nghiệp nhỏ; và
Thúc đẩy cơ hội học tập bình đẳng: các bảo tàng và cơ sở văn hóa giúp bồi đắp năng lực hiểu biết về AI, khả năng sáng tạo và tư duy phản biện.
Nhóm Chuyên gia Độc lập kêu gọi sự hợp tác toàn cầu và cơ chế quản trị bao trùm nhằm đảm bảo AI góp phần củng cố sự đa dạng văn hóa, tính công bằng và sự bền vững. Các phương pháp tiếp cận AI dựa trên quyền con người, các thực hành xanh, nền kinh tế sáng tạo công bằng và tương lai văn hóa bền vững cần đặt sự sáng tạo của con người và quyền văn hóa vào vị trí trung tâm của quá trình phát triển công nghệ.”
Tự do tải về bản dịch sang tiếng Việt của tài liệu có 115 trang tại địa chỉ:
Là bản dịch sang tiếng Việt tài liệu của Michael Weinberg, do GLAM-E Lab xuất bản tháng 6/2025, giấy phép CC BY 4.0.
“Giới thiệu
Vào cuối năm 2024, bắt đầu xuất hiện những báo cáo lẻ tẻ từ các bộ sưu tập di sản văn hóa trực tuyến riêng lẻ. Các báo cáo này mô tả tình trạng máy chủ và hệ thống lưu trữ bị quá tải – và đôi khi gặp sự cố – do sự tấn công dồn dập của các chương trình tự động (bot). Các bot này được cho là đang thu thập toàn bộ dữ liệu từ các bộ sưu tập để xây dựng tập dữ liệu huấn luyện cho các mô hình trí tuệ nhân tạo (AI). Hoạt động này gây áp lực quá lớn lên các hệ thống vốn được thiết kế để duy trì sự hiện diện trực tuyến của các bộ sưu tập đó.
Mặc dù đáng lo ngại, nhưng chưa thể khẳng định ngay liệu những báo cáo này có phản ánh một xu hướng rộng lớn hơn hay không. Liệu chúng có đại diện cho trải nghiệm của đa số các bộ sưu tập trực tuyến? Chúng chỉ là những trường hợp cá biệt? Hay là những dấu hiệu cảnh báo sớm?
GLAM-E Lab đã công bố báo cáo này nhằm giải đáp các câu hỏi trên và bắt đầu phác họa bức tranh toàn cảnh lớn hơn. Báo cáo tập trung đặc biệt vào các bộ sưu tập đã được số hóa và dữ liệu liên quan đến các tổ chức GLAM – bao gồm Phòng trưng bày (Galleries), Thư viện (Libraries), Cơ quan lưu trữ (Archives) và Bảo tàng (Museums).
Vào tháng 4 năm 2025, GLAM-E Lab đã gửi một bản khảo sát ngắn qua các danh sách thư điện tử (listserv) dành cho những người làm việc trong lĩnh vực di sản và công nghệ tại các tổ chức GLAM, bao gồm cả những người trong và ngoài giới học thuật. Cộng đồng này mang tính quốc tế và bao gồm các cơ sở với quy mô đa dạng, từ các cơ quan lưu trữ quốc gia hàng đầu cho đến các bảo tàng địa phương.
Chúng tôi đã đặt câu hỏi cho các tổ chức sở hữu bộ sưu tập trực tuyến – bất kể các bộ sưu tập đó có được cấp phép mở hay không – về trải nghiệm của họ liên quan đến các bot thu thập dữ liệu để huấn luyện AI. Các câu hỏi tập trung vào tác động kỹ thuật mà các bot gây ra (hoặc không gây ra) đối với cơ sở hạ tầng trực tuyến của họ. Mục tiêu của chúng tôi là tìm hiểu xem liệu những báo cáo ban đầu về sự cố có đại diện cho tình hình chung của cộng đồng GLAM hay không, đồng thời hiểu rõ hơn và chi tiết hơn về các vấn đề kỹ thuật mà các bộ sưu tập mở đang gặp phải do bot, và cuối cùng là bắt đầu định hình các giải pháp khả thi….”
Tự do tải về bản dịch sang tiếng Việt của tài liệu có 51 trang tại địa chỉ:
Creative Commons, một đối tác lâu năm của IFLA, đang dẫn đầu nỗ lực vận động cho một Khuyến nghị của UNESCO về Văn hóa Mở (Open Culture). Điều này sẽ tiếp nối các khuyến nghị hiện tại của UNESCO về Khoa học Mở và Tài nguyên Giáo dục Mở.
Vì mục tiêu của Văn hóa Mở tập trung vào việc làm cho di sản văn hóa dễ tiếp cận hơn vì lợi ích của tất cả mọi người, IFLA đã nhiệt tình ủng hộ nỗ lực này. Chúng tôi đã hợp tác với Creative Commons trong những năm qua để thúc đẩy cuộc thảo luận về Văn hóa Mở và đại diện cho các quan điểm đa dạng từ lĩnh vực thư viện, bao gồm cả tại Hội nghị Thượng đỉnh Toàn cầu của Creative Commons ở Mexico City vào tháng 9/2023.
IFLA một lần nữa tham gia cùng Creative Commons trong một hội thảo chuyên sâu tại Lisbon, Bồ Đào Nha được tổ chức vào tháng 5 năm 2024 để giúp vạch ra lộ trình hướng tới một khuyến nghị cuối cùng.
Open Culture Strategic Workshop Group Photo by Filipa Alfama, CC BY 4.0
Văn hóa Mở là gì?
Đã có một cuộc tranh luận sôi nổi về các thông số và định nghĩa của Văn hóa Mở trong bối cảnh dự án này. Theo quan điểm của IFLA, việc tập trung vào số hóa di sản văn hóa và làm cho các bộ sưu tập đó có sẵn cho giáo dục, nghiên cứu và làm giàu văn hóa là trọng tâm thực tế nhất.
Trong đó, IFLA nhấn mạnh sự cần thiết phải đưa ra các ngoại lệ đối với di sản văn hóa có thể không phù hợp với việc tiếp cận mở, chẳng hạn như di sản thuộc về các cộng đồng người bản địa.
Dưới góc độ của Creative Commons, di sản văn hóa được chia sẻ mở sẽ:
dễ dàng được tìm thấy hơn
tiếp cận được nhiều đối tượng khán giả rộng rãi và đa dạng hơn
có thể được bảo tồn, gìn giữ và hoàn thiện dưới dạng kỹ thuật số
có thể được (tái) sử dụng với sự đảm bảo cao hơn về mặt pháp lý
Di sản văn hóa mở dẫn tới:
Đơn vị lưu giữ bộ sưu tập thích ứng tốt hơn và gắn kết hơn với thực tiễn
Hoạt động nghiên cứu sôi nổi hơn và giáo dục mang tính tham gia cao hơn
Sự sáng tạo văn hóa năng động hơn
Các xã hội công bằng, dân chủ, đa dạng, tự do và bình đẳng hơn
Công việc của IFLA hướng tới một văn bản Khuyến nghị
IFLA đã tham gia vào nhóm chuyên gia do Creative Commons quy tụ nhằm thúc đẩy việc xác định các bước tiếp theo trong nỗ lực xây dựng một văn bản khuyến nghị liên chính phủ về Văn hóa Mở.
Bà Claire McGuire, Quản lý phụ trách Chính sách và Vận động, đã điều phối một phiên thảo luận với sự tham gia của các đại diện UNESCO ở cấp quốc gia, khu vực và quốc tế. Phiên thảo luận này đã tạo nền tảng thực tiễn cho hội thảo thông qua việc trình bày các quy trình mà UNESCO áp dụng để xây dựng những văn bản mang tính chuẩn mực như vậy.
Điều này có ý nghĩa gì đối với các thư viện?
Trong thời gian tới, IFLA sẽ tiếp tục đóng vai trò chủ chốt cùng với các đối tác từ Creative Commons để triển khai nỗ lực này. Đối với các thư viện, đây là cơ hội để tác động vào một quy trình nhằm thúc đẩy các cam kết quốc gia, từ đó tạo ra môi trường thuận lợi giúp thư viện hoàn thành sứ mệnh của mình.
Khi công việc được triển khai, IFLA sẽ tìm kiếm các cơ hội để đại diện cho quan điểm của ngành thư viện và lan tỏa tiếng nói của các thành viên, hướng tới một kết quả mang lại giá trị cho lĩnh vực thư viện.
Hãy tiếp tục theo dõi để cập nhật thêm thông tin!
IFLA xin gửi lời cảm ơn chân thành đến Creative Commons vì đã mời chúng tôi tham gia hội thảo này!
Creative Commons, a longstanding partner of IFLA, is leading an effort to advocate for a UNESCO Recommendation on Open Culture. This would follow in the footsteps of current UNESCO recommendations on Open Science and Open Educational Resources.
As the goal of Open Culture centres on making cultural heritage more accessible for the benefit of all people, IFLA has been a keen supporter of this effort. We have been collaborating with Creative Commons over the past years to drive forward the discourse on Open Culture and represent diverse perspectives from the library sector, including at the Creative Commons Global Summit in Mexico City in September 2023.
IFLA once again joined Creative Commons for an intensive workshop in Lisbon, Portugal held in May 2024 to help outline a pathway towards an eventual recommendation.
What is Open Culture?
There has been a rich debate on the parameters and definitions of Open Culture in the context of this project. In IFLA’s perspective, a focus on digitising cultural heritage and making those collections available for education, research, and cultural enrichment is the most realistic focus.
In this, IFLA stresses the need to carve out exceptions for cultural heritage that might not be appropriate for open access, such as that belonging to Indigenous communities.
From the perspective of Creative Commons, openly shared cultural heritage:
is easier to find
reaches broader and more diverse audiences
can be preserved, safeguarded and refined in digital form
can be (re)used with more legal certainty
Open cultural heritage leads to:
More resilient and relevant collection holders
More vibrant research and more participatory education
More dynamic cultural creativity
More just, democratic, diverse, free, and equitable societies
IFLA was represented in a group of experts brought together by Creative Commons to further work towards identifying next-steps in the pursuit of an intergovernmental recommendation on Open Culture.
Policy and Advocacy Manager Claire McGuire moderated a panel of UNESCO representatives from the national, regional, and international levels. This grounded the workshop by laying out the processes UNESCO follows to create such normative instruments.
What does this mean for libraries?
Going forward, IFLA will continue to play a central role together with partners from Creative Commons to elaborate this effort. For libraries, this means a chance to influence an process which advances national commitments that create an enabling environment for libraries to succeed in their mission.
As the work develops, IFLA will identify opportunities to represent library perspectives and amplify the voices of our members towards an outcome that will hopefully bring value to the library sector.
Stay tuned for more!
IFLA gives a big thank you to Creative Commons for involving us in this workshop!
Xin chia sẻ với các bạn một bản mẫu (prototype) mới! Mục đích chính của tôi khi xây dựng nó là khơi gợi cảm hứng để các bạn suy nghĩ về việc kết hợp nội dung mở (open content) và AI tạo sinh mở (open generative AI). Sự kết hợp này nhằm tạo ra các tài nguyên học tập tương tác, được cấp phép mở, miễn phí sử dụng và có thể vận hành cục bộ (ngay trên máy tính của bạn) mà không cần kết nối máy chủ bên ngoài.
Mô hình thử nghiệm này kết hợp ba yếu tố: (1) sách giáo khoa OpenStax, (2) sơ đồ tri thức (knowledge graph) biểu diễn nội dung cuốn sách, và (3) mô hình ngôn ngữ lớn trọng số mở (open weights LLM) chạy cục bộ ngay trong trình duyệt web của bạn. Việc LLM chạy cục bộ đồng nghĩa với việc bạn có thể trò chuyện thoải mái mà không tốn phí theo từng token; còn sơ đồ tri thức cho phép bạn duyệt qua bản đồ trực quan của cuốn sách, nơi các phần được liên kết chặt chẽ với chính nội dung tài liệu.
Vì "trăm nghe không bằng một thấy", mời bạn xem video demo ngắn dưới 3 phút này:
Đây thực sự chỉ là một bản mẫu thử nghiệm và có thể gặp lỗi hoặc trục trặc khi bạn sử dụng. Tuy nhiên, bạn có thể trải nghiệm thử tại địa chỉ: genoer.netlify.app.
Nếu bạn cũng đang thử nghiệm các phương pháp kết hợp AI tạo sinh và OER, tôi vừa phát hành một số công cụ với hy vọng sẽ giúp quá trình khám phá của bạn thuận tiện hơn. Càng nhiều người cùng thử nghiệm, chúng ta càng nhanh chóng tìm ra những đổi mới hữu ích!
Các công cụ này hoạt động với sách giáo khoa OpenStax ở định dạng nguồn "Connexions XML" (CNXML) có sẵn trên GitHub. Ví dụ: bạn có thể tìm thấy cuốn Nhập môn Tâm lý học (Introduction to Psychology ) của họ trên GitHub.
Công cụ đầu tiên của tôi, openstax-convert, chuyển đổi kho lưu trữ sách OpenStax thành một tệp book.json duy nhất được phân chia theo khối (kèm theo các hình ảnh thực sự được cuốn sách tham chiếu đến); tệp này sẵn sàng để đưa vào trình đọc, công cụ học tập, quy trình RAG (truy xuất và cung cấp ngữ cảnh) hoặc các công cụ khác.
Công cụ thứ hai, openstax-graph, sử dụng đầu ra từ openstax-convert để tạo ra một đồ thị tri thức có phân loại và đã được kiểm chứng qua quy trình đối kháng (adversarially-verified). Đồ thị này bao gồm các khái niệm, các thực thể thực tế minh họa cho chúng, các phần nội dung chứa chúng, cùng các mối quan hệ giữa chúng (là một loại của, là một phần của, phụ thuộc vào, tương phản với, liên quan đến, minh họa cho), cộng thêm một đồ thị có hướng không chu trình (DAG) thể hiện các điều kiện tiên quyết. Đồ thị được xuất ra dưới dạng một tệp graph.json duy nhất, sẵn sàng để sử dụng trong nhiều ứng dụng khác nhau.
Chúc bạn có trải nghiệm thú vị và đừng quên chia sẻ những gì bạn tạo ra nhé!
New prototype to share! My main purpose in building it is to inspire you to think more about how open content and open generative AI can be combined to create openly licensed, freely available, interactive learning resources that run privately and locally.
This proof-of-concept combines (1) an OpenStax textbook, (2) a knowledge-graph representation of the book’s contents, and (3) an open weights LLM that runs locally inside your web browser. The locally-running LLM means you can chat forever without having to pay per-token costs, and the knowledge graph means you can browse a visual map of the book that is interlinked with the content itself.
Since a demo is worth a 1000 words, here’s a < 3 minute demo:
This is definitely a prototype and may explode when you try to use it. But you can play around with it at genoer.netlify.app.
-----------------------------------------------
If you’re also experimenting with ways to combine generative AI and OER, I’ve just released some tools I hope will make your explorations easier. More people experimenting means we discover useful innovations more quickly!
These tools work with OpenStax textbooks in their source format, “Connexions XML” (CNXML), available in Github. For example, you can find their Introduction to Psychology text in Github.
My first tool, openstax-convert, converts an OpenStax book repo into a single block-segmented book.json file (plus only the images the book actually references), ready to drop into a reader, study tool, retrieval/grounding (RAG) pipeline, or other tool.
The second tool, openstax-graph, takes the output of openstax-convert and derives a typed, adversarially-verified knowledge graph. The graph includes concepts, the real-world entities that illustrate them, the sections where they live, and the relationships between them (is-a, part-of, depends-on, contrasts-with, related-to, illustrates), plus an acyclic prerequisite DAG. The graph is exported as a single graph.json file, ready to use in a wide range of applications.
Các công cụ AI tạo sinh đã đạt đến năng lực vượt xa con người trong việc phát hiện các lỗ hổng bảo mật trong mã nguồn máy tính. Khi mô tả về Claude Mythos Preview, Anthropic gần đây đã viết:
Trong quá trình thử nghiệm, chúng tôi nhận thấy Mythos Preview có khả năng xác định và sau đó khai thác các lỗ hổng zero-day trên mọi hệ điều hành và trình duyệt web phổ biến khi được người dùng yêu cầu. Các lỗ hổng mà nó tìm thấy thường rất tinh vi hoặc khó phát hiện. Nhiều lỗ hổng trong số đó đã tồn tại từ 10 hoặc 20 năm trước; lỗ hổng lâu đời nhất mà chúng tôi tìm thấy cho đến nay là một lỗi đã 27 năm tuổi trong OpenBSD—một hệ điều hành vốn nổi tiếng về tính bảo mật—và lỗi này hiện đã được khắc phục.
Tương tự, Mozilla báo cáo rằng Claude Mythos Preview đã phát hiện 271 lỗ hổng trong Firefox, một phần mềm khác vốn đã hoàn thiện và được kiểm tra cực kỳ kỹ lưỡng. v.v.
Hệ quả của Định luật Linus
Trước đây, hệ quả chính của việc mở mã nguồn của bạn (open sourcing your code) là tạo điều kiện hợp tác với người dùng, giúp phần mềm hữu ích hơn và tăng cường tính bảo mật. Eric Raymond đã gọi những tác động về mặt bảo mật của nguồn mở là Định luật Linus:
Với đủ số lượng người cùng xem xét, mọi lỗi đều trở nên dễ phát hiện.
Một cách hiểu Định luật Linus trong bối cảnh AI tạo sinh là: một mô hình mạnh mẽ như Claude Mythos Preview cung cấp số lượng "cặp mắt" quan sát gần như vô hạn. Có lẽ giờ đây chúng ta cần đến một hệ quả bổ sung cho Định luật Linus:
Với AI đủ mạnh, mọi lỗ hổng đều sẽ bị phát hiện và khai thác.
Tôi chưa nắm được đủ chi tiết về vụ xâm nhập hệ thống Canvas để biết chính xác hệ thống đã bị tấn công như thế nào, nhưng khi nghe tin, suy nghĩ đầu tiên của tôi là: Chắc chắn vụ này xảy ra vì Canvas là mã nguồn mở. Ai đó đã sử dụng AI mạnh mẽ để rà soát mã nguồn, tìm ra các lỗ hổng và khai thác một trong số đó. Sau đó, suy nghĩ thứ hai nảy ra trong đầu tôi là: Liệu vụ xâm nhập Canvas có phải là khởi đầu cho sự kết thúc của mã nguồn mở hay không?
Tính bất đối xứng của AI trong phòng thủ
Mozilla chỉ ra rằng các công cụ AI cũng tiếp sức cho các nhà phát triển, đồng thời cũng mang lại cho những người làm công tác bảo mật "siêu năng lực" khi họ rà soát và bảo vệ mã nguồn của mình. Theo báo cáo, Mozilla đã tận dụng rất hiệu quả công nghệ này cho mục đích đó. Tuy nhiên, không phải dự án mã nguồn mở nào cũng được vận hành bởi một tổ chức lớn như Mozilla.
Phần lớn các dự án nguồn mở là những dự án xuất phát từ niềm đam mê, chỉ có một người đóng góp duy nhất làm việc theo hình thức bán thời gian. Liệu chúng ta có thể kỳ vọng những người làm dự án vì đam mê này phải trả phí để tiếp cận các mô hình AI tiên tiến nhất và liên tục tích hợp chúng vào quy trình phát hành sản phẩm hay không? Nếu họ không thể hoặc vì lý do nào đó không muốn làm vậy, họ nên làm gì? Liệu việc chia sẻ mã nguồn – thứ gần như chắc chắn sẽ bị khai thác lỗ hổng – có phải là một lựa chọn phù hợp?
Giờ thì sao?
Có lẽ trong tương lai sẽ xuất hiện các mô hình AI có trọng số mở (open-weights) đủ mạnh mẽ; chúng có thể được vận hành cục bộ (miễn phí) và tích hợp trực tiếp vào các công cụ cũng như quy trình phát triển trong tương lai. Nhưng từ nay đến lúc đó, chúng ta phải làm gì?
Generative AI tools have become superhuman in their capacity to discover vulnerabilities in computer code. Describing the Claude Mythos Preview, Anthropic recently wrote:
During our testing, we found that Mythos Preview is capable of identifying and then exploiting zero-day vulnerabilities in every major operating system and every major web browser when directed by a user to do so. The vulnerabilities it finds are often subtle or difficult to detect. Many of them are ten or twenty years old, with the oldest we have found so far being a now-patched 27-year-old bug in OpenBSD—an operating system known primarily for its security.
Similarly, Mozilla reports that Claude Mythos Preview identified 271 vulnerabilities in Firefox, which is another mature and very thoroughly reviewed piece of software. &c.
Linus’s Corollary
Once upon a time, the primary consequence of open sourcing your code was enabling collaboration with your users, making the software more helpful for them and improving its security. Eric Raymond called the security implications of open source Linus’s Law:
Given enough eyeballs, all bugs are shallow.
One way of understanding Linus’s Law in the context of generative AI is that a model as powerful as Claude Mythos Preview provides essentially infinite eyes. Perhaps we now need Linus’s Corollary:
Given powerful enough AI, all bugs will be found and exploited.
I haven’t heard enough detail yet about the Canvas breach to know how the system was compromised, but when I heard about it my first thought was: I bet this is because Canvas is open source. Someone used powerful AI to review the source code, found vulnerabilities, and exploited one. Then my second thought was: is the Canvas breach the beginning of the end for open source?
The Asymmetry of AI for Defense
Mozilla points out that AI tools empower developers, too, giving defenders superpowers as they review and secure their own code. And according to the report, Mozilla used it very effectively for this purpose. But not every open source project is run by a major organization like Mozilla.
The majority of open source projects are passion projects with a single, part-time contributor. Do we now expect each of these hobbyists to pay for access to frontier AI models and consistently integrate them into their release process? If they can’t or for any reason don’t want to, what should they do? Is sharing code that is all but guaranteed to be exploited an appropriate choice to make?
What Now?
Perhaps in the future there will be sufficiently powerful open weights AI models, and these can be run locally (for free) and integrated directly into whatever future development tools and workflows look like. But until then, what now?
Nếu gần đây bạn đã tra cứu thông tin qua Google, Grok hay ChatGPT, hẳn bạn đã bắt gặp các phản hồi do AI tạo ra—những phản hồi được tổng hợp từ nhiều nguồn dữ liệu đa dạng mà thường không nêu rõ nguồn gốc cụ thể. Hãy so sánh điều này với việc tra cứu thông tin trên Wikipedia; tại đó, các trích dẫn cho phép bạn truy xuất nguồn gốc của một thông tin hay khẳng định nào đó. Chính chuỗi ghi nhận nguồn gốc này giúp thông tin trở nên đáng tin cậy hơn và ngăn chặn sự lan truyền của thông tin sai lệch. Đáng tiếc là trong bối cảnh các hệ thống AI hiện nay, việc ghi nhận nguồn gốc thường bị xem nhẹ hoặc thậm chí bị bỏ qua hoàn toàn. Nhiều mô hình AI nền tảng khiến người dùng không thể xác định được dữ liệu đầu vào cụ thể nào đã góp phần tạo nên kết quả đầu ra.
Nền dân chủ của chúng ta phụ thuộc vào khả năng chia sẻ và tiếp cận kho tài nguyên chung (commons) một cách cởi mở và bình đẳng, cũng như khả năng kiểm chứng và phát triển dựa trên nguồn tài nguyên đó. Chúng tôi mong muốn việc ghi nhận nguồn gốc trở thành quy chuẩn trong cả hoạt động chia sẻ tri thức giữa con người với nhau lẫn trong các hệ thống AI, nhằm luôn tôn vinh người sáng tạo và minh bạch hóa nguồn gốc tri thức. Đây vốn đã là quy chuẩn trong việc tái sử dụng thông tin tại các môi trường học thuật, xuất bản truy cập mở và các giấy phép Creative Commons; nó giúp việc tìm kiếm và kiểm chứng dữ liệu trở nên dễ dàng hơn khi tất cả chúng ta cùng đóng góp và hưởng lợi từ một kho tài nguyên chung phát triển mạnh mẽ.
Hãy tham gia cùng các chuyên gia từ Creative Commons, NISO, AXM và Wikimedia Foundation trong một cuộc thảo luận cộng đồng đầy thực tiễn về lý do tại sao việc ghi nhận nguồn gốc cần trở thành quy chuẩn trong các hệ thống AI, cũng như cách lĩnh vực này đang xây dựng các giải pháp cho tương lai. Các diễn giả sẽ thảo luận về việc phát triển và triển khai các công nghệ AI có khả năng ghi nhận nguồn gốc ngay tại thời điểm suy luận (inference-time attribution), chẳng hạn như các mô hình RAG (Retrieval-Augmented Generation - Tạo nội dung có tăng cường truy xuất) và các mô hình tác tử (agent models). Chúng ta sẽ cùng thảo luận về các yêu cầu và phương pháp tối ưu cho các công cụ thế hệ mới—những công cụ vừa tạo điều kiện thuận lợi cho việc chia sẻ, vừa chuẩn hóa quy trình ghi nhận nguồn gốc trong kỷ nguyên AI.
Tiến sĩ Monica Granados là Giám đốc phụ trách Khoa học Mở; bà lãnh đạo mảng Khoa học Mở của CC và hợp tác với các nhà nghiên cứu, thủ thư, các liên minh, nhà hoạch định chính sách cùng các bên liên quan khác trong lĩnh vực truyền thông học thuật. Bà cung cấp hoạt động giáo dục và đào tạo về các loại giấy phép của CC, qua đó giúp họ triển khai các thực hành khoa học mở và tăng cường khả năng tiếp cận…
Giám đốc Điều hành, Tổ chức Tiêu chuẩn Thông tin Quốc gia (NISO)
Todd Carpenter gia nhập NISO với tư cách là Giám đốc Điều hành vào tháng 9 năm 2006. Ở cương vị này, ông lãnh đạo NISO cũng như tập trung vào việc tăng cường mối quan hệ với các bên liên quan, phát triển tiêu chuẩn và hoàn thiện các quy trình vận hành. Trước khi gia nhập NISO, Todd từng là Giám đốc Phát triển Kinh doanh tại BioOne, nơi ông nỗ lực thực hiện các mục tiêu của cả…
Andrew Farrior là Giám đốc Vận hành của AXM Technologies – công ty chuyên xây dựng các hệ thống giúp nhà sáng tạo, các tổ chức và chủ sở hữu quyền quản lý việc sử dụng tài sản văn hóa trong kỷ nguyên trí tuệ nhân tạo. Công việc của ông tập trung vào sự giao thoa ngày càng lớn giữa AI, quyền sở hữu trí tuệ và nền kinh tế sáng tạo toàn cầu. Ông cũng là…
If you have Googled, Grok’d, or ChatGPT’d anything recently, you’ve encountered an AI-generated response, built by pulling information from a wide range of sources, often without clarity about which sources are being used. Compare this to looking something up on Wikipedia, where citations let you trace a claim back to its sources. That chain of attribution is what makes information more trustworthy and helps prevent the spread of misinformation. Unfortunately, in the current context of AI systems, attribution is commonly an afterthought or omitted altogether. Many AI foundational models make it impossible to determine how any given input contributed to an output.
Our democracy depends on all people being able to openly and equitably share and access the commons of knowledge, verify it, and build upon it. We expect attribution to be the norm in human sharing of knowledge and in AI systems, to always give credit to creators and show where the knowledge originates. This is already the norm for reuse in academic settings, open access publishing, and Creative Commons licenses, and makes it easier to discover and verify data as we all contribute to and benefit from a thriving commons.
Join practitioners from Creative Commons, NISO, AXM, and the Wikimedia Foundation for a grounded community conversation about why attribution should be the norm in AI systems, and how the field is actually building solutions for the future. Panelists will discuss development and deployment of AI technologies that give inference-time attribution in AI systems such as Retrieval Augmented Generation (RAG) models and agent models. Together we will discuss requirements and best practices for next generation tools that facilitate sharing while normalizing attribution in the age of AI.
Dr. Monica Granados is the Director of Open Science where she leads CC’s Open Science Portfolio working with researchers, librarians, consortia, policy makers, and other stakeholders in scholarly communication to equip them with education and training about our licences so that they can implement open science practices and increase access…
Executive Director, National Information Standards Organization
Todd Carpenter joined NISO as Executive Director in September 2006. In this role, Todd provides leadership to NISO as well as focuses on improving constituency relationships, standards development, and operational procedures. Prior to joining NISO, Todd was Director of Business Development with BioOne, where he served the goals of both…
Andrew Farrior is the COO of AXM Technologies, a company building systems to help creators, institutions, and rights holders manage how cultural assets are used in the age of artificial intelligence. His work focuses on the growing intersection of AI, intellectual property, and the global creative economy. He is also…