Thứ Hai, 10 tháng 8, 2026

Ghi nhận nguồn gốc trong Kỷ nguyên AI

 

Image by Diego Delso is licensed under CC BY-SA 4.0 via Wikimedia Commons.
Image by Diego Delso is licensed under CC BY-SA 4.0 via Wikimedia Commons.

Attribution in the Age of AI

Posted 24 July 2026 by Jack Hardinges, Irina Bejan

Theo: https://creativecommons.org/2026/07/24/attribution-in-the-age-of-ai/

Bài được đưa lên Internet ngày: 24/07/2026

Ghi nhận nguồn gốc là cơ chế cho phép một mẩu kiến ​​thức hoặc tác phẩm sáng tạo được kết nối với những người đã tạo ra nó. Khi các hệ thống AI tạo ra đầu ra mà không có nguồn gốc, kết nối đó bị phá vỡ, khiến việc tin tưởng thông tin, xác minh tính chính xác hoặc ghi nhận công lao trở nên khó khăn hơn. Vào tháng 3, chúng tôi đã phát hành "Ghi nhận nguồn gốc và đầu ra của AI" (bản dịch sang tiếng Việt), một bản tóm tắt vấn đề xem xét lý do tại sao việc ghi nhận nguồn gốc trong các hệ thống AI thường khó thực hiện chính xác. Các tác giả Jack Hardinges (Creative Commons) và Irina Bejan (OpenMined) đã đi sâu hơn vào câu hỏi này, và lập luận rằng những khoảng trống trong việc ghi nhận nguồn gốc không phải là tác dụng phụ không thể tránh khỏi của cách thức AI hoạt động. CC cho rằng đây là một bước quan trọng tiếp theo trong cuộc thảo luận này.

Giới thiệu

Việc ghi nhận nguồn gốc luôn là nền tảng của việc làm việc với sự sáng tạo và kiến ​​thức của người khác.

Như Creative Commons nhắc nhở chúng ta, (bản dịch sang tiếng Việt) việc thực hành ghi nhận nguồn gốc phục vụ nhiều chức năng quan trọng, từ việc cung cấp bằng chứng có thể kiểm chứng cho một tuyên bố, đến việc thể hiện sự tôn trọng đối với công việc của người khác, và tạo ra các con đường cho lưu lượng truy cập và giá trị tài chính được lưu chuyển.

Mặc dù tầm quan trọng của việc ghi nhận nguồn gốc, nhiều hệ thống AI hiện nay lại không thừa nhận các nguồn kiến ​​thức và sự sáng tạo đã tạo nên chúng.

Một nghiên cứu gần đây do Dự án Tiết lộ AI (AI Disclosures Project) dẫn dắt cho thấy hơn 30% phản hồi của các Mô hình ngôn ngữ lớn (LLM) hỗ trợ tìm kiếm hàng đầu không cung cấp bất kỳ sự ghi nhận nào. Ngay cả khi việc ghi nhận nguồn gốc được cung cấp, nó vẫn có thể bị hạn chế theo những cách thức ẩn khuất đối với người dùng và những thách thức kỹ thuật sâu sắc vẫn tồn tại trong việc kết nối kết quả đầu ra từ AI với các nguồn mà chúng được tạo ra.

Mặc dù vậy, chúng tôi tin rằng có nhiều lý do chính đáng để lạc quan rằng hệ thống AI có thể ghi nhận nguồn gốc mà chúng sử dụng. Không hoàn hảo và không phải luôn luôn, nhưng đủ và ngày càng cải thiện, đến mức chúng ta nên bác bỏ lập luận rằng việc thiếu ghi nhận nguồn gốc là một tác dụng phụ không thể tránh khỏi trong cách hoạt động của công nghệ. Tài sản chung không nhất thiết phải trở thành “chất nền ẩn”.

Lưu ý về thuật ngữ

Trong bài đăng này, chúng tôi hiểu ghi nhận nguồn gốc là thực hành kết nối một chế tác (artifact) với các nguồn dữ liệu được sử dụng để tạo ra nó. Điều này là cố ý rộng rãi. Như chúng tôi giải thích, hệ thống AI có thể thực hành các hình thức ghi nhận khác nhau đối với việc ghi nhận nguồn gốc cho các mục đích khác nhau và hữu ích. Chúng tôi không coi việc ghi nhận nguồn gốc là một yêu cầu hoặc điều kiện pháp lý cụ thể. Chúng tôi cũng sử dụng “hệ thống AI” một cách rộng rãi, vì hầu hết những gì chúng tôi thảo luận đều áp dụng cho nhiều mô hình và công nghệ xung quanh (mặc dù một số phương pháp chủ yếu áp dụng cho các hệ thống tạo đầu ra văn bản).

Lý do để lạc quan

1. Hệ thống AI đã phát triển theo những cách hỗ trợ việc ghi nhận nguồn gốc.

Làn sóng đầu tiên của các công cụ dựa trên LLM về cơ bản là các giao diện người dùng thực hiện lệnh gọi đến một mô hình tĩnh, được đào tạo trước (hoặc “trình bao bọc ChatGPT mỏng” - thin ChatGPT wrappers). Đầu ra từ những công cụ này là một chức năng của bất kỳ thứ gì mà mô hình đã được thể hiện trong quá trình đào tạo mà không có quyền truy cập trực tiếp vào các nguồn.

Điều này đã thay đổi nhanh chóng. Giờ đây, các kiến ​​trúc như tạo sinh tăng cường truy xuất - RAG (Retrieval Augmented Generation) cho phép các hệ thống AI thu thập dữ liệu mới (ví dụ như các trang web hoặc tệp của người dùng) để tạo ra kết quả đầu ra.

Việc thực hành truy xuất này giúp các hệ thống AI dễ dàng hơn trong việc ghi nhận nguồn gốc. Khi các hệ thống tạo ra đầu ra dựa trên nội dung được truy xuất, chúng có thể được huấn luyện và hướng dẫn để gắn các tuyên bố ở đầu ra với các nguồn cụ thể nơi các tuyên bố đó có thể được chứng thực. Điều này cung cấp một hình thức ghi nhận công lao và cho phép người dùng theo dõi đến các trang web hoặc truy tìm lại các tệp của riêng họ.

Ví dụ, Claude có thể cung cấp chú thích cuối trang với các liên kết có thể nhấp vào đến các nguồn. Để làm điều này, nó chia các tài liệu nguồn mà nó truy xuất thành các “khối” (chunks), mỗi khối có một ID duy nhất. Theo cài đặt mặc định, nó sẽ—ít nhất là một cách có chọn lọc—trích dẫn ID của các khối hỗ trợ các tuyên bố được đưa ra ở đầu ra và hiển thị chúng dưới dạng các liên kết có thể nhấp vào ở chú thích cuối trang. Tính năng Trích dẫn của Claude có thể được sử dụng để thực hiện việc này thường xuyên và nhất quán hơn, đồng thời cho phép đầu ra trỏ đến các đoạn văn chính xác từ các tệp của người dùng. Nó hoạt động bằng cách trích xuất các khối nguồn, chẳng hạn như các trích dẫn, và chèn chúng, nguyên văn, vào kết quả đầu ra.

Còn có các phương pháp tiếp cận khác. Pleias phát triển các mô hình AI nguồn mở nhỏ gọn sử dụng dữ liệu được cấp phép mở và thuộc phạm vi công cộng. Các mô hình Pleias-RAG được thiết kế để tạo ra đầu ra chỉ từ các nguồn được truy xuất. Thay vì chia nhỏ và chèn, mô hình tạo ra cả đầu ra và bản thân trích dẫn hỗ trợ trong một lần xử lý duy nhất. Cách tiếp cận này linh hoạt hơn, vì trích dẫn không bị ràng buộc bởi các khối được xác định trước, mà điều đó có nghĩa là hệ thống không thể đảm bảo hoàn toàn rằng các trích dẫn của nó hoàn toàn khớp với nguồn. Đối với người dùng, kết quả trông tương tự: một đầu ra có các tuyên bố được truy vết đến các nguồn, với các đoạn trích dẫn và các liên kết có thể nhấp (nếu ứng dụng được xây dựng trên mô hình nguồn mở lựa chọn thiết kế này).

Vẫn còn chỗ để cải thiện ở đây. Hầu hết các hệ thống AI không ghi nhận nguồn gốc được truy xuất một cách có hệ thống như các mô hình Pleias-RAG. Ngay cả khi các hệ thống làm như vậy, nó thường không đạt đến định dạng Tiêu đề Tác giả Nguồn Giấy phép - TASL (Title Author Source License) đầy đủ mà CC khuyến nghị. Và các khung như Kiểm soát Dựa trên Ghi nguồn (Attribution-Based Control) của OpenMined chứng minh cách các hệ thống có thể thực hiện một hình thức truy xuất phi tập trung hơn, bảo vệ quyền riêng tư, trong đó dữ liệu được truy vấn tại nơi nó tồn tại thay vì được sao chép từ hệ thống của người dùng hoặc từ web vào một chỉ mục tập trung.

Nhìn chung, các kiến ​​trúc truy xuất đã cho phép thực hành ghi nhận nguồn gốc, thể hiện sự cải tiến mạnh mẽ so với các hộp đen được LLM hỗ trợ đầu tiên mà chúng ta từng tiếp xúc. Những phát triển này đã khiến các nhà nghiên cứu từ Dự án Công bố Thông tin AI và các cộng sự của họ kết luận rằng “khoảng trống trong việc ghi nhận nguồn gốc là do các lựa chọn thiết kế, chứ không chỉ đơn thuần là những hạn chế kỹ thuật. Các hệ thống hoạt động tốt nhất cho thấy rằng việc ghi nhận nguồn gốc minh bạch và toàn diện là khả thi về mặt kỹ thuật hiện nay”.

2. Ghi nhận nguồn gốc dữ liệu là một lĩnh vực nghiên cứu tích cực.

Các cách tiếp cận ghi nhận nguồn gốc được mô tả ở trên có thể cung cấp bằng chứng xác nhận, nhưng chúng không thực sự chứng minh rằng một nguồn được liệt kê đã gây ra kết quả đầu ra. Chúng thường chỉ liệt kê một nguồn duy nhất và chỉ đề cập đến các nguồn mà hệ thống đã truy cập trong quá trình suy luận.

Sử dụng các phương pháp này, một hệ thống có thể dựa vào nhiều nguồn để tạo ra kết quả đầu ra, xuyên suốt quá trình huấn luyện và suy luận, nhưng chỉ liệt kê một nguồn duy nhất làm bằng chứng xác nhận.

Nghiên cứu đang được tiến hành để giải quyết câu hỏi khó hơn: “Với tất cả những gì hệ thống đã sử dụng, nguồn nào đã định hình kết quả đầu ra này, sao cho việc loại bỏ chúng sẽ làm thay đổi kết quả?”

Một số phương pháp cố gắng trả lời câu hỏi này bằng cách đọc trạng thái nội bộ của mô hình để ước tính đầu vào nào quan trọng đối với đầu ra. Trọng số chú ý hoạt động bằng cách theo dõi sự tập trung của mô hình trên các tài liệu nguồn được truy xuất khi nó tạo ra đầu ra. Tỷ lệ chú ý dành cho một nguồn nhất định đôi khi được sử dụng làm thước đo cho mức độ quan trọng của nó. Các phương pháp dựa trên gradient thì đo lường độ nhạy, tìm cách tính toán xem câu trả lời sẽ thay đổi bao nhiêu nếu mỗi đầu vào được thay đổi một chút, với giả định rằng các đầu vào mà đầu ra nhạy cảm nhất là những đầu vào đã định hình nó.

Một nhóm phương pháp khác tuân theo logic “loại bỏ một nguồn” để cố gắng xác định xem kết quả đầu ra sẽ thay đổi như thế nào nếu một trong những nguồn tài liệu của nó bị loại bỏ.

Để làm điều này một cách hoàn hảo, cần phải chạy lại quá trình suy luận với các nguồn khác nhau bị giữ lại mỗi lần. Điều này nhanh chóng trở nên tốn kém về mặt tính toán, vì việc ghi nhận nguồn gốc ở cấp độ từng đoạn văn riêng lẻ có thể đồng nghĩa với hàng trăm lần chạy lại cho mỗi kết quả đầu ra. Hầu hết các nghiên cứu đều cố gắng xấp xỉ hiệu ứng này bằng cách sử dụng các phương pháp khác nhau để giảm chi phí tạo ra kết quả phản thực. AttriBoT tính xấp xỉ sự thay đổi trong phản hồi của hệ thống khi các đoạn cụ thể của nguồn được truy xuất bị loại bỏ bằng cách kiểm tra các khối nội dung nguồn lớn trước khi “phóng to” vào các đoạn nhỏ hơn. ContextCite xem xét các tập con ngẫu nhiên của các nguồn để dự đoán câu trả lời sẽ thay đổi như thế nào khi các nguồn được bật và tắt. OpenMined đang thử nghiệm với các giá trị Shapley, hoạt động bằng cách tính trung bình đóng góp biên của mỗi nguồn trên nhiều tổ hợp khác nhau của các nguồn.

Logic phản thực tế y hệt này cũng có thể được áp dụng cho dữ liệu huấn luyện thay vì các nguồn dữ liệu được truy xuất.

Các hàm ảnh hưởng ước tính, mà không cần huấn luyện lại, mức độ nhạy cảm của đầu ra mô hình đối với từng nguồn huấn luyện và do đó, việc loại bỏ một nguồn sẽ làm thay đổi kết quả như thế nào. Việc này liên quan đến việc đảo ngược một ma trận ghi lại cách mọi tham số trong mô hình tương tác với mọi tham số khác. Kích thước của ma trận này bằng bình phương số lượng tham số của toàn bộ mô hình. Đối với các mô hình hiện nay, thường vượt quá 3 nghìn tỷ tham số, con số này quá lớn để lưu trữ, chứ chưa nói đến việc tính toán. Do đó, hầu hết các tiến bộ trong việc ghi nhận nguồn gốc dữ liệu huấn luyện đều liên quan đến việc đưa ra các ước tính về việc thiếu điểm dữ liệu huấn luyện nào sẽ làm thay đổi đầu ra của mô hình nhiều nhất. Các nhà nghiên cứu tại Anthropic đã thử nghiệm một kỹ thuật gọi là EK-FAC để tính xấp xỉ ma trận khổng lồ đó bằng một ma trận thay thế có cấu trúc đơn giản hơn. Phương pháp lặp Arnoldi chỉ giữ lại các hướng chủ đạo của ma trận. Những phương pháp khác giảm chi phí theo những cách khác nhau. TracIn bỏ qua ma trận và thay vào đó quan sát các tham số mô hình tại các thời điểm khác nhau trong quá trình huấn luyện để đánh giá cách một đầu vào cụ thể định hình đầu ra, còn TRAK coi mô hình đã được huấn luyện như thể đó là một mô hình tuyến tính đơn giản, điều này làm cho việc tính toán cùng một ước tính trở nên rẻ hơn nhiều.

Các nhà nghiên cứu đã phát hiện ra rằng các ước tính về đóng góp của dữ liệu huấn luyện có thể khá chính xác đối với các mô hình nhỏ, đơn giản, nhưng nhanh chóng trở nên không đáng tin cậy khi mô hình phát triển, và các phương pháp khác nhau có thể không đồng ý về tác động của một nguồn cụ thể. Ngoài ra, mặc dù chúng có thể - có lẽ - chỉ ra các ví dụ huấn luyện riêng lẻ định hình đầu ra nhiều nhất, nhưng những ví dụ đó khó có thông tin về tác giả hoặc nguồn gốc của chúng. Việc xác định một nguồn huấn luyện có ảnh hưởng không giống như việc có thể ghi nguồn đúng cho nó.

Mặc dù không hoàn hảo, các phương pháp được mô tả ở đây là sản phẩm của một lĩnh vực nghiên cứu đang phát triển dành riêng cho việc ghi nguồn cho dữ liệu, và có lý do để kỳ vọng một số phương pháp sẽ được đưa vào các hệ thống AI chính thống. Nhìn rộng hơn nữa, hầu hết các hệ thống chúng ta có ngày nay không được xây dựng để bảo tồn thông tin về các nguồn mà chúng sử dụng, đặc biệt là trong quá trình huấn luyện. Chúng tôi hy vọng rằng sẽ có nhiều lựa chọn thiết kế chú trọng đến nguồn gốc hơn ngay từ đầu (chẳng hạn như dữ liệu huấn luyện được chọn lọc và có thể nhận dạng liên tục hơn), thay vì việc ghi nhận nguồn gốc phải được thêm vào các hệ thống mà không lường trước được tầm quan trọng của nó.

3. Áp lực pháp lý đối với các nhà phát triển AI trong việc tiết lộ nguồn đang gia tăng.

Nếu không có sự can thiệp, các nhà phát triển AI đã tiết lộ rất ít về nội dung mà mô hình của họ được huấn luyện hoặc có quyền truy cập. Nhiều người dường như coi việc tiết lộ dữ liệu huấn luyện, đặc biệt là, như một gánh nặng không cần thiết, hoặc thành phần của nó là một nguồn lợi thế cạnh tranh và rủi ro pháp lý.

Đáp lại, các cơ quan quản lý đã bắt đầu đưa ra các tiêu chuẩn tối thiểu về những gì các nhà phát triển AI phải ghi lại và công bố về dữ liệu được các mô hình của họ sử dụng.

Ví dụ, Đạo luật AI của EU yêu cầu các nhà cung cấp mô hình AI đa năng phải công bố “bản tóm tắt đủ chi tiết” về nội dung huấn luyện của họ, sử dụng mẫu do Văn phòng AI của Ủy ban Châu Âu công bố. Mẫu này yêu cầu một bản ghi chép có hệ thống về các nguồn dữ liệu chính của mô hình, bao gồm các tập dữ liệu lớn có sẵn công khai, dữ liệu được cấp phép từ chủ sở hữu bản quyền và dữ liệu được thu thập hoặc trích xuất từ ​​các nguồn trực tuyến. Tương tự, Đạo luật Minh bạch Dữ liệu Huấn luyện AI Tạo sinh của California yêu cầu các nhà phát triển phải công bố bản tóm tắt các tập dữ liệu được sử dụng để huấn luyện bất kỳ hệ thống AI tạo sinh nào được cung cấp cho người dân California.

Trong bối cảnh này, việc ghi nhận nguồn gốc liên quan đến việc kết nối các nguồn dữ liệu huấn luyện với một mô hình chứ không phải với một kết quả đầu ra cụ thể. Đó là sự khác biệt giữa việc trả lời “những nguồn nào đã giúp mô hình này có khả năng tạo ra đầu ra?” so với “mô hình này đã sử dụng những nguồn nào để tạo ra đầu ra này?”. Việc trả lời câu hỏi này đáp ứng các nhu cầu khác nhau so với các hình thức ghi nhận nguồn gốc khác được mô tả trong bài viết này, vốn thường tập trung vào việc kết nối đầu ra từ các mô hình với các nguồn được sử dụng để tạo ra chúng. Việc ghi nhận nguồn gốc ở cấp độ mô hình (thường được gọi đơn giản là “minh bạch” hoặc “công khai”) cho phép người tiêu dùng so sánh các hệ thống cạnh tranh, các cơ quan quản lý giám sát và thực thi quy định, và các nhà nghiên cứu đưa ra đánh giá cấp cao về các vấn đề như những thiên kiến và an toàn.

Hình thức ghi nhận nguồn gốc này thường được tóm tắt hơn là đủ chi tiết. Các bản tóm tắt có thể chỉ nêu tên riêng lẻ các tập dữ liệu lớn – chứ không phải tất cả – được công khai và các nguồn dữ liệu huấn luyện khác. Và nó thường được thực hiện với các ngoại lệ. Ví dụ, mẫu của EU cho phép các nhà cung cấp mô hình biên tập lại một số yếu tố mà họ có thể biện minh là bí mật thương mại.

Mặc dù chúng phục vụ các mục đích khác nhau, chúng tôi cho rằng việc xem xét việc ghi nhận nguồn gốc ở cấp độ đầu ra và cấp độ mô hình có liên quan với nhau là hữu ích. Thứ nhất, kiểu thiết kế nhận biết nguồn mà quy định cấp độ mô hình ngày càng khuyến khích, chẳng hạn như việc sử dụng dữ liệu huấn luyện được chọn lọc kỹ lưỡng hơn, cũng chính là điều giúp việc ghi nhận nguồn gốc ở cấp độ đầu ra tốt hơn trở nên khả thi (như chúng ta đã thảo luận trước đó trong bài viết này). Thứ hai, chúng tôi kỳ vọng các cơ quan quản lý sẽ phát triển các yêu cầu của họ đối với các hệ thống AI để bao gồm việc ghi nhận nguồn gốc ở cấp độ đầu ra. Vào tháng 6 năm 2026, Cơ quan Cạnh tranh và Thị trường của Vương quốc Anh đã áp đặt một yêu cầu về hành vi đối với Google, theo đó Google phải thực hiện các bước để đảm bảo nội dung tìm kiếm của mình được ghi nhận nguồn gốc rõ ràng và chính xác, cũng như công bố thông tin thân thiện với người dùng giải thích các phương pháp ghi nhận nguồn gốc của mình. (Tuy nhiên, cần lưu ý rằng chúng ta nên thận trọng với các quy định ghi nhận nguồn gốc quá khắt khe, khó khăn hoặc không thực tế, đặc biệt là đối với việc phát triển AI nguồn mở và phi thương mại, hoặc đối với việc sử dụng máy móc nói chung.)

4. Người dùng mong đợi sự ghi nhận nguồn gốc.

Sau khi thế hệ LLM đầu tiên nổi tiếng vì những "ảo giác", một hệ thống đưa ra kết quả một cách tự tin mà không ghi lại nguồn gốc của nó giờ đây bị coi là thiếu sót.

Người dùng mong muốn có thể nhấp chuột để xem tài liệu nguồn đằng sau một tuyên bố, và kỳ vọng đó định hình những gì được xây dựng. Đó là một phần lý do tại sao các hệ thống như Claude hiện trả về kết quả có liên kết trở lại các trang web và tệp người dùng đã được sử dụng.

Trong các thị trường được quản lý và nhạy cảm, kỳ vọng này đang dần chuyển từ sở thích của người tiêu dùng thành yêu cầu mua sắm. Người mua hệ thống AI trong các lĩnh vực như luật, y tế và tài chính ngày càng yêu cầu các bằng chứng có thể kiểm toán cho thấy kết quả đầu ra cụ thể dựa trên cơ sở nào, để đáp ứng các chế độ tuân thủ của riêng họ. Được thiết kế cho các chuyên gia y tế, OpenEvidence ghi nhận nguồn gốc của nó thông qua phương pháp tương tự như Claude, và cải thiện hơn nữa độ tin cậy bằng cách giới hạn các nguồn đó trong các tài liệu y khoa đã được kiểm duyệt.

Khi các cá nhân, doanh nghiệp và chính phủ thúc đẩy "AI tự chủ", các hệ thống hoạt động như một máy trộn mờ ám, trộn lẫn mọi thứ chúng tìm thấy một cách bừa bãi, sẽ là không đủ. Các lựa chọn kiến ​​trúc giúp kiểm soát mối quan hệ giữa hệ thống AI và dữ liệu—chẳng hạn như quyền truy cập được cấp phép, truy xuất liên kết liên đoàn và nhật ký truy xuất minh bạch—cũng chính là những lựa chọn làm cho việc ghi nhận nguồn gốc tốt hơn, đặc biệt là trong quá trình suy luận.

Cũng có áp lực từ phía nhà cung cấp dữ liệu. Mặc dù các thỏa thuận cấp phép dữ liệu có thể gây lo ngại cho những người quan tâm đến việc mở rộng không gian chung kỹ thuật số, nhưng chúng tạo ra các động lực thương mại và nghĩa vụ hợp đồng cho các công ty AI trong việc phát triển các phương tiện để xác định nguồn nào đã đóng góp vào kết quả đầu ra nào. ProRata sử dụng việc ghi nhận nguồn gốc làm cơ sở cho việc cấp phép và thanh toán (mặc dù phương pháp của họ không được công bố, khiến khó có thể biết họ thực sự đang làm gì hoặc độ chính xác của nó như thế nào); Comet Plus của Perplexity trả tiền cho các nhà xuất bản tham gia khi nội dung của họ được truy cập, trích dẫn trong câu trả lời hoặc được một tác nhân xử lý; và Index của Parallel sử dụng giá trị Shapley để khuyến khích người viết "xem nội dung của họ đáng giá bao nhiêu đối với các tác nhân AI".

Mặc dù các định dạng truyền thống như TASL vẫn đóng vai trò quan trọng, đặc biệt là trong quá trình suy luận, chúng ta nên cởi mở với các mô hình và tiêu chuẩn mới để trình bày thông tin ghi nhận nguồn gốc cho người dùng. Đối với các phương pháp được Shapley hỗ trợ, nghiên cứu của OpenMined cho thấy cách biểu đồ hoặc các tính năng thiết kế khác có thể trình bày đóng góp tương đối của nhiều nguồn vào một kết quả đầu ra tổng hợp duy nhất. Khung Ghi nhận Nguồn gốc của Wikimedia mô tả cách bao gồm số lượng tham chiếu, hoạt động của người đóng góp và lời kêu gọi hành động có thể hỗ trợ độ tin cậy của các phản hồi do AI tạo ra, và thúc đẩy người đóng góp và quyên góp cho các nguồn. Trong môi trường học thuật, những người tham gia hội thảo gần đây tại Cambridge đã nêu bật nhu cầu về các kết quả đầu ra phải trình bày thông tin như việc rút lại bài báo và các biểu hiện quan ngại khác.

Tiến về phía trước

Chúng ta không được quên rằng việc ghi nhận nguồn gốc là một yếu tố quan trọng của khế ước xã hội về chia sẻ. Bất kể máy móc tham gia như thế nào, việc nêu tên nguồn gốc của chúng ta duy trì mối liên hệ giữa một tác phẩm sáng tạo hoặc kiến ​​thức và những người đã tạo ra nó.

Mặc dù thực sự là một thách thức về mặt kỹ thuật, chúng tôi lạc quan rằng các hệ thống AI hiện đại có thể thực hành việc ghi nhận nguồn gốc một cách có ý nghĩa, đặc biệt nếu việc ghi nhận nguồn gốc được tích hợp ngay từ khâu thiết kế. Như bài viết này đã mô tả: kiến ​​trúc truy xuất giúp việc ghi nhận nguồn gốc trở nên khả thi; các phương pháp đóng góp tiên tiến hơn đang dần chuyển từ nghiên cứu sang ứng dụng thực tiễn; và áp lực từ phía thương mại, pháp lý và người dùng đang cùng hướng đến mục tiêu chung này.

Khi các phương pháp ghi nhận nguồn gốc trưởng thành, điều quan trọng đối với chúng ta là chúng cần được mở rộng đến những người sáng tạo, nhà xuất bản và người quản lý nội dung được cấp phép mở và thuộc phạm vi công cộng, thay vì chỉ dành riêng cho những người tham gia vào các thỏa thuận cấp phép hạn chế hoặc sử dụng công nghệ tinh vi để kiểm soát quyền truy cập vào nội dung của họ.

Cuối cùng, chúng ta không nên quên rằng việc ghi nhận nguồn gốc đúng cách là cần thiết nhưng chưa đủ cho tương lai của tài nguyên chung. Một người sáng tạo có thể được ghi nhận công lao nhưng vẫn mất đi lượng truy cập đã tài trợ cho công việc của họ. Một thư viện công cộng vẫn có thể bị quá tải bởi các máy móc truy cập ồ ạt vào bộ sưu tập của mình. Một cộng đồng như Wikipedia vẫn có thể mất đi kết nối với những người đóng góp, cả hiện tại và tiềm năng. Để xây dựng mối quan hệ tương hỗ thực sự giữa AI và tài nguyên chung, chúng ta cũng cần những ý tưởng mới táo bạo, cơ sở hạ tầng và các hình thức trao đổi để duy trì các cộng đồng và thể chế mà tài nguyên chung phụ thuộc vào.

Nếu bạn đang nghiên cứu về việc ghi nhận nguồn gốc tác giả, đặc biệt là việc xây dựng các hệ thống AI thực hiện việc này theo một số cách mà chúng tôi mô tả ở đây, CC rất muốn được nghe ý kiến ​​từ bạn.

Bài viết này của Jack Hardinges và Irina Bejan (OpenMined) được cấp phép theo CC BY 4.0. Xin cảm ơn Diyana Noory, Monica Granados và Sarah Pearson tại Creative Commons vì những nhận xét của họ về bản thảo bài viết này.

Attribution is the mechanism that lets a piece of knowledge or creativity stay connected to the people who made it possible. When AI systems produce outputs without sources, that connection breaks, making it harder to trust the information, verify accuracy, or give credit. In March, we released Attribution & AI Outputs, an issue brief examining why attribution in AI systems is so often difficult to get right. Authors Jack Hardinges (Creative Commons) and Irina Bejan (OpenMined) take that question further here, and make the case that attribution gaps aren’t an inevitable side effect of how AI works. CC thinks it’s an important next step in this conversation.

Introduction

Attribution has always been a cornerstone of working with other people’s creativity and knowledge.

As Creative Commons reminds us, practicing attribution serves many important functions, from providing verifiable evidence of a claim, to paying respect to the work of others, and creating pathways for traffic and financial value to flow.

Despite the importance of attribution, many of today’s AI systems fail to acknowledge the sources of knowledge and creativity that make them possible.

A recent study led by the AI Disclosures Project found that more than 30% of responses by leading search-enabled Large Language Models (LLMs) provided no attribution whatsoever. Even where attribution is provided, it can be limited in ways that are hidden to users, and deep technical challenges persist in connecting outputs from AI to the sources they are derived from.

Despite this, we believe there are good reasons to be optimistic that AI systems can attribute the sources they use. Not perfectly, and not always, but enough and improving, such that we should reject the argument that a lack of attribution is an inevitable side effect of the way the technology works. The commons needn’t become “hidden substrate.”

A Note on Terminology

In this post, we interpret attribution as the practice of connecting an artifact with the sources of data used to create it. This is deliberately broad. As we explain, it’s possible—and useful—for AI systems to practice different forms of attribution for different purposes. We are not referring to attribution as a specific legal requirement or condition. We also use “AI systems” broadly, as most of what we discuss applies to a wide range of models and surrounding technologies (although some methods apply mainly to systems that generate text outputs).

Reasons to Be Optimistic

1. AI systems have evolved in ways that support attribution. 

The first wave of LLM-based tools were essentially user interfaces that made calls to a static, pre-trained model (or “thin ChatGPT wrappers”). Outputs from these tools were a function of whatever the model had been exposed to in training, with no live access to sources.

This changed quickly. Now, architectures such as retrieval augmented generation (RAG) enable AI systems to draw on fresh data (such as web pages or a user’s files) to produce outputs.

This practice of retrieval makes AI systems much more amenable to attribution. When systems generate an output based on retrieved content, they can be trained and prompted to attach claims in the output to specific sources where those claims can be corroborated. This provides a form of credit, and allows users to follow through to web pages or trace back to their own files.

Claude, for example, can provide footnotes with clickable links to sources. To do this, it breaks the source materials it retrieves into “chunks”, each with a unique ID. Under default settings, it will—selectively, at least—cite the IDs of chunks that support the claims made in the output and render them as clickable links in the footnotes. Claude’s Citations feature can be used to make this practice more frequent and consistent, and enable outputs to point to exact passages from users’ files. It works by extracting source chunks, such as quotations, and injecting them, verbatim, into the output.

Other approaches exist. Pleias develops small, open-source AI models using openly licensed and public domain data. Pleias-RAG models are designed to produce outputs exclusively from retrieved sources. Rather than chunking and injecting, the model generates both the output and the supporting quote itself, in a single pass. This approach is more flexible, as the quote isn’t bound by pre-defined chunks, but it means that the system cannot fully guarantee that its quotations perfectly match the source. For a user, the result looks similar: an output whose claims trace to sources, with quoted excerpts and clickable links (if the application built on top of the open-source model makes this design choice).

There’s room for improvement here. Most AI systems do not attribute their retrieved sources as systematically as the Pleias-RAG models. Even where systems do, it often doesn’t amount to the full Title Author Source License (TASL) format that CC recommends. And frameworks like OpenMined’s Attribution-Based Control demonstrate how systems could practice a more decentralized, privacy-preserving form of retrieval, where data is queried where it lives rather than copied from the user’s system or the web into a central index.

In the round, retrieval architectures have enabled attribution practices that represent a strong improvement from the first LLM-enabled black boxes we were exposed to. These developments have led researchers from the AI Disclosures Project and their collaborators to conclude that “attribution gaps result from design choices, not simply technical limitations. The best-performing systems show that transparent, comprehensive attribution is technically feasible today”.

2. Data attribution is an active research discipline.

The approaches to attribution described above can provide corroboration, but they don’t truly establish that a listed source caused an output. They often list just one source, and only address the sources that a system accessed at inference time.

Using these methods, a system could rely on multiple sources to produce an output, across training and inference, but list only one source as corroboration.

Research is underway to address the harder question of: “given everything the system drew on, which sources shaped this output, such that removing them would have changed the result?”

Some methods attempt to answer this by reading the model’s internal state to estimate which inputs mattered to an output. Attention weights work by monitoring a model’s focus across retrieved source materials as it generates an output. The share of attention landing on a given source is sometimes used as a proxy for how much it mattered. Gradient-based methods instead measure sensitivity, seeking to calculate how much the answer would shift if each input were changed slightly, on the assumption that the inputs the output is most sensitive to are the ones that shaped it. 

A different cluster of methods follows the logic of “leave one out” to try to identify how an output would change if one of its source materials was removed.

Doing this perfectly would involve rerunning inference with different sources withheld each time. That gets computationally expensive quickly, as attributing at the level of individual passages could mean hundreds of reruns per output. Most research attempts to approximate this effect by using different methods to cut the cost of producing the counterfactual. AttriBoT approximates the change in a system’s response when particular spans of retrieved sources are taken away by testing large blocks of source content first before “zooming in” on smaller spans. ContextCite looks at random subsets of the sources to predict how the answer shifts as sources are switched on and off. OpenMined is experimenting with Shapley values, which work by averaging each source’s marginal contribution across many different combinations of the sources.

This same counterfactual logic can also be pointed at training data rather than retrieved sources.

Influence functions estimate, without retraining, how sensitive the model’s output is to each training source and, therefore, how much removing one would change the answer. Doing this involves inverting a matrix that records how every parameter in a model interacts with every other parameter. Its size is the full model’s parameter count squared. For today’s models, which often exceed 3 trillion parameters, this is far too large to even store, let alone compute with. As a result, most progress on training data attribution involves producing estimations for which training data point’s absence would have changed the model’s output the most. Researchers at Anthropic have experimented with a technique called EK-FAC to approximate that enormous matrix with a simpler, structured stand-in. Arnoldi iteration keeps only the matrix’s dominant directions. Others cut the cost differently. TracIn skips the matrix and instead observes the model parameters at different points in training to assess how a particular input shaped the output, and TRAK treats the trained model as if it was a simple linear one, which makes the same estimate far cheaper to compute.

Researchers have found that estimates of training data contributions can be fairly accurate for small, simple models, but become unreliable quickly as models grow, and different methods are likely to disagree on the impact of a particular source. Also, while they can—perhaps—point to the individual training examples that most shaped an output, those examples are unlikely to have information about their authorship or provenance attached. Identifying an influential training source is not the same as being able to properly attribute it.

While imperfect, the methods described here are the product of a growing field of research dedicated to data attribution, and it’s reasonable to expect some will work their way into mainstream AI systems. Taking an even wider view, most of the systems we have today were not built to preserve information about the sources they use, especially in training. We are hopeful that more source-aware design choices will be made from the ground up (such as more curated and persistently identifiable training data), rather than attribution needing to be bolted onto systems that chose not to anticipate its importance.

3. Regulatory pressure on AI developers to disclose their sources is increasing.

Left to themselves, AI developers have disclosed little about the content their models are trained on or have access to. Many seem to view training data disclosure, in particular, as an unnecessary burden, or its composition as a source of competitive advantage and legal exposure.

In response, regulators have started to introduce minimum standards for what AI developers must document and publish about the data used by their models.

The EU AI Act, for example, requires providers of general-purpose AI models to publish a “sufficiently detailed summary” of their training content, using a template published by the European Commission’s AI Office. The template requires an organised account of the model’s main data sources, including large publicly available datasets, data licensed from rightsholders, and data crawled or scraped from online sources. California’s Generative AI Training Data Transparency Act similarly requires developers to publish a summary of the datasets used to train any generative AI system made available to Californians. 

In this context, attribution involves connecting sources of training data to a model rather than to a specific output. It’s the difference between answering what sources made this model capable of producing outputs?” vs “what sources has this model used to produce this output?” Answering this meets different needs to other forms of attribution described in this post, which are generally focused on connecting outputs from models to the sources used to generate them. Model-level attribution (often referred to as simply “transparency” or “disclosure”) enables consumers to compare competing systems, regulators to supervise and enforce regulation, and researchers to make high-order assessments of things like bias and safety.

This form of attribution is typically summarized rather than granular. Summaries might only individually name large—rather than all—publicly available datasets and other sources of training data. And it’s often practiced with carve-outs. The EU template, for instance, lets model providers redact some elements they can justify as trade secrets.

While they serve different purposes, we think it’s useful to see output-level and model-level attribution as related. First, the kind of source-aware design that model-level regulation increasingly encourages, such as the use of more curated training data, is also what makes better output-level attribution possible (as we discussed earlier in this post). Second, we expect regulators to evolve their demands of AI systems to include output-level attribution. In June 2026, the UK’s Competition and Markets Authority imposed a conduct requirement on Google, under which it must take steps to ensure its search content is attributed clearly and accurately, as well as publish user-friendly information explaining its attribution methods. (However, on that note, we should be wary of attribution regulations that are overly prescriptive, onerous, or impractical, especially for open source and non-commercial development of AI, or for machine use more broadly.)

4. Users expect attribution.

After the first generation of LLMs became notorious for “hallucinations”, a system that outputs confidently without documenting its sources is now seen as deficient.

Users have come to expect to be able to click through to source material behind a claim, and that expectation shapes what gets built. It is part of the reason why systems like Claude now return outputs with links back to the web pages and user files that have been drawn on. 

In regulated and sensitive markets, this expectation is hardening from a consumer preference into a procurement requirement. Buyers of AI systems in sectors such as law, medicine, and finance increasingly require auditable trails showing what a given output was based on, in order to satisfy their own compliance regimes. Designed for medical professionals, OpenEvidence attributes its sources through much the same approach as Claude, and further improves reliability by constraining those sources to vetted medical literature.

As individuals, enterprises, and governments push for “sovereign AI”, systems that behave as an opaque blender, indiscriminately mixing everything they can find, will not suffice. The architectural choices that make control of AI systems’ relationship with data possible—such as permissioned access, federated retrieval, and transparent retrieval logs—are the same ones that make for better attribution, especially at inference time.

There is pressure from the data supply side, too. While licensed data deals can be concerning to those of us with an interest in broadening the digital commons, they create commercial incentives and contractual obligations for AI firms to develop means of identifying which sources contributed to which outputs. ProRata uses attribution as the basis for licensing and payment (though their methods are unpublished, making it hard to tell what they are really doing or how accurate it is); Perplexity’s Comet Plus pays participating publishers when their content is visited, cited in an answer, or acted on by an agent; and Index by Parallel uses Shapley values to encourage writers to “see what [their] content is worth to AI agents.”

While traditional formats like TASL still have a role to play, especially at inference time, we should be open to new patterns and standards for presenting attribution information to users. For Shapley-enabled methods, OpenMined’s research shows how charts or other design features can present the relative contribution of several sources to a single synthesized output. The Wikimedia Attribution Framework describes how including reference counts, contributor activity and calls-to-action can support the credibility of AI-generated responses, and drive contributors and donations to sources. In scholarly settings, participants at a recent Cambridge workshop flagged the need for outputs to present information such as retractions and other expressions of concern.

Moving Forward

We must not lose sight of the fact that attribution is a vital element of the social contract of sharing. Regardless of how machines are involved, naming our sources sustains the connection between a piece of creativity or knowledge and the people who produced it.

While it is indeed technically challenging, we’re optimistic that modern AI systems can meaningfully practice attribution, especially if attribution is incorporated by design. As this post has described: retrieval architectures make corroborative attribution eminently possible; more advanced, contributive methods are inching from research toward production; and commercial, regulatory, and user pressure are aligning behind the same goal.

As attribution practices mature, it’s important to us that they extend to creators, publishers, and stewards of openly licensed and public domain content rather than become the preserve only of those who engage in restrictive licensing deals or use sophisticated technology to gate access to their content. 

Lastly, we shouldn’t lose sight of the fact that getting attribution right is necessary but insufficient for the future of the commons. A creator can be attributed and still lose the traffic that funded their work. A public library can still find itself overwhelmed by machines drawing on its collection en masse. A community like Wikipedia can still lose its connection with contributors, current and potential. To build a genuinely reciprocal relationship between AI and the commons, we also need bold new ideas, infrastructure, and forms of exchange to sustain the communities and institutions the commons depends on.

If you are working on attribution, especially building AI systems that practice it in some of the ways we describe here, CC would like to hear from you.

This article by Jack Hardinges and Irina Bejan (OpenMined) is licensed under CC BY 4.0. Thanks to Diyana Noory, Monica Granados, and Sarah Pearson at Creative Commons for their comments on a draft of this article.

Dịch: Lê Trung Nghĩa

letrungnghia.foss@gmail.com

Chủ Nhật, 9 tháng 8, 2026

‘Ghi nhận nguồn gốc & kết quả đầu ra của AI’ - bản dịch sang tiếng Việt

 

‘Ghi nhận nguồn gốc & kết quả đầu ra của AI’ - bản dịch sang tiếng Việt

Là bản dịch sang tiếng Việt tài liệu của Creative Commons, xuất bản tháng 3/2026, giấy phép CC BY 4.0.

Bản tóm tắt vấn đề này xem xét cách thức hoạt động của việc ghi nhận nguồn gốc trong bối cảnh Trí tuệ Nhân tạo (AI) — nơi các hệ thống tạo ra nội dung dựa trên lượng lớn dữ liệu hiện có — và tại sao việc ghi nhận nguồn gốc vẫn quan trọng, ngay cả khi việc thực hiện nó gặp khó khăn.

Tự do tải về bản dịch sang tiếng Việt của tài liệu có 7 trang tại địa chỉ: https://www.dropbox.com/scl/fi/zpx3yltqurqhfz3e1v7ty/Attribution-and-AI-Outputs-Issue-Brief-Mar-2026_Vi-31072026.pdf?rlkey=s4hhuyojauv68ekdvnj8undq2&st=qmfpettm&dl=0

Xem thêm:

Blogger: Lê Trung Nghĩa

letrungnghia.foss@gmail.com

Thứ Năm, 6 tháng 8, 2026

‘Nhiệm vụ khó khăn trong việc phân loại việc sử dụng Web của máy móc’ - bản dịch sang tiếng Việt

 

‘Nhiệm vụ khó khăn trong việc phân loại việc sử dụng Web của máy móc’ - bản dịch sang tiếng Việt

Là bản dịch sang tiếng Việt tài liệu của tác giả Jack Hardinges, Creative Commons xuất bản tháng 3/2026, giấy phép CC BY 4.0.

Giới thiệu

Trong ba mươi năm qua, con người đã sử dụng các chương trình tự động để điều hướng, truy cập và sử dụng nội dung web một cách có hệ thống, để thực hiện những việc như xây dựng chỉ mục tìm kiếm hoặc tạo kho lưu trữ. Mặc dù không hoàn toàn không gây tranh cãi, việc sử dụng này của máy móc được các chuẩn mực và tiêu chuẩn tương đối không chính thức điều chỉnh.

Giờ đây, máy móc (đôi khi được gọi là “bot” hoặc “trình thu thập dữ liệu” [crawlers]) đang được sử dụng để truy cập web nhằm đào tạo và hỗ trợ hoạt động của các mô hình AI lớn. Các máy móc như vậy hiện chiếm một tỷ lệ lớn lưu lượng truy cập web. Chúng tôi đã mô tả những tác động đáng kể về mặt kỹ thuật, kinh tế và văn hóa của sự thay đổi này trong tài liệu Từ Nội dung của Con người đến Dữ liệu của Máy móc (bản dịch sang tiếng Việt).

Trong thời đại mới này, việc đơn giản chỉ định nghĩa các hình thức sử dụng nội dung web khác nhau của máy móc hiện đang diễn ra—chứ chưa nói đến việc quản lý nó—đang chứng tỏ là một thách thức. Bản tóm tắt vấn đề này mô tả lý do tại sao cần có một vốn từ vựng chung cho việc sử dụng của máy móc nhưng lại khó đạt được, và nơi các định nghĩa hiện đang được tranh luận.”

Tự do tải về bản dịch sang tiếng Việt của tài liệu có 6 trang tại địa chỉ: https://www.dropbox.com/scl/fi/ky29au7er5yehdofzvnao/Categorizing-Machine-Use-Issue-Brief-Mar-2026_Vi-28062026.pdf

Xem thêm: 

Blogger: Lê Trung Nghĩa

letrungnghia.foss@gmail.com 

Thứ Tư, 5 tháng 8, 2026

‘Bản quyền và đào tạo trí tuệ nhân tạo tạo sinh’ - bản dịch sang tiếng Việt

 

‘Bản quyền và đào tạo trí tuệ nhân tạo tạo sinh’ - bản dịch sang tiếng Việt

Là bản dịch sang tiếng Việt tài liệu của các tác giả Diyana Noory & Derek Slater. Creative Commons xuất bản tháng 1/2026. Giấy phép CC BY 4.0.

Tóm tắt này giải thích cách thức hoạt động của quy trình đào tạo AI tạo sinh, lý do tại sao nó đặt ra các câu hỏi về bản quyền và các yếu tố mà tòa án và các nhà hoạch định chính sách đang xem xét.

Lưu ý: Tóm tắt này không đề cập đến các vấn đề bản quyền khác, chẳng hạn như suy luận và đầu ra của AI.

Tự do tải về bản dịch sang tiếng Việt của tài liệu có 6 trang tại địa chỉ: https://www.dropbox.com/scl/fi/ie8vvtx57bwzbsts2p3m9/Copyright-and-Generative-AI-Issue-Brief_Jan-2026_Vi-27062026.pdf

Xem thêm: 

Blogger: Lê Trung Nghĩa

letrungnghia.foss@gmail.com

Thứ Ba, 4 tháng 8, 2026

Tập huấn: “Xây dựng nguồn tài nguyên giáo dục mở” tại Đại học Trà Vinh, 04-05/08/2026

 

Tập huấn: “Xây dựng nguồn tài nguyên giáo dục mở” tại Đại học Trà Vinh, 04-05/08/2026

Nhằm nâng cao năng lực của đội ngũ viên chức và giảng viên trong việc xây dựng, quản lý, khai thác và chia sẻ nguồn tài nguyên giáo dục mở, góp phần thúc đẩy chuyển đổi số và phát triển học liệu số trong giáo dục, Đại học Trà Vinh tổ chức chương trình tập huấn với chuyên đề: Xây dựng nguồn tài nguyên giáo dục mở - OER (Open Educational Resources) trong các ngày 04 và 05/08/2026 cho các viên chức và giảng viên của nhà trường.

Tự do tải về bài trình chiếu trong tập huấn tại: https://zenodo.org/records/21544542

X(Tweet): https://x.com/nghiafoss/status/2084874151169593369

Xem thêm:

Blogger: Lê Trung Nghĩa

letrungnghia.foss@gmail.com

Thứ Hai, 3 tháng 8, 2026

‘Hệ thống trả phí để thu thập dữ liệu’ - bản dịch sang tiếng Việt

‘Hệ thống trả phí để thu thập dữ liệu’ - bản dịch sang tiếng Việt 

Là bản dịch sang tiếng Việt tài liệu của tác giả Jack Hardinges. Creative Commons xuất bản tháng 11/2025, giấy phép CC BY 4.0.

Hệ thống trả phí để thu thập dữ liệu (Pay-to-crawl) đề cập đến các hệ thống kỹ thuật mới nổi được các trang web sử dụng để tự động hóa việc bồi thường khi nội dung kỹ thuật số của họ — ví dụ như văn bản, hình ảnh và dữ liệu có cấu trúc — được máy móc truy cập.

Tự do tải về bản dịch sang tiếng Việt của tài liệu có 5 trang tại địa chỉ: https://www.dropbox.com/scl/fi/81b13qps6jz16xw6650ee/Pay-to-Crawl-Issue-Brief-Nov-2025_Vi-26062026.pdf

Xem thêm:

Blogger: Lê Trung Nghĩa

letrungnghia.foss@gmail.com

Chủ Nhật, 2 tháng 8, 2026

Từ Tín hiệu tới Hạ tầng: Tăng cường tài sản chung cho kỷ nguyên AI

Từ Tín hiệu tới Hạ tầng: Tăng cường tài sản chung cho kỷ nguyên AI

From Signals to Infrastructure: Strengthening the Commons for the AI Era

Posted 13 May 2026 by Anna Tumadóttir, Sarah Hinchliff Pearson

Theo: https://creativecommons.org/2026/05/13/from-signals-to-infrastructure-strengthening-the-commons-for-the-ai-era/

Bài được đưa lên Internet ngày: 13/05/2026

Gần đây chúng tôi đã chia sẻ một bản cập nhật về sự phát triển của các tín hiệu CC. Khi các hệ thống AI ngày càng khai thác giá trị từ tài sản chung (commons) mà không có sự đồng ý, ghi công hoặc minh bạch đầy đủ, việc duy trì một tài sản chung lành mạnh đòi hỏi quản trị và trách nhiệm giải trình mạnh mẽ hơn. Điều này phản ánh sự thay đổi trong cách tiếp cận của chúng tôi: từ việc bày tỏ sở thích sang việc cân bằng lại quyền lực để bảo vệ tài sản chung.

Trong bài đăng này, chúng tôi phác thảo kế hoạch của mình để xây dựng và tăng cường các tín hiệu CC nhằm hỗ trợ mục tiêu truy cập bền vững vào tri thức của con người. Chúng tôi chưa có tất cả các câu trả lời. Điều chúng tôi có là một khuôn khổ về cách chúng tôi sẽ nỗ lực hướng tới chúng.

Tóm tắt: Điều gì đang bị đe dọa

Khi nói đến AI, bản quyền hoạt động trong một bối cảnh không đồng đều và thường không rõ ràng. Vì lý do này, các giấy phép CC, mặc dù vẫn quan trọng, nhưng không đủ để giải quyết cách thức nội dung được sử dụng trong các hệ thống AI. Bạn có thể đọc thêm về điều này tại đây. Các giấy phép CC cũng không nắm bắt đầy đủ phạm vi ý định của người sáng tạo và người nắm giữ dữ liệu trong một thế giới được AI hỗ trợ.

Trên khắp mạng Internet, người sáng tạo, cộng đồng và các tổ chức đang chuyển sang nhiều hình thức bao vây phòng thủ để hạn chế quyền truy cập. Chúng bao gồm:

  • Về mặt pháp lý (ví dụ: cấp phép), chẳng hạn như các nhà xuất bản truy cập mở khuyến nghị sử dụng CC BY-NC-ND như một cơ chế kiểm soát, điều mà ACM hiện đang thực hiện, gây ảnh hưởng tiêu cực đến sự cộng tác của con người.

  • Về mặt kỹ thuật (ví dụ: CAPTCHA, chặn bot, giới hạn tốc độ), chẳng hạn như những gì các nhà xuất bản tin tức đang làm, gây ảnh hưởng tiêu cực đến các nỗ lực lưu trữ.

  • Về mặt tài chính (ví dụ: API có thu phí), chẳng hạn như những gì X đã làm sau sát nhập, gây ảnh hưởng tiêu cực đến các nhà nghiên cứu.

Vấn đề là các công cụ này coi tất cả việc sử dụng máy móc là như nhau, bất kể mục đích là gì. Trong nỗ lực hạn chế việc khai thác quy mô lớn từ các nhà phát triển AI, chúng cũng chặn các mục đích sử dụng vì lợi ích công cộng như nghiên cứu, bảo tồn và khả năng truy cập.

Trong khi nghiên cứu của chúng tôi vẫn đang tiếp diễn, đã có những dấu hiệu ban đầu về một không gian chung bị phân mảnh hơn và có khả năng thu hẹp lại, cùng với sự suy yếu của các biện pháp bảo vệ lợi ích công cộng lâu dài.

Xây dựng cơ sở hạ tầng chia sẻ thế hệ tiếp theo

Truy cập mở thông qua các giấy phép CC đã tạo ra một phổ chia sẻ. Ngày nay, chúng ta cần một điều tương tự cho AI: một phạm vi tham gia rộng lớn, nơi người sáng tạo và người quản lý dữ liệu là những người tham gia tích cực vào cách thức tri thức được tạo ra, chia sẻ và sử dụng.

Tài sản chung mà chúng ta đã xây dựng trong 25 năm qua không tự nhiên mà có. Nó được thiết kế thông qua các khuôn khổ pháp lý, tiêu chuẩn kỹ thuật và các chuẩn mực chung. Kỷ nguyên AI đòi hỏi thế hệ tiếp theo của cơ sở hạ tầng đó. Chúng ta muốn một tương lai nơi tài sản chung tri thức toàn cầu vẫn dễ tiếp cận và nơi các hệ thống AI tương tác với nó theo những cách minh bạch, có trách nhiệm và phù hợp với lợi ích công cộng.

Kế hoạch của chúng tôi

CC đang thúc đẩy một số biện pháp can thiệp có tác động cao như một phần của khung tín hiệu CC nhằm khôi phục niềm tin, tăng cường sự tham gia và lồng ghép các giá trị lợi ích công cộng vào hệ sinh thái tri thức AI.

  1. Giúp mọi người đưa ra quyết định sáng suốt trong thời điểm hiện tại

  2. Biến việc ghi công trở thành chuẩn mực trong AI

  3. Xây dựng công cụ mới bảo vệ việc sử dụng vì lợi ích công cộng đồng thời khôi phục quyền tự chủ

Giúp mọi người đưa ra quyết định sáng suốt trong thời điểm hiện tại

Các hệ thống AI đang sử dụng các tác phẩm được cấp phép CC theo những cách khiến nhiều người đặt câu hỏi liệu bộ giấy phép CC hiện tại có còn phù hợp với mục tiêu của họ hay không.

Những lo ngại này có nhiều hình thức khác nhau: việc ghi công biến mất bên trong các hệ thống AI, kiến thức nhạy cảm bị tước bỏ khỏi bối cảnh ban đầu, sự tập trung ngày càng tăng về giá trị và quyền lực, và không có cơ chế rõ ràng nào cho sự có đi có lại hoặc trách nhiệm giải trình. Nhưng chúng có chung một gốc rễ: sự không chắc chắn về ý nghĩa thực sự của các giấy phép CC trong môi trường mới này.

Chúng tôi muốn những người chọn cấp phép CC làm điều đó một cách tự tin. Chúng tôi cũng muốn các tổ chức lồng ghép việc cấp phép CC vào trong chính sách của họ có một bức tranh rõ ràng về những gì giấy phép bao gồm và không bao gồm khi nói đến AI. Trong sáu tháng tới, chúng tôi sẽ cung cấp hướng dẫn tạm thời dành riêng cho từng lĩnh vực để hỗ trợ các nhà cấp phép CC giải quyết những câu hỏi mới mà AI đặt ra cho họ. Hướng dẫn này không nhằm mục đích giải quyết mọi sự mơ hồ về mặt pháp lý. Thay vào đó, trong giai đoạn không chắc chắn này, chúng tôi muốn bảo tồn hoạt động chia sẻ mà AI hiện đang đặt ra rủi ro, đồng thời phát triển các công cụ và phương pháp mới để giải quyết những lo ngại của cộng đồng.

Chúng tôi sẽ tổ chức một loạt các sự kiện ảo dành riêng cho từng lĩnh vực để thu thập phản hồi về hướng dẫn tạm thời này. Hãy đăng ký nhận bản tin CC để biết thêm thông tin ngay khi nó có sẵn.

Biến việc ghi công trở thành chuẩn mực trong AI

Việc ghi công luôn là nền tảng của tài sản chung. Nó hỗ trợ sự tham gia, tạo điều kiện cho sự minh bạch và cho phép truy vết, đánh giá và xây dựng kiến thức.

Hệ sinh thái AI hiện nay đang làm xói mòn chuẩn mực này. Hầu hết các hệ thống tạo sinh không thực sự ghi nhận nguồn gốc mà chúng dựa vào. Khi AI ngày càng đóng vai trò trung gian trong việc tiếp cận kiến thức, điều này dẫn đến những hậu quả nghiêm trọng: mất nguồn gốc, giảm lòng tin và ít động lực chia sẻ hơn. Phiên bản đầu tiên của tín hiệu CC bao gồm việc ghi công như một tùy chọn; ngày nay chúng tôi tin rằng việc ghi công phải là một yêu cầu bắt buộc.

Kế hoạch của chúng tôi là định nghĩa các phương pháp tốt nhất để ghi công trong bối cảnh AI. Các nhà phát triển AI thường cho rằng việc ghi công đơn giản là không thể thực hiện được trong LLM. Nhưng đây là hậu quả của những lựa chọn được đưa ra trong quá trình thiết kế, chứ không phải là một điều tất yếu về mặt kỹ thuật. Chúng tôi tin rằng việc hình dung ra các phương pháp ghi công có thể trông như thế nào trong một hệ sinh thái AI đã ưu tiên chúng là rất có giá trị. Và mặc dù không thể quay ngược thời gian, chúng ta có thể yêu cầu ghi công ở những nơi mà về mặt kỹ thuật là khả thi trong các hệ thống hiện có, chẳng hạn như Tạo sinh Tăng cường Truy xuất - RAG (Retrieval Augmented Generation), một phương pháp trong đó các hệ thống AI lấy dữ liệu từ các nguồn cụ thể, có thể truy vết để tạo ra phản hồi.

Công việc của chúng tôi sẽ bao gồm việc trình bày chi tiết hướng dẫn ghi công lý tưởng cho các hệ thống AI, người dùng cuối và người tạo nội dung. Sau đó, chúng tôi sẽ chứng minh cách thức ghi công có thể được hiện thực hóa trong các mô hình RAG. Sáng kiến này phục vụ hai mục đích: xây dựng sự hiểu biết chung về những gì việc ghi công trong AI hiện có thể và không thể đạt được, và cung cấp cho người tạo nội dung và người dùng AI các công cụ để vận động cho việc ghi công như một kỳ vọng cơ bản. Tăng cường việc ghi công giúp đảm bảo rằng kiến thức có thể được lưu truyền rộng rãi mà không làm mất đi sự kết nối với những người và cộng đồng đã tạo ra nó.

CC đang tìm cách kết nối với các chuyên gia đang làm việc về các tiêu chuẩn ghi công và các nhà phát triển đang làm việc trên các hệ thống AI bảo tồn việc ghi công. Nếu đó là công việc của bạn, chúng tôi rất muốn được nghe ý kiến từ bạn.

Xây dựng công cụ mới bảo vệ việc sử dụng vì lợi ích công cộng đồng thời khôi phục quyền tự chủ

Chỉ riêng bản quyền không thể làm được điều này. Chúng tôi tin rằng việc duy trì một Internet lấy con người làm trung tâm đòi hỏi sự bảo vệ có ý nghĩa, được duy trì một cách tập thể. Mục tiêu của chúng tôi là hỗ trợ một hệ sinh thái cân bằng giữa tính mở và quyền tự chủ, giữa quyền truy cập và trách nhiệm giải trình.

Trước tiên, chúng tôi đang ủng hộ việc phát triển và sử dụng các tùy chọn từ chối AI được xác định phạm vi cẩn thận, vừa duy trì quyền tự chủ của người sáng tạo vừa bảo vệ các mục đích sử dụng vì lợi ích công cộng. Trong nỗ lực giải quyết nhu cầu này, chúng tôi đã đề xuất bổ sung vào từ vựng Tùy chọn AI của IETF (cơ quan thiết lập các tiêu chuẩn Internet cơ bản) nhằm giúp đạt được sự cân bằng phù hợp giữa quyền tự chủ của người sáng tạo và việc tái sử dụng vì lợi ích công cộng. Điều cần thiết là các công cụ từ chối và bất kỳ luật liên quan nào cũng phải bảo vệ các sử dụng vì lợi ích công cộng. Điều này bao gồm việc cho phép các tổ chức di sản văn hóa bảo tồn và phân tích nội dung, và hỗ trợ các tổ chức nghiên cứu và giáo dục phi lợi nhuận trong công việc của họ.

Thứ hai, chúng tôi đang nghiên cứu và phát triển một công cụ mới được thiết kế để cho phép truy cập có điều kiện vào các bộ sưu tập và tổng hợp được chia sẻ mở công khai. Nó sẽ cho phép người quản lý dữ liệu đặt ra các điều khoản để truy cập và sử dụng một bộ sưu tập hoặc tổng hợp nhằm bảo vệ tính bền vững của cơ sở hạ tầng kỹ thuật của họ. Những người quản lý này có thể bao gồm thư viện, kho lưu trữ, viện nghiên cứu, kho dữ liệu, dự án tri thức công cộng và các tổ chức di sản văn hóa. Những đơn vị tái sử dụng dữ liệu quy mô lớn, đòi hỏi nhiều tài nguyên, có thể phải tuân thủ nhiều điều kiện hơn, và việc sử dụng vì lợi ích công cộng sẽ bị loại trừ hoàn toàn.

Nếu không có các công cụ pháp lý thực tiễn để xác định các điều kiện phát triển AI, các bộ sưu tập chỉ còn lại những lựa chọn đơn giản: cho phép các nhà phát triển AI trích xuất dữ liệu không hạn chế, hoặc hạn chế hoàn toàn quyền truy cập. Cả hai lựa chọn đều không phản ánh mục tiêu của hầu hết những người quản lý tri thức. Nghiên cứu và phát triển này được thực hiện dựa trên sự tham vấn chặt chẽ với các thành viên cộng đồng và các bên liên quan, chẳng hạn như đối thoại với các chuyên gia trong bối cảnh châu Phi trong năm qua, cũng như những khám phá rộng hơn trong phong trào, chẳng hạn như phân tích này về việc chia sẻ di sản văn hóa của Quỹ Tương lai Mở (Open Future Foundation) và việc phát triển NOODL để cân bằng lại quyền lực cho các cộng đồng ngôn ngữ bị thiệt thòi.

Nhiều người muốn tiếp tục chia sẻ các bộ sưu tập của họ đồng thời đảm bảo rằng các nhà phát triển AI sử dụng chúng một cách có trách nhiệm bằng cách tôn trọng sự ghi công, đảm bảo tính minh bạch và đáp ứng các biện pháp bảo vệ khác phù hợp với sứ mệnh vì lợi ích công cộng của họ. Chúng tôi muốn xây dựng các công cụ để cho phép điều này theo những cách thức được tiêu chuẩn hóa và có thể thực thi về mặt pháp lý.

Điều gì sẽ xảy ra tiếp theo?

Việc khám phá các loại công cụ này đòi hỏi chúng ta phải nhìn xa hơn bản quyền, đây là một sự thay đổi mô hình thực sự đối với CC, và chúng tôi không xem nhẹ điều này. Chúng tôi tin rằng việc điều tra các rủi ro và lợi ích của các công cụ pháp lý hỗ trợ quyền truy cập có điều kiện là một phần thiết yếu của việc quản lý sức khỏe lâu dài của tài sản chung. Chúng ta cần bảo tồn quyền truy cập vào các nguồn tri thức quý giá đồng thời đảm bảo rằng các tổ chức và cộng đồng quản lý chúng vẫn là những người tham gia tích cực vào việc định hình hệ sinh thái AI.

Đây là tình hình hiện tại. Tháng này, chúng tôi sẽ tổ chức một hội thảo tại London để bắt đầu giải quyết các vấn đề về thiết kế và quản trị mà các công cụ mới đặt ra. Cuối năm nay, chúng tôi sẽ tìm kiếm những người áp dụng thí điểm để giúp chúng tôi thử nghiệm và tinh chỉnh phương pháp tiếp cận trong thực tế. Chúng tôi sẽ chia sẻ các bản cập nhật khi công việc này phát triển.

Chúng tôi có một kế hoạch rõ ràng, với các sáng kiến này sẽ bước vào giai đoạn thí điểm trong năm nay. Giống như nhiều tổ chức phi lợi nhuận khác, khả năng phát triển nhanh chóng của chúng tôi phụ thuộc trực tiếp vào nguồn lực hiện có. Sự hỗ trợ từ Hội Hạ tầng Mở (Open Infrastructure Circle) đã giúp chúng tôi đạt được những tiến bộ cho đến nay, và nhân dịp kỷ niệm 25 năm thành lập, chúng tôi đặt mục tiêu gây quỹ 5 triệu đô la để thúc đẩy thế hệ tiếp theo của tín hiệu CC. Nếu có thể, chúng tôi mời bạn ủng hộ công việc này.

Hãy cùng nhau xây dựng những gì mà tài sản chung cần trong tương lai.

We recently shared an update on the evolution of CC signals. As AI systems increasingly extract value from the commons without adequate consent, attribution, or transparency, sustaining a healthy commons requires stronger governance and accountability. This reflects a shift in our approach: from expressing preferences to rebalancing power to protect the commons.

In this post, we outline our plans to build upon and strengthen CC signals in order to support our goal of sustained access to human knowledge. We do not have all the answers yet. What we do have is a framework for how we will work toward them.

Recap: What’s At Stake

When it comes to AI, copyright operates in a landscape that is uneven and often unclear. Because of this, the CC licenses, while still important, are not sufficient to address how content is used in AI systems. You can read more on this here. CC licenses also do not fully capture the range of intentions creators and data holders have in an AI-mediated world.

Across the web, creators, communities, and institutions are turning to multiple forms of defensive enclosure to restrict access. These include:

  • Legal (e.g. licensing), such as open access publishers recommending CC BY-NC-ND as a mechanism of control, which ACM now does, which negatively impacts human collaboration.

  • Technical (e.g. CAPTCHAs, bot blocking, rate limiting), such as what news publishers are doing, which negatively impacts archiving efforts.

  • Financial (e.g. paywalled APIs), such as what X did post-acquisition, which negatively impacts researchers.

The problem is that these tools treat all machine use as the same, regardless of the purpose. In trying to limit large-scale extraction by AI developers, they also block public interest uses like research, preservation, and accessibility.

While our research is ongoing, there are early indications of a more fragmented and potentially shrinking commons, along with a weakening of long-standing public interest protections.

Building the Next Generation Infrastructure of Sharing

Open access through CC licenses created a spectrum of sharing. Today we need something similar for AI: a spectrum of participation, where creators and data-holding stewards are active participants in how knowledge is produced, shared, and used.

The commons we have built over the past 25 years did not emerge on its own. It was designed through legal frameworks, technical standards, and shared norms. The AI era requires the next generation of that infrastructure. We want a future where the global knowledge commons remains accessible, and where AI systems engage with it in ways that are transparent, accountable, and aligned with the public good.

Our Plans

CC is advancing several high-impact interventions as part of the CC signals framework to restore trust, strengthen participation, and embed public interest values into the AI knowledge ecosystem.

  1. Helping People Make Informed Decisions in the Current Moment

  2. Making Attribution the Norm in AI

  3. Building New Tooling that Protects Public Interest Uses while Restoring Agency

Helping People Make Informed Decisions in the Current Moment

AI systems are using CC-licensed works in ways that are causing many to question whether the existing CC license suite still aligns with their goals.

These concerns take different forms: attribution that disappears inside AI systems, sensitive knowledge stripped from its original context, growing concentrations of value and power, and no clear mechanisms for reciprocity or accountability. But they share a common root: uncertainty about what the CC licenses actually mean in this new environment.

We want people who choose to CC license to do so with confidence. We also want institutions with CC licensing embedded in their policies to have a clear picture of what the licenses do and do not cover when it comes to AI. Over the next six months, we will provide sector-specific interim guidance to support CC licensors in navigating the new questions that AI raises for them. This guidance is not intended to resolve all legal ambiguity. Instead, during this period of uncertainty, we want to preserve the practice of sharing that AI is currently putting at risk, while we develop new tools and practices that address our communities’ concerns.

We will be holding a series of sector-specific virtual events to collect feedback on this interim guidance. Sign up for the CC newsletter for more information as soon as it becomes available.

Making Attribution the Norm in AI

Attribution has always been a cornerstone of the commons. It supports participation, enables transparency, and allows knowledge to be traced, evaluated, and built upon.

Today’s AI ecosystem is eroding this norm. Most generative systems do not meaningfully acknowledge the sources they rely on. As AI increasingly mediates access to knowledge, this has serious consequences: loss of provenance, reduced trust, and fewer incentives to share. The first iteration of CC signals included attribution as a preference; today we believe that attribution must be a requirement.

Our plan is to define best practices for attribution in AI contexts. AI developers often claim that attribution is simply not possible in LLMs. But this is a consequence of choices made during design, not a technical inevitability. We believe there is value in envisioning what attribution practices could look like in an AI ecosystem that prioritized them. And while there is no going back in time, we can demand attribution where it is technically possible within existing systems, such as Retrieval Augmented Generation (RAG), a method where AI systems pull from specific, traceable sources to generate responses.

Our work will involve detailing ideal attribution guidance for AI systems, end users, and creators. We will then demonstrate how attribution can be realized in RAG models. This initiative serves two purposes: building shared understanding of what attribution in AI can and cannot currently achieve, and giving creators and AI users the tools to advocate for attribution as a baseline expectation. Strengthening attribution helps ensure that knowledge can circulate widely without losing connection to the people and communities who created it.

CC is looking to connect with experts working on attribution standards and developers working on AI systems that preserve attribution. If that describes your work, we would love to hear from you.

Building New Tooling that Protects Public Interest Uses While Restoring Agency

Copyright alone cannot do this work. We believe maintaining a human-centered internet requires meaningful guardrails, upheld collectively. Our goal is to support an ecosystem that balances openness with agency, and access with accountability.

First, we are advocating for the development and usage of carefully scoped AI opt-outs that simultaneously sustain creator agency while protecting public interest uses. In an effort to address this need, we proposed additions to the IETF (the body that sets foundational internet standards) AI Preferences vocabulary that would help strike the right balance between creator agency and public interest reuse. It is essential that opt-out tooling and any related legislation protect public interest uses. This includes enabling cultural heritage institutions to preserve and analyze content, and supporting not-for-profit research and educational organizations in their work.

Second, we are doing research and development for a new tool designed to enable conditional access to openly shared collections and compilations. It will allow data stewards to set terms for accessing and using a collection or compilation that protect the sustainability of their technical infrastructure. These stewards may include libraries, archives, research institutions, data repositories, public knowledge projects, and cultural heritage organizations. Resource-heavy bulk reusers of data may be subject to more conditions, and public interest uses would be excluded entirely.

Without practical legal tools to define conditions for AI development, collections are left with blunt options: allow unrestricted extraction by AI developers, or restrict access entirely. Neither option reflects the goals of most knowledge stewards. This research and development is informed by close consultation with community members and stakeholders, such as dialogue with practitioners in the African context this past year, as well as broader explorations in the movement, such as this analysis on sharing of cultural heritage by Open Future Foundation, and the development of NOODL to rebalance power for marginalized language communities.

Many want to continue sharing their collections while ensuring that AI developers use them responsibly by respecting attribution, ensuring transparency, and meeting other safeguards aligned with their public interest missions. We want to build tooling to enable this in standardized, legally enforceable ways.

What Happens Next

The exploration of these kinds of tools requires us to look beyond copyright alone, which is a real paradigm shift for CC, and not one we take lightly. We believe that investigating the risks and benefits of legal tools that support conditional access is an essential part of stewarding the long-term health of the commons. We need to preserve access to valuable knowledge resources while ensuring that the institutions and communities who steward them remain active participants in shaping the AI ecosystem.

Here is where things stand. This month, we are convening a workshop in London to begin working through the design and governance questions that new tooling raises. Later this year, we will be seeking pilot adopters to help us test and refine the approach in practice. We will share updates as this work develops.

We have a clear plan, with these initiatives entering pilot phases within the year. Like many nonprofits, our ability to accelerate depends directly on the resources we have available. Support from our Open Infrastructure Circle has made progress to date possible, and as we mark our 25th anniversary, we have set a goal to raise $5 million to advance the next iteration of CC signals. If you are able, we invite you to support this work.

Let’s collectively build what the commons needs next.

Dịch: Lê Trung Nghĩa

letrungnghia.foss@gmail.com