
From Signals
to Infrastructure: Strengthening the Commons for the AI Era
Posted 13 May 2026 by Anna
Tumadóttir, Sarah
Hinchliff Pearson
Theo:
https://creativecommons.org/2026/05/13/from-signals-to-infrastructure-strengthening-the-commons-for-the-ai-era/
Bài được đưa lên Internet ngày:
13/05/2026
Gần đây chúng tôi đã chia sẻ một bản
cập nhật về sự phát triển của các tín hiệu CC.
Khi các hệ thống AI ngày càng khai thác giá trị từ tài
sản chung (commons) mà không có sự đồng ý, ghi công hoặc
minh bạch đầy đủ, việc duy trì một tài sản chung lành
mạnh đòi hỏi quản trị và trách nhiệm giải trình mạnh
mẽ hơn. Điều này phản ánh sự thay đổi trong cách tiếp
cận của chúng tôi: từ việc bày tỏ sở thích sang việc
cân bằng lại quyền lực để bảo vệ tài sản chung.
Trong bài đăng này,
chúng tôi phác thảo kế hoạch của mình để xây dựng
và tăng cường các tín hiệu CC nhằm hỗ trợ mục tiêu
truy cập bền vững vào tri thức của con người. Chúng
tôi chưa có tất cả các câu trả lời. Điều chúng tôi
có là một khuôn khổ về cách chúng tôi sẽ nỗ lực
hướng tới chúng.
Tóm tắt: Điều gì đang bị đe dọa
Khi nói đến AI, bản quyền hoạt động
trong một bối cảnh không đồng đều và thường không
rõ ràng. Vì lý do này, các giấy phép CC, mặc dù vẫn
quan trọng, nhưng không đủ để giải quyết cách thức
nội dung được sử dụng trong các hệ thống AI. Bạn có
thể đọc thêm về điều này tại
đây. Các giấy phép CC cũng không nắm bắt đầy đủ
phạm vi ý định của người sáng tạo và người nắm
giữ dữ liệu trong một thế giới được AI hỗ trợ.
Trên khắp mạng Internet, người sáng tạo,
cộng đồng và các tổ chức đang chuyển sang nhiều hình
thức bao vây phòng thủ để hạn chế quyền truy cập.
Chúng bao gồm:
Về mặt pháp lý (ví dụ: cấp phép),
chẳng hạn như các nhà xuất bản truy cập mở khuyến
nghị sử dụng CC BY-NC-ND như một cơ chế kiểm soát,
điều mà ACM
hiện đang thực hiện, gây ảnh hưởng tiêu cực đến
sự cộng tác của con người.
Về mặt kỹ thuật (ví dụ: CAPTCHA,
chặn bot, giới hạn tốc độ), chẳng hạn như những gì
các nhà xuất bản tin tức đang làm, gây ảnh hưởng
tiêu cực đến các nỗ lực lưu trữ.
Về mặt tài chính (ví dụ: API có thu
phí), chẳng hạn như những
gì X đã làm sau sát nhập, gây ảnh hưởng tiêu cực
đến các nhà nghiên cứu.
Vấn đề là các công cụ này coi tất cả
việc sử dụng máy móc là như nhau, bất kể mục đích
là gì. Trong nỗ lực hạn chế việc khai thác quy mô lớn
từ các nhà phát triển AI, chúng cũng chặn các mục đích
sử dụng vì lợi ích công cộng như nghiên cứu, bảo tồn
và khả năng truy cập.
Trong khi nghiên cứu của chúng tôi vẫn
đang tiếp diễn, đã có những dấu hiệu ban đầu về
một không gian chung bị phân mảnh hơn và có khả năng
thu hẹp lại, cùng với sự suy yếu của các biện pháp
bảo vệ lợi ích công cộng lâu dài.
Xây dựng cơ sở hạ tầng chia sẻ thế
hệ tiếp theo
Truy cập mở thông qua các giấy phép CC đã
tạo ra một phổ chia sẻ. Ngày nay, chúng ta cần một điều
tương tự cho AI: một phạm vi tham gia rộng lớn, nơi
người sáng tạo và người quản lý dữ liệu là những
người tham gia tích cực vào cách thức tri thức được
tạo ra, chia sẻ và sử dụng.
Tài sản chung mà chúng ta đã xây dựng
trong 25 năm qua không tự nhiên mà có. Nó được thiết kế
thông qua các khuôn khổ pháp lý, tiêu chuẩn kỹ thuật và
các chuẩn mực chung. Kỷ nguyên AI đòi hỏi thế hệ tiếp
theo của cơ sở hạ tầng đó. Chúng ta muốn một tương
lai nơi tài sản chung tri thức toàn cầu vẫn dễ tiếp
cận và nơi các hệ thống AI tương tác với nó theo những
cách minh bạch, có trách nhiệm và phù hợp với lợi ích
công cộng.
Kế hoạch của chúng tôi
CC đang thúc đẩy một số biện pháp can
thiệp có tác động cao như một phần của khung tín hiệu
CC nhằm khôi phục niềm tin, tăng cường sự tham gia và
lồng ghép các giá trị lợi ích công cộng vào hệ sinh
thái tri thức AI.
Giúp mọi người đưa ra quyết định
sáng suốt trong thời điểm hiện tại
Biến việc ghi công trở thành chuẩn
mực trong AI
Xây dựng công cụ mới bảo vệ việc
sử dụng vì lợi ích công cộng đồng thời khôi phục
quyền tự chủ
Giúp mọi người đưa ra quyết định
sáng suốt trong thời điểm hiện tại
Các hệ thống AI đang sử dụng các tác
phẩm được cấp phép CC theo những cách khiến nhiều
người đặt câu hỏi liệu bộ giấy phép CC hiện tại
có còn phù hợp với mục tiêu của họ hay không.
Những lo ngại này có nhiều hình thức
khác nhau: việc ghi công biến mất bên trong các hệ thống
AI, kiến thức nhạy cảm bị tước bỏ khỏi bối cảnh
ban đầu, sự tập trung ngày càng tăng về giá trị và
quyền lực, và không có cơ chế rõ ràng nào cho sự có
đi có lại hoặc trách nhiệm giải trình. Nhưng chúng có
chung một gốc rễ: sự không chắc chắn về ý nghĩa thực
sự của các giấy phép CC trong môi trường mới này.
Chúng tôi muốn những người chọn cấp
phép CC làm điều đó một cách tự tin. Chúng tôi cũng
muốn các tổ chức lồng ghép việc cấp phép CC vào trong
chính sách của họ có một bức tranh rõ ràng về những
gì giấy phép bao gồm và không bao gồm khi nói đến AI.
Trong sáu tháng tới, chúng tôi sẽ
cung cấp hướng dẫn tạm thời dành riêng cho từng lĩnh
vực để hỗ trợ các nhà cấp phép CC giải quyết những
câu hỏi mới mà AI đặt ra cho họ. Hướng dẫn
này không nhằm mục đích giải quyết mọi sự mơ hồ về
mặt pháp lý. Thay vào đó, trong giai đoạn không chắc
chắn này, chúng tôi muốn bảo tồn hoạt động chia sẻ
mà AI hiện đang đặt ra rủi ro, đồng thời phát triển
các công cụ và phương pháp mới để giải quyết những
lo ngại của cộng đồng.
Chúng tôi sẽ tổ chức một loạt các
sự kiện ảo dành riêng cho từng lĩnh vực để thu thập
phản hồi về hướng dẫn tạm thời này. Hãy
đăng ký nhận bản tin CC để biết thêm thông tin ngay
khi nó có sẵn.
Biến việc ghi công trở thành chuẩn
mực trong AI
Việc ghi công luôn là nền tảng của tài
sản chung. Nó hỗ trợ sự tham gia, tạo điều kiện cho
sự minh bạch và cho phép truy vết, đánh giá và xây dựng
kiến thức.
Hệ sinh thái AI hiện nay đang làm xói mòn
chuẩn mực này. Hầu hết các hệ thống tạo sinh không
thực sự ghi nhận nguồn gốc mà chúng dựa vào. Khi
AI ngày càng đóng vai trò trung gian trong việc tiếp cận
kiến thức, điều này dẫn đến những hậu quả nghiêm
trọng: mất nguồn gốc, giảm lòng tin và ít động lực
chia sẻ hơn. Phiên bản đầu tiên
của tín hiệu CC bao gồm việc ghi công như một tùy chọn;
ngày nay chúng tôi tin rằng việc ghi công phải là một
yêu cầu bắt buộc.
Kế hoạch của chúng
tôi là định nghĩa các phương pháp tốt nhất để ghi
công trong bối cảnh AI. Các nhà phát triển AI
thường cho rằng việc ghi công đơn giản là không thể
thực hiện được trong LLM. Nhưng đây là hậu quả của
những lựa chọn được đưa ra trong quá trình thiết kế,
chứ không phải là một điều tất yếu về mặt kỹ
thuật. Chúng tôi tin rằng việc hình dung ra các phương
pháp ghi công có thể trông như thế nào trong một hệ
sinh thái AI đã ưu tiên chúng là rất có giá trị. Và
mặc dù không thể quay ngược thời gian, chúng ta có thể
yêu cầu ghi công ở những nơi mà về mặt kỹ thuật là
khả thi trong các hệ thống hiện có, chẳng hạn như Tạo
sinh Tăng cường Truy xuất - RAG (Retrieval Augmented
Generation), một phương pháp trong đó các hệ thống AI lấy
dữ liệu từ các nguồn cụ thể, có thể truy vết để
tạo ra phản hồi.
Công việc của chúng tôi sẽ bao gồm việc
trình bày chi tiết hướng dẫn ghi công lý tưởng cho các
hệ thống AI, người dùng cuối và người tạo nội dung.
Sau đó, chúng tôi sẽ chứng minh cách thức ghi công có
thể được hiện thực hóa trong các mô hình RAG. Sáng
kiến này phục vụ hai mục đích: xây dựng sự hiểu
biết chung về những gì việc ghi công trong AI hiện có
thể và không thể đạt được, và cung cấp cho người
tạo nội dung và người dùng AI các công cụ để vận
động cho việc ghi công như một kỳ vọng cơ bản. Tăng
cường việc ghi công giúp đảm bảo rằng kiến thức có
thể được lưu truyền rộng rãi mà không làm mất đi sự
kết nối với những người và cộng đồng đã tạo ra
nó.
CC đang tìm cách kết nối với các
chuyên gia đang làm việc về các tiêu chuẩn ghi công và
các nhà phát triển đang làm việc trên các hệ thống AI
bảo tồn việc ghi công. Nếu
đó là công việc của bạn, chúng tôi rất muốn được
nghe ý kiến từ bạn.
Xây dựng công cụ mới bảo vệ việc
sử dụng vì lợi ích công cộng đồng thời khôi phục
quyền tự chủ
Chỉ riêng bản quyền không thể làm được
điều này. Chúng tôi tin rằng việc duy trì một Internet
lấy con người làm trung tâm đòi hỏi sự bảo vệ có ý
nghĩa, được duy trì một cách tập thể. Mục tiêu của
chúng tôi là hỗ trợ một hệ sinh thái cân bằng giữa
tính mở và quyền tự chủ, giữa quyền truy cập và
trách nhiệm giải trình.
Trước tiên, chúng tôi đang ủng
hộ việc phát triển và sử dụng các tùy chọn từ
chối AI được xác định phạm vi cẩn thận, vừa duy trì
quyền tự chủ của người sáng tạo vừa bảo vệ các
mục đích sử dụng vì lợi ích công cộng. Trong nỗ
lực giải quyết nhu cầu này, chúng
tôi đã đề xuất bổ sung vào từ vựng Tùy chọn AI của
IETF (cơ quan thiết lập các tiêu chuẩn Internet cơ bản)
nhằm giúp đạt được sự cân bằng phù hợp giữa quyền
tự chủ của người sáng tạo và việc tái sử dụng vì
lợi ích công cộng. Điều cần thiết
là các công cụ từ chối và bất kỳ luật liên quan nào
cũng phải bảo vệ các sử dụng vì lợi ích công cộng.
Điều này bao gồm việc cho phép các tổ
chức di sản văn hóa bảo tồn và phân tích nội dung, và
hỗ trợ các tổ chức nghiên cứu và giáo dục phi lợi
nhuận trong công việc của họ.
Thứ hai, chúng tôi
đang nghiên cứu và phát triển một công cụ mới được
thiết kế để cho phép truy cập có điều kiện vào các
bộ sưu tập và tổng hợp được chia sẻ mở công khai.
Nó sẽ cho phép người quản lý dữ
liệu đặt ra các điều khoản để truy cập và sử dụng
một bộ sưu tập hoặc tổng hợp nhằm bảo vệ tính bền
vững của cơ sở hạ tầng kỹ thuật của họ.
Những người quản lý này có thể bao
gồm thư viện, kho lưu trữ, viện nghiên cứu, kho dữ
liệu, dự án tri thức công cộng và các tổ chức di sản
văn hóa. Những đơn vị tái sử
dụng dữ liệu quy mô lớn, đòi hỏi nhiều tài nguyên,
có thể phải tuân thủ nhiều điều kiện hơn, và việc
sử dụng vì lợi ích công cộng sẽ bị loại trừ hoàn
toàn.
Nếu không có các công
cụ pháp lý thực tiễn để xác định các điều kiện
phát triển AI, các bộ sưu tập chỉ còn lại những lựa
chọn đơn giản: cho phép các nhà phát triển AI trích xuất
dữ liệu không hạn chế, hoặc hạn chế hoàn toàn quyền
truy cập. Cả hai lựa chọn đều
không phản ánh mục tiêu của hầu hết những người
quản lý tri thức. Nghiên cứu và phát triển này
được thực hiện dựa trên sự tham vấn chặt chẽ với
các thành viên cộng đồng và các bên liên quan, chẳng
hạn như đối
thoại với các chuyên gia trong bối cảnh châu Phi trong
năm qua, cũng như những khám phá rộng hơn trong phong trào,
chẳng hạn như phân
tích này về việc chia sẻ di sản văn hóa của Quỹ
Tương lai Mở (Open Future Foundation) và việc phát triển
NOODL để cân
bằng lại quyền lực cho các cộng đồng ngôn ngữ bị
thiệt thòi.
Nhiều người muốn tiếp tục chia sẻ các
bộ sưu tập của họ đồng thời đảm bảo rằng các
nhà phát triển AI sử dụng chúng một cách có trách nhiệm
bằng cách tôn trọng sự ghi công, đảm bảo tính minh
bạch và đáp ứng các biện pháp bảo vệ khác phù hợp
với sứ mệnh vì lợi ích công cộng của họ. Chúng tôi
muốn xây dựng các công cụ để cho phép điều này theo
những cách thức được tiêu chuẩn hóa và có thể thực
thi về mặt pháp lý.
Điều gì sẽ xảy ra tiếp theo?
Việc khám phá các loại công cụ này đòi
hỏi chúng ta phải nhìn xa hơn bản quyền, đây là một
sự thay đổi mô hình thực sự đối với CC, và chúng
tôi không xem nhẹ điều này. Chúng tôi tin rằng việc
điều tra các rủi ro và lợi ích của các công cụ pháp
lý hỗ trợ quyền truy cập có điều kiện là một phần
thiết yếu của việc quản lý sức khỏe lâu dài của
tài sản chung. Chúng ta cần bảo tồn quyền truy cập vào
các nguồn tri thức quý giá đồng thời đảm bảo rằng
các tổ chức và cộng đồng quản lý chúng vẫn là những
người tham gia tích cực vào việc định hình hệ sinh
thái AI.
Đây là tình hình hiện tại. Tháng này,
chúng tôi sẽ tổ chức một hội thảo tại London để
bắt đầu giải quyết các vấn đề về thiết kế và
quản trị mà các công cụ mới đặt ra. Cuối năm nay,
chúng tôi sẽ tìm kiếm những người áp dụng thí điểm
để giúp chúng tôi thử nghiệm và tinh chỉnh phương pháp
tiếp cận trong thực tế. Chúng tôi sẽ chia sẻ các bản
cập nhật khi công việc này phát triển.
Chúng tôi có một kế hoạch rõ ràng, với
các sáng kiến này sẽ bước vào giai đoạn thí điểm
trong năm nay. Giống như nhiều tổ chức phi lợi nhuận
khác, khả năng phát triển nhanh chóng của chúng tôi phụ
thuộc trực tiếp vào nguồn lực hiện có. Sự hỗ trợ
từ Hội Hạ tầng Mở (Open
Infrastructure Circle) đã giúp chúng tôi đạt được
những tiến bộ cho đến nay, và nhân dịp kỷ
niệm 25 năm thành lập, chúng tôi đặt mục tiêu gây
quỹ 5 triệu đô la để thúc đẩy thế hệ tiếp theo của
tín hiệu CC. Nếu có thể, chúng
tôi mời bạn ủng hộ công việc này.
Hãy cùng nhau xây
dựng những gì mà tài sản chung cần trong tương lai.
We
recently shared an update
on
the evolution of CC signals. As AI systems increasingly extract value
from the commons without adequate consent, attribution, or
transparency, sustaining a healthy commons requires stronger
governance and accountability. This reflects a shift in our approach:
from expressing preferences to rebalancing power to protect the
commons.
In this post, we
outline our plans to build upon and strengthen CC signals in order to
support our goal of sustained access to human knowledge. We do not
have all the answers yet. What we do have is a framework for how we
will work toward them.
Recap: What’s
At Stake
When it comes to
AI, copyright operates in a landscape that is uneven and often
unclear. Because of this, the CC licenses, while still important, are
not sufficient to address how content is used in AI systems. You can
read more on this here.
CC licenses also do not fully capture the range of intentions
creators and data holders have in an AI-mediated world.
Across the web,
creators, communities, and institutions are turning to multiple forms
of defensive enclosure to restrict access. These include:
Legal
(e.g. licensing), such as open access publishers recommending CC
BY-NC-ND as a mechanism of control, which
ACM now does, which negatively impacts human collaboration.
Technical
(e.g. CAPTCHAs, bot blocking, rate limiting), such
as what news publishers are doing, which negatively impacts
archiving efforts.
Financial
(e.g. paywalled APIs), such as what
X did post-acquisition, which negatively impacts researchers.
The problem is
that these tools treat all machine use as the same, regardless of the
purpose. In trying to limit large-scale extraction by AI developers,
they also block public interest uses like research, preservation, and
accessibility.
While our
research is ongoing, there are early indications of a more fragmented
and potentially shrinking commons, along with a weakening of
long-standing public interest protections.
Building the
Next Generation Infrastructure of Sharing
Open access
through CC licenses created a spectrum of sharing. Today we need
something similar for AI: a spectrum of participation, where creators
and data-holding stewards are active participants in how knowledge is
produced, shared, and used.
The commons we
have built over the past 25 years did not emerge on its own. It was
designed through legal frameworks, technical standards, and shared
norms. The AI era requires the next generation of that
infrastructure. We want a future where the global knowledge commons
remains accessible, and where AI systems engage with it in ways that
are transparent, accountable, and aligned with the public good.
Our Plans
CC is advancing
several high-impact interventions as part of the CC signals framework
to restore trust, strengthen participation, and embed public interest
values into the AI knowledge ecosystem.
Helping
People Make Informed Decisions in the Current Moment
Making
Attribution the Norm in AI
Building
New Tooling that Protects Public Interest Uses while Restoring
Agency
Helping
People Make Informed Decisions in the Current Moment
AI systems are
using CC-licensed works in ways that are causing many to question
whether the existing CC license suite still aligns with their goals.
These concerns
take different forms: attribution that disappears inside AI systems,
sensitive knowledge stripped from its original context, growing
concentrations of value and power, and no clear mechanisms for
reciprocity or accountability. But they share a common root:
uncertainty about what the CC licenses actually mean in this new
environment.
We
want people who choose to CC license to do so with confidence. We
also want institutions with CC licensing embedded in their policies
to have a clear picture of what the licenses do and do not cover when
it comes to AI. Over
the next six months, we will provide sector-specific interim guidance
to support CC licensors in navigating the new questions that AI
raises for them. This
guidance is not intended to resolve all legal ambiguity. Instead,
during this period of uncertainty, we want to preserve the practice
of sharing that AI is currently putting at risk, while we develop new
tools and practices that address our communities’ concerns.
We
will be holding a series of sector-specific virtual events to collect
feedback on this interim guidance. Sign
up for the CC newsletter
for
more information as soon as it becomes available.
Making
Attribution the Norm in AI
Attribution has
always been a cornerstone of the commons. It supports participation,
enables transparency, and allows knowledge to be traced, evaluated,
and built upon.
Today’s AI
ecosystem is eroding this norm. Most generative systems do not
meaningfully acknowledge the sources they rely on. As AI increasingly
mediates access to knowledge, this has serious consequences: loss of
provenance, reduced trust, and fewer incentives to share. The first
iteration of CC signals included attribution as a preference; today
we believe that attribution must be a requirement.
Our plan is
to define best practices for attribution in AI contexts.
AI developers often claim that attribution is simply not possible in
LLMs. But this is a consequence of choices made during design, not a
technical inevitability. We believe there is value in envisioning
what attribution practices could look like in an AI ecosystem that
prioritized them. And while there is no going back in time, we can
demand attribution where it is technically possible within existing
systems, such as Retrieval Augmented Generation (RAG), a method where
AI systems pull from specific, traceable sources to generate
responses.
Our work will
involve detailing ideal attribution guidance for AI systems, end
users, and creators. We will then demonstrate how attribution can be
realized in RAG models. This initiative serves two purposes: building
shared understanding of what attribution in AI can and cannot
currently achieve, and giving creators and AI users the tools to
advocate for attribution as a baseline expectation. Strengthening
attribution helps ensure that knowledge can circulate widely without
losing connection to the people and communities who created it.
CC
is looking to connect with experts working on attribution standards
and developers working on AI systems that preserve attribution. If
that describes your work, we would love to hear from you.
Building New
Tooling that Protects Public Interest Uses While Restoring Agency
Copyright alone
cannot do this work. We believe maintaining a human-centered internet
requires meaningful guardrails, upheld collectively. Our goal is to
support an ecosystem that balances openness with agency, and access
with accountability.
First, we are
advocating
for the development and
usage of carefully scoped AI opt-outs that simultaneously sustain
creator agency while protecting public interest uses.
In
an effort to address this need, we
proposed additions to the IETF (the body that sets foundational
internet standards) AI Preferences vocabulary
that
would help strike the right balance between creator agency and public
interest reuse. It is essential that opt-out tooling and any related
legislation protect public interest uses. This includes enabling
cultural heritage institutions to preserve and analyze content, and
supporting not-for-profit research and educational organizations in
their work.
Second, we
are doing research and development for a new tool designed to enable
conditional access to openly shared collections and compilations. It
will allow data stewards to set terms for accessing and using a
collection or compilation that protect the sustainability of their
technical infrastructure. These stewards may include libraries,
archives, research institutions, data repositories, public knowledge
projects, and cultural heritage organizations. Resource-heavy bulk
reusers of data may be subject to more conditions, and public
interest uses would be excluded entirely.
Without
practical legal tools to define conditions for AI development,
collections are left with blunt options: allow unrestricted
extraction by AI developers, or restrict access entirely. Neither
option reflects the goals of most knowledge stewards. This research
and development is informed by close consultation with community
members and stakeholders, such as dialogue
with practitioners in the African context
this
past year, as well as broader explorations in the movement, such as
this
analysis on sharing of cultural heritage by Open Future
Foundation, and the development of NOODL
to
rebalance power for marginalized language communities.
Many want to
continue sharing their collections while ensuring that AI developers
use them responsibly by respecting attribution, ensuring
transparency, and meeting other safeguards aligned with their public
interest missions. We want to build tooling to enable this in
standardized, legally enforceable ways.
What Happens
Next
The exploration
of these kinds of tools requires us to look beyond copyright alone,
which is a real paradigm shift for CC, and not one we take lightly.
We believe that investigating the risks and benefits of legal tools
that support conditional access is an essential part of stewarding
the long-term health of the commons. We need to preserve access to
valuable knowledge resources while ensuring that the institutions and
communities who steward them remain active participants in shaping
the AI ecosystem.
Here is where
things stand. This month, we are convening a workshop in London to
begin working through the design and governance questions that new
tooling raises. Later this year, we will be seeking pilot adopters to
help us test and refine the approach in practice. We will share
updates as this work develops.
We
have a clear plan, with these initiatives entering pilot phases
within the year. Like many nonprofits, our ability to accelerate
depends directly on the resources we have available. Support from our
Open
Infrastructure Circle
has
made progress to date possible, and as we mark our 25th
anniversary, we have set a goal to raise $5 million to advance
the next iteration of CC signals. If you are able, we
invite you to support this work.
Let’s
collectively build what the commons needs next.
Dịch: Lê Trung Nghĩa
letrungnghia.foss@gmail.com