vivo互联网技术

开源V话:S1 OSPO 与开源 | x08 当开源遇上 AI

【开源V话】旨在以图文并茂的方式通俗易懂地传播开源文化及相关知识,分享开源实践及洞见,成为开源文化及开源生态发展的参与者、贡献者和布道者。

欢迎来到第一季“OSPO 与开源”,共8期,本文是S1x08期。


Image

AI 时代的开源治理新挑战。

第一季终章:当开源遇上 AI。
Image

OSPO 的职责正在极速膨胀。

现在的挑战不仅仅是代码许可证,还有:

训练数据是否开源?

模型权重是否开放?

AI 生成的代码归谁所有?

未来的 OSPO,

将是 AI Governance 的核心力量。 

准备好迎接新时代了吗?

S1x08 当开源遇上 AI

(The Future: AI & OSPO)

随着 GenAI(生成式人工智能)的爆发,OSPO 正在进入无人区。开源的概念正在从单纯的“源码(Source Code)”扩展到“数据(Data)”和“模型(Model)”。

OSPO 面临的新三大挑战:

  1. 许可证的模糊性:传统的 OSI 开源定义(OSD)并不完全适用于 AI 模型。Meta 的 LLaMA 等所谓的“开源”模型,实际上限制了商业用途。OSPO 需要重新界定“什么是开源 AI”。

  2. 代码生成的合规风险:当工程师使用 GitHub Copilot 或 ChatGPT 生成代码时,这些代码可能无意中侵犯了开源许可证(如复制了 GPL 代码片段)。OSPO 需要制定 AI 辅助编程的使用规范。

  3.  数据透明度:AI 模型的安全性取决于训练数据。未来的 SBOM 将演变为 AIBOM (AI Bill of Materials),不仅包含组件,还要包含数据集来源、标注方法和模型权重信息。

未来的 OSPO,将是企业 AI Governance(AI 治理)的核心参与者。

🔗参考资料与扩展阅读:

vivo开源实践与思考

  • 重新认识AI开源: 随着OSI正式定义“开源AI”,AI模型(结构与参数)与软件代码的差异越发明确,前者往往不受传统开源协议的直接约束。实践中需明确区分模型与代码,避免将代码规则错误适用于模型本身。

  • 合规前置: AI时代,代码本身的合规无法涵盖训练数据,训练数据来源合法成为新的刚需。需建立来源追溯与分类管理体系,在面对争议时能有效保护自身。

  • AI生成代码的反向传染:AI编程可能生成侵权的代码片段。OSPO需做好风险识别和隔离,防止GPL等Copyleft协议的代码通过AI工具隐性“传染”。

  vivo开源 

说明:
  • 本文在创作中使用 AI 工具作为辅助
  • 本系列内容采用 CC BY-SA 4.0 许可发布

第一季 OSPO 与开源 

  1. S1 OSPO 与开源 | x01 OSPO概述

  2. S1 OSPO 与开源 | x02 为什么你需要它?

  3. S1 OSPO 与开源 | x03 OSPO 应该在哪儿?

  4. S1 OSPO 与开源 | x04 组建你的“复仇者联盟”

  5. S1 OSPO 与开源 | x05 那层看不见的盾

  6. S1 OSPO 与开源 | x06 从索取到贡献

  7. S1 OSPO 与开源 | x07 如何证明你做得好?