开源V话:S1 OSPO 与开源 | x08 当开源遇上 AI
【开源V话】旨在以图文并茂的方式通俗易懂地传播开源文化及相关知识,分享开源实践及洞见,成为开源文化及开源生态发展的参与者、贡献者和布道者。
欢迎来到第一季“OSPO 与开源”,共8期,本文是S1x08期。
AI 时代的开源治理新挑战。
第一季终章:当开源遇上 AI。OSPO 的职责正在极速膨胀。
训练数据是否开源?
模型权重是否开放?
AI 生成的代码归谁所有?
未来的 OSPO,
将是 AI Governance 的核心力量。
准备好迎接新时代了吗?
S1x08 当开源遇上 AI
(The Future: AI & OSPO)
随着 GenAI(生成式人工智能)的爆发,OSPO 正在进入无人区。开源的概念正在从单纯的“源码(Source Code)”扩展到“数据(Data)”和“模型(Model)”。
OSPO 面临的新三大挑战:
许可证的模糊性:传统的 OSI 开源定义(OSD)并不完全适用于 AI 模型。Meta 的 LLaMA 等所谓的“开源”模型,实际上限制了商业用途。OSPO 需要重新界定“什么是开源 AI”。
代码生成的合规风险:当工程师使用 GitHub Copilot 或 ChatGPT 生成代码时,这些代码可能无意中侵犯了开源许可证(如复制了 GPL 代码片段)。OSPO 需要制定 AI 辅助编程的使用规范。
数据透明度:AI 模型的安全性取决于训练数据。未来的 SBOM 将演变为 AIBOM (AI Bill of Materials),不仅包含组件,还要包含数据集来源、标注方法和模型权重信息。
未来的 OSPO,将是企业 AI Governance(AI 治理)的核心参与者。
🔗参考资料与扩展阅读:
OSI (Open Source Initiative) 发布 开源AI 定义:Open Source AI Definition。
Hugging Face: AI 模型的开源社区与许可证实践:https://huggingface.co/
vivo开源实践与思考
重新认识AI开源: 随着OSI正式定义“开源AI”,AI模型(结构与参数)与软件代码的差异越发明确,前者往往不受传统开源协议的直接约束。实践中需明确区分模型与代码,避免将代码规则错误适用于模型本身。
合规前置: AI时代,代码本身的合规无法涵盖训练数据,训练数据来源合法成为新的刚需。需建立来源追溯与分类管理体系,在面对争议时能有效保护自身。
AI生成代码的反向传染:AI编程可能生成侵权的代码片段。OSPO需做好风险识别和隔离,防止GPL等Copyleft协议的代码通过AI工具隐性“传染”。
vivo开源
本文在创作中使用 AI 工具作为辅助 本系列内容采用 CC BY-SA 4.0 许可发布
第一季 OSPO 与开源