来源 :开普云2026-09-18
近日,在中央网信办指导下,中文互联网基础语料4.0在2026年国家网络安全宣传周人工智能安全治理分论坛上正式发布。开普云作为共建单位参与其中,公司副总裁王瑛与中国网络空间安全协会、国家计算机网络与信息安全管理中心,以及百度、科大讯飞等企业代表共同见证发布。
2026年国家网络安全宣传周人工智能安全治理分论坛上发布中文互联网基础语料4.0,开普云副总裁王瑛(右二)见证发布
开普云长期参与高质量中文语料共建。自2023年参与首批开放资源建设以来,公司持续贡献高质量可信数据,累计已超过1T,为中文大模型训练和人工智能安全可信发展提供数据支撑。
AI走进真实场景
高质量数据成为可信基础
从大模型训练到智能体应用,人工智能正在加快进入真实业务场景。随着AI不断深入业务流程,数据来源是否可信、内容是否准确合规,越来越直接影响模型的理解、判断和应用表现。高质量数据正成为提升模型能力、推动AI安全可信落地的重要基础。
在中央网信办指导下,中国网络空间安全协会会同开普云等单位,依托网安协会人工智能安全治理专委会建立的语料共建共享机制,持续推进中文互联网基础语料建设。从1.0到4.0,开普云持续参与共建并提供高质量可信数据。此次发布的4.0汇聚一批新的高质量可信数据,经过严格的数据加工处理形成,数据量120GB,为大模型训练和人工智能发展提供可信数据支撑。
从高质量语料
到可信AI安全能力持续延伸
依托长期积累的数据资源和治理能力,开普云将相关语料及数据治理经验应用于开悟系列大模型的训练与优化,为模型在价值观对齐、意识形态风险防范和内容合规等方面的能力建设提供支撑。
随着AI从内容生成、知识问答进一步走向业务流程和任务执行,安全治理也从源头数据不断延伸至模型、智能体和应用全过程。高质量可信数据是起点,模型安全、行为可控和应用安全则共同构成AI规模化落地的重要保障。
从持续参与高质量中文语料共建,到推进模型安全、智能体治理和高安全AI应用,开普云正不断完善覆盖数据、模型与应用的可信AI能力,为人工智能安全、可靠地走进真实业务场景提供支撑。