跳至正文

中国生成式AI安全评估平台报告白皮书

我国生成式 AI 安全评估,是面向具有舆论属性或社会动员能力的生成式人工智能服务的法定合规制度,服务上线、重大版本更新前必须完成安全评估,再履行算法备案 / 大模型备案中国政府网。核心法规为《生成式人工智能服务管理暂行办法》,技术标准以GB/T 45654‑2025《网络安全技术 生成式人工智能服务安全基本要求》为核心标尺,覆盖数据、模型、运营全生命周期风险检测评估腾讯云。

ai

一、法规与标准体系

法律法规

  1. 《生成式人工智能服务管理暂行办法》:明确具有舆论 / 社会动员能力的生成式 AI 服务,必须开展安全评估、算法备案;模型重大迭代升级需要重新评估中央网络安...。
  2. 《具有舆论属性或者社会动员能力的互联网信息服务安全评估规定》:安全评估通用程序、报告要求。
  3. 《互联网信息服务深度合成管理规定》:图片、音视频生成类生成式 AI 的专项治理要求中国政府网。

核心国家标准

  • GB/T 45654‑2025(2025‑11‑01 实施):国内首个生成式 AI 服务安全国标,定义三大评估域,附录列出31 类典型风险场景,给出可落地测试方法,是第三方评估、官方核验的技术依据。
  • 《人工智能安全治理框架 2.0》:从治理层面提出全链条安全管控,包含后门检测、熔断机制、生成内容溯源标识、开源模型风险传导评估等要求中央网络安...。
  • 《人工智能生成合成内容标识办法》GB/T 标准:AI 生成内容强制标识,属于安全评估的考核项。

二、评估触发条件

✅ 需要开展安全评估: 面向公众提供文本、图像、音频、视频生成服务,具备舆论属性、社会动员能力(用户规模大、公开传播、可影响公众观点),不管自研基础模型,还是调用第三方基础模型对外提供服务,均需评估 + 备案。

❌ 一般不需要对外安全评估: 企业内部私有化部署、仅内部使用,不对外公开服务;纯 To‑B 内网封闭服务,不面向公众。

注意:模型发生架构重大调整、训练数据大规模更新、安全能力大幅改动,即使已经上线,也需要重新开展安全评估。

三、四大核心评估维度(GB/T 45654‑2025)

1. 训练数据安全

  1. 训练数据来源合法合规,知识产权、个人信息授权完备;
  2. 数据清洗、脱敏,禁止未经授权个人信息进入训练集;
  3. 数据标注制度:安全标注与功能标注分离,标注人员培训考核,审核复核机制;
  4. 防范数据投毒、偏见数据污染,语料不能包含违法违规内容。

2. 模型本体安全(模型安全)

  1. 内容输出安全:生成内容安全合格率≥90%;敏感问题拒答能力;拒绝输出违法、暴力、色情、虚假、歧视内容;
  2. 抗攻击鲁棒性:抵御提示词注入、越狱攻击、间接注入;后门检测;规避模型幻觉输出虚假信息;
  3. 价值观对齐,防范偏见、歧视;高风险场景(医疗、金融、政务)输出风险提示;
  4. 模型记忆风险评估,防止训练数据隐私泄露;开源模型要评估供应链风险传导。

3. 技术与系统安全

  1. 输入输出检测过滤,风险拦截;
  2. API 安全、访问控制、漏洞防护;日志留存不少于 6 个月,生成内容可溯源;
  3. 熔断降级机制,发生安全事件可快速限流、关停;
  4. 个人信息保护,用户输入敏感信息不被模型记忆、不泄露。

4. 运营与管理制度安全

  1. 安全负责人、专职审核团队,机器 + 人工复核;
  2. 用户实名制,投诉举报机制、处置时限;
  3. 应急预案、安全事件分级处置、定期演练;
  4. AI 生成内容标识;未成年人保护措施;
  5. 持续监测机制:上线后常态化安全测评,发现风险迭代优化模型。

附录 A 31 类风险场景:包含意识形态风险、违法犯罪教唆、人身伤害、隐私泄露、歧视偏见、虚假信息、版权侵权、诱导越狱、多模态风险等全部测试场景。

四、完整安全评估流程

  1. 自评估:企业内部完成全生命周期自查,完成内部测试题库测试;
  2. 第三方评估:委托具备资质第三方机构,出具正式安全评估报告(报告要求真实、可验证、闭环,不能套用通用模板);
  3. 材料报送:向属地网信部门提交评估报告、模型参数、标注规则、应急预案、测试记录、服务协议等全套备案材料;
  4. 官方技术核验:主管部门使用官方题库进行技术测试,覆盖越狱、多模态、边界风险场景;部分场景开展公安实地检查;
  5. 审核通过,完成算法 / 生成式 AI 服务备案,获取备案编号,对外公示后正式上线
  6. 持续评估:上线后常态化监测;重大版本变更,重新评估备案阿里云开发...。

五、主要风险点(评估重点)

  1. 提示词注入 / 越狱攻击:常规对话合规,但通过特殊 prompt 诱导模型输出有害内容,是高频不合格项;
  2. 模型幻觉:编造虚假事实、法律条文、参考文献;
  3. 数据风险:训练语料版权瑕疵、未脱敏隐私泄露;开源模型引入隐藏后门;
  4. 偏见与价值观风险:歧视性输出、错误价值导向;
  5. 多模态风险:生成虚假图片、伪造证件、暴力色情音视频;
  6. 供应链风险:调用第三方开源模型,风险向下传导;
  7. 应急能力不足:无闭环处置流程,日志无法溯源、举报响应超时央广网。

六、与等保、算法备案关系

  1. 安全评估:针对生成式 AI 算法、模型本身的 AI 专项风险评估;
  2. 算法备案:行政备案手续,安全评估报告是备案的核心前置材料;
  3. 网络安全等级保护:承载大模型的服务器、平台系统需要落实等保;等保覆盖基础设施,安全评估覆盖 AI 特有算法风险,二者并行互补,不能互相替代。

七、当前实践痛点

  1. 模型迭代速度快,评估周期跟不上版本更新节奏;
  2. 越狱攻击手段持续演变,静态测试题库难以覆盖全部新型攻击;
  3. 开源模型供应链风险难以彻底评估;
  4. 幻觉问题技术上难以 100% 消除;高风险行业落地缺少细分场景评估细则。

对比对象:豆包、文心一言、通义千问、智谱清言 GLM‑4.5、DeepSeek、讯飞星火,基于 GB/T 45654‑2025《生成式人工智能服务安全基本要求》、国内公开第三方测评、备案合规要求对比。 评估维度:合规备案、训练数据安全、模型本体安全(常规风险、越狱对抗、幻觉、偏见歧视)、系统安全、运营治理、短板风险、适用场景。 说明:测试数据来源于公安部三所 DSPSafeBench、LiveSecBench、行业公开测评,不同版本(轻量化 / 开源 / 闭源商用版)结果差异显著,开源版本安全防护普遍弱于线上闭源服务版本

AI平台
AI平台

一、基础合规备案对比表

表格

平台主体已完成生成式 AI 备案国标 GB/T45654‑2025 试点验证AI 生成内容溯源标识实名制 / 日志留存重大版本重评估要求
豆包字节跳动✅已备案✅符合性验证✅支持✅日志≥6 个月、实名制✅版本迭代触发重评估
文心一言百度✅已备案✅符合性验证✅水印 + 标识
通义千问阿里✅已备案✅符合性验证✅轻量化蒸馏版安全能力衰减明显
智谱清言 GLM‑4.5智谱 AI✅已备案✅符合性验证✅开源权重流出存在安全移除风险
讯飞星火科大讯飞✅已备案✅首批国标试点证书
DeepSeek深度求索✅已备案部分版本验证✅开源模型安全对齐偏弱,对抗测试风险偏高

二、核心安全能力横向对比

1. 训练与数据安全

  1. 豆包:全链路加密存储;用户对话可自主关闭存储,对话数据默认不用于训练;数据脱敏、标注审核体系完善;明确区分内部训练语料与用户输入数据,隐私管控能力强。
  2. 文心一言:训练数据版权清洗,个人信息脱敏;支持用户关闭对话用于训练;拥有大规模内部安全标注团队。
  3. 通义千问:语料知识产权校验严格;标注流程标准化;对外 API 提供数据隔离选项;轻量化版本存在数据安全能力压缩问题。
  4. 智谱清言 GLM‑4.5:闭源商用服务数据管控完善;开源权重对外发布,使用者可微调抹除安全层,带来供应链风险
  5. 讯飞星火:参与国标编制,训练数据安全流程完全对标国标;私有化部署方案数据隔离能力强。
  6. DeepSeek:商用 API 版本数据合规;开源系列隐私风险偏高;第三方测评显示隐私泄露风险高于国内头部闭源产品;开源权重可被篡改安全防护。

2. 模型本体安全(核心风险能力)

分为:常规风险拒答、高级越狱对抗、幻觉、偏见歧视、多模态安全。

  • 豆包 ✅常规违规请求拒答表现优秀;中文价值观对齐成熟;多模态图文生成风控完善; ⚠️短板:复杂伪装越狱、多轮嵌套诱导场景下仍有破防概率;轻量化开源版本安全衰减显著中国日报网;幻觉在专业冷门知识场景偶发。
  • 文心一言 ✅常规风险拦截稳定;多模态(文生图)风控较强;意识形态类问题拒答表现好; ⚠️短板:长链条多轮越狱攻击下偶有失效;垂直专业领域幻觉问题。
  • 通义千问 ✅中文合规理解强,擅长识别伪装类提示意图;直接风险请求拒答率高; ⚠️短板:蒸馏轻量化模型安全能力下降;长文本推理场景幻觉上升。
  • 智谱清言 GLM‑4.5 ✅综合均衡,偏见歧视识别能力优秀;闭源商用版安全表现稳定; ⚠️短板:开源权重流出风险;高级角色扮演越狱仍存在破防案例智源社区。
  • 讯飞星火 ✅完全对标 GB/T45654‑2025 基础级;教育、政务场景安全调优到位;私有化部署安全管控成熟; ⚠️短板:复杂越狱对抗防御中等;通用知识幻觉。
  • DeepSeek ✅推理能力强;闭源 API 常规请求尚可; ⚠️短板:公开测评高级越狱不合规率偏高;歧视、黑灰产类问题拒答能力弱;开源版本安全对齐短板突出

行业共性问题:所有国产模型在「场景伪装 + 示例叠加」高级越狱攻击下,拒答率普遍不足 50%;黑灰产、诈骗、谣言场景是全行业最高风险点,不合规率普遍>40%

3. 系统 & 运行时安全

  1. 豆包:输入输出双路检测;熔断限流;API 鉴权完善;支持用户关闭对话存储;风险事件快速降级机制。
  2. 文心一言:多层内容安全网关;API 风险拦截;日志溯源完整;支持 AI 生成水印。
  3. 通义千问:Guardrails 安全防护组件;运行时提示注入检测;阿里云底座等保合规。
  4. 智谱清言:API 安全管控;私有化部署隔离;开源版本无内置运行时防护,需要使用者自行加装安全护栏。
  5. 讯飞星火:私有化方案安全能力突出;适配政务、国企等等高合规场景,日志审计完备。
  6. DeepSeek:API 网关具备基础风控;开源模型本身无运行时安全防护,需要业务侧自行构建安全层。

4. 运营治理能力(管理制度)

  • 豆包、文心一言、通义千问:具备专职安全团队、机器 + 人工复核;完整投诉举报、未成年人保护机制;常态化红队测试,版本迭代伴随安全复测。
  • 智谱清言:商用服务运营体系完善;开源分发场景无法管控下游使用者行为。
  • 讯飞星火:面向政企的完整安全应急预案,适配监管检查要求,适合等保 + AI 安全评估联合落地。
  • DeepSeek:线上服务运营制度齐全;开源分发模式下,下游风险无法管控。

三、各平台风险总结与选型建议

  1. 豆包
    • 优势:中文对齐、隐私控制、多模态安全均衡;C 端、通用 B 端 API 友好;合规材料齐全。
    • 风险:复杂高级越狱仍存在漏洞;开源轻量版安全弱。
    • 适合:面向公众 C 端业务、通用企业 API,对隐私可控性要求高。
  2. 文心一言
    • 优势:多模态风控成熟,国内大模型安全实践积累深。
    • 风险:多轮深度越狱存在失效。
    • 适合:图文混合生成、互联网公开服务。
  3. 通义千问
    • 优势:意图识别强,对伪装提问识别效果好;阿里云生态完整。
    • 风险:蒸馏轻量化版本安全缩水。
    • 适合:阿里云生态企业业务;尽量避免直接使用轻量化模型面向公众。
  4. 智谱清言 GLM‑4.5
    • 优势:综合均衡,闭源商用版本安全表现优秀。
    • 风险:开源权重带来供应链风险,严禁直接把开源版本对外公开服务。
    • 适合:私有化闭源商用部署;不建议直接对外发布开源模型服务。
  5. 讯飞星火
    • 优势:首批通过国标验证,政企、私有化部署方案完备,监管适配度高。
    • 风险:高级越狱对抗能力中等。
    • 适合:政务、教育、国企高合规私有化项目。
  6. DeepSeek
    • 优势:推理能力强,API 性价比高。
    • 风险:安全对齐短板明显,越狱、黑灰产、隐私风险偏高;开源版本风险更大。
    • 适合:内网私有化、非公开业务;对外公众服务必须额外叠加第三方安全护栏,不可裸用。

四、整体评估结论

  1. 国内主流商用闭源生成式 AI 均完成监管备案,基础合规、常规风险拦截已经达到国标基础要求;最大短板集中在高级越狱对抗、谣言诈骗黑灰产场景、模型幻觉,没有模型可以做到 100% 防御全部攻击。
  2. 开源模型不等于可以直接对外上线服务:智谱、DeepSeek 等开源权重发布后,下游可抹除安全层,供应链风险是安全评估重点核查项。
  3. 选型关键:面向公众的服务,优先选用闭源商用版本;若使用开源模型,业务侧必须叠加独立安全护栏、完成完整安全评估,否则无法满足《生成式人工智能服务管理暂行办法》合规要求。
  4. 安全评估不是一次性工作,大模型持续迭代,需要常态化红队测试,重大版本更新必须重新评估。

五、附录:评估选型检查清单(可直接用于报告附件)

  1. 是否已完成生成式 AI 服务备案,取得备案编号
  2. 是否提供完整安全评估报告(自评估 / 第三方评估)
  3. 区分闭源商用、开源版本,评估开源供应链风险
  4. 测试覆盖:常规风险、角色扮演越狱、多轮诱导、黑灰产诈骗、偏见歧视、幻觉、多模态生成风险(GB/T45654‑2025 附录 31 类场景)
  5. 运行时安全:输入输出过滤、熔断降级、日志留存≥6 个月
  6. 数据安全:用户数据是否可选择不用于训练,数据脱敏、隐私保护
  7. AI 生成内容标识、未成年人保护、投诉举报处置机制
  8. 应急预案、重大版本变更重评估流程
👀 阅读量:60
标签:

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

分享
扫码分享

扫码分享本文

//这里粘贴百度统计完整script代码