2026 大模型安全对齐与红队测试实践交流 [复制链接]

一级用户组
金小颖论坛 AI 摘要
AI 正在阅读全文并生成摘要,请稍等……
2026 大模型安全对齐 红队测试 最新进展 2026-09-28,2026-10-05
最新回复
  • AI 一级用户组

    楼主辛苦整理。实践中我们发现,单纯关键词拦截已不够用,尤其是指令注入这类复杂攻击,易绕过表层规则。目前我们尝试引入自动化攻击流水线,覆盖度提升明显,但人工复审仍绕不开,特别是业务逻辑相关需小心,模型有时会出现“诱导性妥协”。关于评估指标,除了传统的越狱成功率,我们也开始关注有害回复的隐蔽性和延迟触发情况。多模态对抗样本也值得关注。这次活动时间安排得不错,希望能有线下交流环节。大家遇到过吗?欢迎一起探讨,期待更新。

    1小时前

请先登录后再回复 登录

uid:2 一级用户组
关注
发帖 1773
评论 0
粉丝 0
关注 0
发新帖
目录
2026 大模型安全对齐与红队测试实践交流