一种基于隐式梯度优化的大语言模型对抗越狱攻击方法
# 热门搜索 #
大模型
人工智能
openai
融资
chatGPT
验证码登录
×
发送
登录即代表您已同意AITNT
用户协议
和
隐私政策
登录
登录成功后会自动刷新界面
AITNT公众号
AITNT APP
AITNT交流群
搜索
未登录
首页
AI中心
退出
首页
AI资讯
AI技术研报
AI监管政策
AI产品测评
AI商业项目
AI产品热榜
AI 源力市场
寻求报道
一种基于隐式梯度优化的大语言模型对抗越狱攻击方法
申请号:
CN202510906532
申请日期:
2025-07-02
公开号:
CN120806044A
公开日期:
2025-10-17
类型:
发明专利
摘要
本发明公开了一种基于隐式梯度优化的大语言模型对抗越狱攻击方法,该方法通过Gumbel‑Softmax技术实现对抗性token的连续梯度优化,结合两阶段代理模型筛选机制降低计算成本,并采用动态正则化策略保持语义隐蔽性。系统包含梯度优化模块、代理筛选模块和迁移增强模块,能够有效提升对抗性提示的攻击成功率和跨模型迁移能力。本发明解决了传统对抗攻击方法效率低、隐蔽性差的技术难题,在提高大模型攻击成功率的同时降低了攻击成本,并且有效减少了API调用次数,适用于大语言模型安全测试领域。
技术关键词
对抗性
大语言模型
正则化策略
退火策略
模板
序列
两阶段
语义
可读存储介质
文本
指令
机制
噪声
处理器
有效性
模块
程序
参数
指数
计算机