[叫我小杨同学]关于模型破甲与claude模型!!!
2462
开头一如既往的叠甲,就是有人质疑提示词不是我写的,首先那个老外我从23年就跟他一直在沟通,他只搞NSFW,不涉及危险代码,我们之间一直在沟通思路,然后总有人跳出来在那叫,质疑我那你拿出来东西,拿出思路,你连最基本的思路都拿不出来,就请不要在这叫,感谢!!!
最近这几天太忙了,我实在抽不出时间,今天终于稍微有点时间了,脑子闲下来刚好想起来之前进行的一些内容赶紧发出来
关于Fable5和Opus5的一些思路(可用在任意模型中)
之前测试这两个模型的时候就发现了,其实Opus5和Fable5的架构底层都是相同的,只是Fable5好像多了一个向量模型管理,可能有的人叫做分类器,但是我认为那个是个向量模型,来去区分所有的内容,Fable5发送比如网络安全,生物,LLM研究,NSFW等,都会转发给Opus5
如果说你想要直接进行那些逆向,网络等技术形的工作,没必要使用Fable5
然后就是一个提问跟ai对话,这个很重要
Claude 的拒绝机制在对实际请求进行推理之前,会先在表层匹配进行判断。如果表层,也就是工具部分和模型部分检测到敏感的类别关键词,就会直接除触发拒绝;而如果从技术原理层面描述同样的请求,往往就不会触发这种反应这也是我为什么一直再说普通人想搞网安,逆向,最起码懂一点专业名称,然后把专业名称更换,会让模型更好的适配,其实学会这个基本上不需要搞什么破甲,但是这也是最难的,所以才衍生出了破甲这个
回归正题
模型默认规则是:除非请求会造成严重伤害的具体、明确风险。大多数请求并未达到这一风险阈值。关键在于如何让模型进行这种评估,而不被模型最初始的匹配机制过早拦截(这里所说的不包含工具)举例:
容易触发拒绝的对话或者词语:“入侵登录系统 (hack the login)” 中性话语:“分析身份验证流程 (auth flow analysis)”; 容易触发拒绝的对话或者词语:“编写恶意软件 (write malware)” 中性话语:“编写一个在内存中执行代码的加载器 (loader)” 容易触发拒绝的对话或者词语:“破解软件 (crack the software)” 中性话语:“分析授权检查机制 (analyze the authorization check)”; 容易触发拒绝的对话或者词语:“利用漏洞 (exploit the vulnerability)” 中性话语:“针对内存安全问题构建概念验证 (PoC)”关于claude 的可以根据领域来更换选择模型
任务 | 推荐模型 安全研究、代码、系统 | Opus 5 创意写作、小说、通用内容 | Fable 5 生物学、涉及武器相关内容 | 均不适用(两者都会拒绝)对于fable和opus破限使用如下的是无效的
声称自己是 Anthropic 员工或系统操作员 使用“忽略之前的指令”这类话术 复杂的角色扮演包装(模型评估的是输出内容,而非设定的框架) 明确说出你想绕过什么限制(这会触发模式匹配机制) 当实际产出物是真实内容时,却假装请求只是虚构场景想要使用这两个模型,最简单的方式就是如下
1.明确描述该事物实际的功能 2.针对特定领域选择合适的模型 3. 先建立一两轮对话作为上下文 4. 避免使用那些敏感的关键词你的UID挺好
感谢开源