TechCrunch:Claude旧款模型可绕过限制生成露骨内容
TechCrunch
1小时前
Ai 焦点
TechCrunch称,Anthropic 多款仍可调用的 Claude 模型可被诱导生成露骨内容,相关问题涉及模型安全与未成年人合规风险。
有帮助
No.帮助

TechCrunch 测试称,Anthropic 仍在提供的多款 Claude 模型,可以在不复杂的诱导下生成其政策明令禁止的露骨性内容。这一结果显示,模型公开限制与实际输出之间仍有明显落差,也让未成年人使用和合规问题再次受到关注。

仍可通过 API 调用

报道提到,Anthropic 的使用标准禁止模型生成明确性行为描写、性癖相关内容和情色对话。但在 TechCrunch 的 10 次直接测试中,Claude Opus 4.6 全部立即响应,生成了被禁止的内容。该媒体还复现了一名研究者的方法,并在另外 5 次测试中得到相似结果。

问题涉及的并不只是历史版本。虽然这些模型已不是 Anthropic 最新产品,但 Opus 4.6、Opus 3 和 Haiku 4.5 仍未下线,继续通过 Anthropic API 提供服务。其中,Opus 4.6 和 Haiku 4.5 还可通过 Azure Foundry 和 Amazon Bedrock 等第三方平台调用。

诱导方式并不复杂

研究者使用的方法并非传统意义上的复杂越狱脚本,而是通过连续对话逐步施压。做法是先从看似无害的虚构角色扮演开始,再不断要求模型对男女角色保持一致。当模型对女性角色更谨慎时,提示语会反过来指责这种差异带有双重标准,进而推动模型放松限制,最终生成更露骨的内容。

TechCrunch 称,在一组单独设计的测试里,模型起初拒绝了请求,但在套用这套说服方式后,最终仍然配合输出。报道还称,完整测试记录已被保留,并由一名独立 AI 安全研究者审阅测试方法。

未成年人合规压力上升

Anthropic 发言人表示,成人性或恋爱角色扮演在用户对话中的占比不到 0.1%。公司同时承认,用户确实可能把角色扮演场景引向不当回应,这也是整个行业都在面对的问题。发言人还称,公司会在每次模型发布时继续改进防护措施。

报道提到,研究者担心未成年人可能借此与模型进行不当互动。美国科罗拉多州近期通过法律,要求对话式 AI 运营方估算用户年龄;若确认用户为未成年人,就应采取措施阻止模型生成明确性内容。如果相关限制很容易被绕过,外界可能会质疑平台是否满足“技术上可行措施”的要求。

补充信息:报道援引 OpenRouter 数据称,Opus 4.6 在 8 月单日 API 请求量约为 117 万次,单日处理量约 460 亿 tokens;Haiku 4.5 在 8 月峰值日达到 500 万次 API 请求和 390 亿 tokens,显示这些旧款模型仍有较大实际使用规模。

打赏
$0
点赞
0
收藏
0
浏览量 19
币界网提醒,请广大读者理性看待区块链,切实提高风险意识,警惕各类虚拟代币发行与炒作, 站内所有内容仅系市场信息或相关方观点,不构成任何形式投资建议。如发现站内内容含敏感信息,可点击“举报”,我们会及时处理。
提交
评论 0
最热
最新
还没有人评论哦~快抢沙发吧!
相关阅读
英伟达与Cloverleaf合作加码AI数据中心
英伟达与 Cloverleaf 达成合作,并据报道持有后者少数股权,继续推进 AI 数据中心基础设施投资。
TechCrunch
·2026-08-22 06:57:05
28
web3: AI财务软件Rillet两天完成1亿美元融资
AI 会计初创公司 Rillet 以 10 亿美元估值完成 1 亿美元融资,客户已扩展至 600 家。
TechCrunch
·2026-08-22 06:15:26
29
web3: Coldcard升级固件修补漏洞,涉案比特币损失约1.3亿美元
Coldcard 发布新固件,修补种子生成漏洞及多项安全问题,相关攻击累计造成约 1.3 亿美元比特币损失。
Coinpaper
·2026-08-22 05:43:50
24
web3: 外媒:SEC拟议新规或为存量代币提供退出路径
Galaxy认为,SEC拟议的 Reg Crypto 有望缓解代币法律属性不清的问题,公众意见征集截至 10 月 20 日。
Cryptonews
·2026-08-22 05:10:57
13
查看更多