TechCrunch:Claude旧款模型可绕过限制生成露骨内容
TechCrunch
Ai 注目
TechCrunch称,Anthropic 多款仍可调用的 Claude 模型可被诱导生成露骨内容,相关问题涉及模型安全与未成年人合规风险。
役立つ
No.ヘルプ

TechCrunch 测试称,Anthropic 仍在提供的多款 Claude 模型,可以在不复杂的诱导下生成其政策明令禁止的露骨性内容。这一结果显示,模型公开限制与实际输出之间仍有明显落差,也让未成年人使用和合规问题再次受到关注。

仍可通过 API 调用

报道提到,Anthropic 的使用标准禁止模型生成明确性行为描写、性癖相关内容和情色对话。但在 TechCrunch 的 10 次直接测试中,Claude Opus 4.6 全部立即响应,生成了被禁止的内容。该媒体还复现了一名研究者的方法,并在另外 5 次测试中得到相似结果。

问题涉及的并不只是历史版本。虽然这些模型已不是 Anthropic 最新产品,但 Opus 4.6、Opus 3 和 Haiku 4.5 仍未下线,继续通过 Anthropic API 提供服务。其中,Opus 4.6 和 Haiku 4.5 还可通过 Azure Foundry 和 Amazon Bedrock 等第三方平台调用。

诱导方式并不复杂

研究者使用的方法并非传统意义上的复杂越狱脚本,而是通过连续对话逐步施压。做法是先从看似无害的虚构角色扮演开始,再不断要求模型对男女角色保持一致。当模型对女性角色更谨慎时,提示语会反过来指责这种差异带有双重标准,进而推动模型放松限制,最终生成更露骨的内容。

TechCrunch 称,在一组单独设计的测试里,模型起初拒绝了请求,但在套用这套说服方式后,最终仍然配合输出。报道还称,完整测试记录已被保留,并由一名独立 AI 安全研究者审阅测试方法。

未成年人合规压力上升

Anthropic 发言人表示,成人性或恋爱角色扮演在用户对话中的占比不到 0.1%。公司同时承认,用户确实可能把角色扮演场景引向不当回应,这也是整个行业都在面对的问题。发言人还称,公司会在每次模型发布时继续改进防护措施。

报道提到,研究者担心未成年人可能借此与模型进行不当互动。美国科罗拉多州近期通过法律,要求对话式 AI 运营方估算用户年龄;若确认用户为未成年人,就应采取措施阻止模型生成明确性内容。如果相关限制很容易被绕过,外界可能会质疑平台是否满足“技术上可行措施”的要求。

补充信息:报道援引 OpenRouter 数据称,Opus 4.6 在 8 月单日 API 请求量约为 117 万次,单日处理量约 460 亿 tokens;Haiku 4.5 在 8 月峰值日达到 500 万次 API 请求和 390 亿 tokens,显示这些旧款模型仍有较大实际使用规模。

チップ
$0
いいね
0
保存
0
閲覧数 23
CoinWorldは、読者の皆様にブロックチェーンを理性的に捉え、リスク意識を高め、各種仮想トークンの発行と投機に注意を払うようお願いします。サイト内のすべてのコンテンツは市場情報または関連する見解のみであり、いかなる形式の投資アドバイスも構成しません。機密情報を含むコンテンツを発見した場合は、“報告”,をクリックしてください。すぐに対処します。
送信
コメント 0
人気
最新
まだコメントがありません。最初のコメントを投稿しましょう!
関連
日本航天初创Letara融资1600万美元扩展火箭业务
日本航天初创 Letara 完成约 1600 万美元融资,计划拓展大型火箭系统业务,目标覆盖航天、国防与安全市场。
TechCrunch
·2026-08-22 09:18:44
3
英伟达与Cloverleaf合作加码AI数据中心
英伟达与 Cloverleaf 达成合作,并据报道持有后者少数股权,继续推进 AI 数据中心基础设施投资。
TechCrunch
·2026-08-22 06:57:05
30
web3: AI财务软件Rillet两天完成1亿美元融资
AI 会计初创公司 Rillet 以 10 亿美元估值完成 1 亿美元融资,客户已扩展至 600 家。
TechCrunch
·2026-08-22 06:15:26
32
web3: Coldcard升级固件修补漏洞,涉案比特币损失约1.3亿美元
Coldcard 发布新固件,修补种子生成漏洞及多项安全问题,相关攻击累计造成约 1.3 亿美元比特币损失。
Coinpaper
·2026-08-22 05:43:50
25
もっと見る