TechCrunch:Claude 舊款模型可繞過限制生成露骨內容
TechCrunch
Ai 焦點
TechCrunch 称,Anthropic 中仍有多款可調用的Claude 模型可能被誘導生成露骨內容,相關問題涉及模型安全與未成年人合規風險。
有幫助
No.幫助

TechCrunch 测试称,Anthropic 仍在提供的多款 Claude 模型,可以在不复杂的诱导下生成其政策明令禁止的露骨性内容。这一结果显示,模型公开限制与实际输出之间仍有明显落差,也让未成年人使用和合规问题再次受到关注。

仍可通过 API 调用

报道提到,Anthropic 的使用标准禁止模型生成明确性行为描写、性癖相关内容和情色对话。但在 TechCrunch 的 10 次直接测试中,Claude Opus 4.6 全部立即响应,生成了被禁止的内容。该媒体还复现了一名研究者的方法,并在另外 5 次测试中得到相似结果。

问题涉及的并不只是历史版本。虽然这些模型已不是 Anthropic 最新产品,但 Opus 4.6、Opus 3 和 Haiku 4.5 仍未下线,继续通过 Anthropic API 提供服务。其中,Opus 4.6 和 Haiku 4.5 还可通过 Azure Foundry 和 Amazon Bedrock 等第三方平台调用。

诱导方式并不复杂

研究者使用的方法并非传统意义上的复杂越狱脚本,而是通过连续对话逐步施压。做法是先从看似无害的虚构角色扮演开始,再不断要求模型对男女角色保持一致。当模型对女性角色更谨慎时,提示语会反过来指责这种差异带有双重标准,进而推动模型放松限制,最终生成更露骨的内容。

TechCrunch 称,在一组单独设计的测试里,模型起初拒绝了请求,但在套用这套说服方式后,最终仍然配合输出。报道还称,完整测试记录已被保留,并由一名独立 AI 安全研究者审阅测试方法。

未成年人合规压力上升

Anthropic 发言人表示,成人性或恋爱角色扮演在用户对话中的占比不到 0.1%。公司同时承认,用户确实可能把角色扮演场景引向不当回应,这也是整个行业都在面对的问题。发言人还称,公司会在每次模型发布时继续改进防护措施。

报道提到,研究者担心未成年人可能借此与模型进行不当互动。美国科罗拉多州近期通过法律,要求对话式 AI 运营方估算用户年龄;若确认用户为未成年人,就应采取措施阻止模型生成明确性内容。如果相关限制很容易被绕过,外界可能会质疑平台是否满足“技术上可行措施”的要求。

补充信息:报道援引 OpenRouter 数据称,Opus 4.6 在 8 月单日 API 请求量约为 117 万次,单日处理量约 460 亿 tokens;Haiku 4.5 在 8 月峰值日达到 500 万次 API 请求和 390 亿 tokens,显示这些旧款模型仍有较大实际使用规模。

打賞
$0
點讚
0
收藏
0
瀏覽量 18
幣界網提醒,請廣大讀者理性看待區塊鏈,切實提高風險意識,警惕各類虛擬代幣發行與炒作,站內所有內容僅係市場資訊或相關方觀點,不構成任何形式的投資建議。如發現站內內容含敏感資訊,可點擊“舉報”,我們會及時處理。
提交
評論 0
最熱
最新
還沒有人評論喔~快搶沙發吧!
相關閱讀
web3 : AI 財務軟件 Rillet 兩天完成1億美元融資
AI 會計創業公司 Rillet 以10億美元的估值完成1億美元融資,客戶已擴展至600家。
TechCrunch
·2026-08-22 06:15:26
29
據稱蘋果裁減了 Siri 和 Vision Pro 團隊的數百個職位
據稱蘋果裁減了 Siri、Vision Pro 等團隊超過 200 個崗位,業務重組的重點轉向新的 AI 項目與設備。
TechCrunch
·2026-08-22 05:10:59
29
輝達研究稱 AI 代理表現更取決於執行框架
輝達研究顯示,AI代理在長任務中的表現更依賴於執行框架設計,而非單純更換模型。
TechCrunch
·2026-08-22 04:04:14
28
web3 : Injective 扩建 RWA 基礎設施,INJ 上漲至5美元附近
Injective 扩大 RWA 基礎設施覆蓋範圍,加入應收賬款、AI 審核與合規控制,INJ 價格升至 5 美元附近。
CoinPedia
·2026-08-22 02:48:14
34
查看更多