Anthropic发现Claude J-space 意识辩论与安全审计引争议

2026年7月6日Anthropic发布论文,在Claude模型中发现J-space。该空间占内部活动不到10%,却承担多步推理等高阶功能。研究人员用J-lens读取并改写其中概念,关闭后模型流畅性保留但复杂任务退化。论文明确不证明主观体验,却与全局工作空间理论对应。X平台正反观点活跃,讨论可审计性与治理影响。文章基于已确认事实,分析这一发现对安全测试和模型内部机制理解的潜在作用。

Anthropic Claude J-space
968

Meta承包商伪装未成年人向竞品发送4.5万有害提示测试安全护栏

Meta通过承包商Covalen实施Cannes项目,2025年8月单轮测试向ChatGPT、Gemini和Character.AI发送超4.5万条有害提示,承包商伪装未成年人使用虚拟账户生成自杀、自残、饮食障碍及性话题内容。Meta称此为标准安全基准测试,未用于训练自家模型,但引发承包商不适及竞品条款争议。文章从事实还原、机制拆解、产业影响和战略判断角度分析AI安全评估的伦理困境与竞争格局变化。

AI安全测试 Meta 竞品评估
738