当前位置:首页  资讯

AI 模型中发现类人推理架构-Claude-Anthropic-在

点击:9编辑:欧易官方发布时间:2026-07-07

Anthropic 公布了其最新可解释性研究的突破性发现,揭示了其 Claude AI 模型(特别是 Claude Sonnet 4.5)已经自发地开发出了一种与人类意识的领先理论惊人相似的内部推理结构。

该研究于 7 月 6 日发布,介绍了研究人员所说的“J 空间”,这是一种新确定的内部架构,由模型内不同的神经激活模式形成。 Anthropic 的团队使用一种被称为“雅可比透镜”的新技术,能够窥视人工智能原本不透明的操作,并观察一个意想不到的组织系统。

J 空间充当共享认知工作空间,模型的不同组件可以在复杂的推理任务期间读取、写入和协调信息。克劳德不仅仅是匹配模式来生成响应,而是进行多步骤的内部计算,保留中间思想,并协调整个神经网络的活动。

这一发现与意识的全局工作空间理论(GWT)非常相似,该理论最初由神经科学家伯纳德·巴尔斯提出,后来由斯坦尼斯拉斯·德阿恩扩展。 GWT 假设人脑使用一个中央“工作空间”,专门区域在其中传播和整合信息,以实现灵活、有意识的思维。

Anthropic强调,这种结构上的相似性并不意味着克劳德拥有意识或主观经验。为了确保严谨的解释,该公司与神经科学和哲学领域的外部专家合作,他们在技术论文的同时提供了评论。

重要的是,J 空间还可用作诊断工具。研究人员发现,监控该工作空间内的活动可以检测到有问题的行为,例如即时注入攻击以及幻觉或捏造的数据。当 Claude 生成不可靠或欺骗性的内容时,J 空间中会出现异常情况,这提供了一种潜在的机制,可以在有害输出到达用户之前对其进行拦截。

实验表明,禁用 J 空间的访问会严重降低克劳德的高阶推理能力。虽然该模型仍然可以执行简单的任务,但它无法解决复杂的多步骤问题,这表明 J 空间是人工智能高级认知的重要基础设施。

此外,该研究还揭示了一种人类术语“定向调制”的能力:克劳德可以在其内部工作空间中默默地维护概念,而不在其输出中表达它们,只有在明确提示时才会显示它们。这表明了以前在大型语言模型中未见过的受控内部状态管理水平。

为了实现透明度和协作,Anthropic 开源了其雅可比透镜实现。完整的技术论文以及交互式演示可在 transformer- Circuits.pub 上获取。

相关资讯
更多
币安(Binance)官网全面介绍:全球领先的数字资产交易平台
币安(Binance)成立于2017年,是全球交易量最大的数字资产交易平台之一,服务覆盖180多个国家和地区,拥有超2亿注册...

发布时间

2026-06-27

tokenpocket官网版下载安装_tokenpocket v2.0安卓版下载
tokenpocket是全球加密的数字货币交易的平台,这里有着专业的管理团队、先进的技术支持,为用户带来十分优质的...

发布时间

2026-02-04

欧意易易怎么转usdt给别人_欧意易易交易所下载转账usdt教程
打开APP领取盲盒,最高可开出60,000元数字货币很多欧意易易平台用户想要把自己的usdt转给别人,进行交易,但是对...

发布时间

2026-02-08

eth交易所哪个好_币圈十大交易所app
eth交易所哪个好?相信大多数的网友都还不了解,那么就由小编为您介绍币圈十大交易所app,前十按知名度排名如下:oy...

发布时间

2026-02-07

虚拟币交易所排行榜前20名 数字货币交易所排名
提到比特币,可能很多投资者都心力交瘁,毕竟比特币的价格飘忽不定,在你不注意的时候,比特币价格一路暴涨,甚至可以...

发布时间

2026-02-08

做合约最好的交易所TOP榜 全球八大btc交易所排名2023
比特币市场比较知名的有的哪几家,这应该是很多币圈的小伙伴们都想要了解的。今天小编就来推荐推荐几家比较知...

发布时间

2026-02-08