GPT (gpt5.6)
GPT-6带火循环Transformer,阿里早已布局
一水
来源:量子位
手握两篇顶会论文
GPT-6 Astra一发布,recurrent depth突然一夜火了!
最早是the Information爆料,Astra使用了这种「循环深度」技术:
让同一组Transformer层反复运行,在不增加同等规模参数的情况下,把计算做得更深 。
??模型不必继续疯狂「长肉」,也能让现有参数多干几轮活,还有这好事。
不出所料,争议很快到来。。。
由于循环发生在hidden state里,中间过程未必会写成人类可读的思维链,模型会不会因此更难监测?
openai也由此被AI安全专家集体讨伐,甚至一度逼得首席科学家Jakub Pachocki亲自下场回应。
Jakub Pachocki还透露,自己正在憋一篇小作文以完整解释整件事情。
边等小作文,边让我们把目光拉回循环Transformer本身:
多循环几圈,模型真的就会更强吗?
学界其实早已踩坑。
同等算力下,省了参数的循环模型,经常打不过普通Transformer。
卡住它的,是一个相当现实的问题:
「计算冗余」 。
有意思的是,阿里早在11个月前就发了相关论文,靶子正是直指这个问题。
一篇MeSH ,解决循环内部怎么管理信息,向行业老大难「循环空转」发起冲击。
一篇SpiralFormer ,死磕循环之间「以什么精度计算」的粒度问题,让每一轮算力都花在刀刃上。
下一代架构候选,先过「计算冗余」这关
循环Transformer之所以让大家上头,是因为它给大模型提供了一种新的「变强方式」。
过去Scaling靠堆参数,24层就得24套参数,现在8层参数跑3遍,也能完成24层深度的计算。
效果能不能追上,还需要实验说话,但需要存储的参数确实少了。
用计算深度换参数规模,这笔账要是算得过来,想象空间可就大了 。
其实在Astra之前,Claude Mythos就曾把循环架构带火过一轮。
当时最抓眼球的,是一项图搜索成绩。
在GraphWalks BFS的256K至1M上下文测试中,Mythos Preview拿到了80.0%,GPT-5.4是21.4%,自家的Opus 4.6则是38.7%。
Mythos Preview得分接近GPT-5.4的四倍。
这个测试,可以理解成给模型一张复杂的关系网,让它从起点出发,一层层找出相连的节点。
找到一批,记住结果,再继续往下找,很考验连续多步处理信息的能力。
巧的是,循环架构擅长的,恰恰也是在hidden state里连续处理多轮信息。
于是Mythos的成绩一出来,外界很快便把两者联系到了一起。
至于它到底有没有采用循环架构,官方没有明说,答案也就留给了外界猜测。
不过从Mythos到Astra,大家期待的其实是同一件事:
模型不用一直长大,也能靠内部多算几轮,把能力提上去 。
这也让循环架构成为下一代高效大模型的候选路线之一。
不过问题来了,多算几轮,和多算出点东西,还真是两回事!!
看看这张图就明白了。
横轴从左到右,是信息经过模型各个模块的过程,中间三个蓝色柱子对应三次核心循环,也就是core loop。
纵轴表示计算前后hidden state的相对变化幅度。
第一个core loop更新很大,后面两个却迅速缩小。
注意,柱子变矮,并不意味着模型少花了算力,矩阵运算和Attention照样要跑。
这正是计算冗余的尴尬:
循环次数增加了,后续计算带来的增量却越来越小 。
来自阿里及合作高校的研究团队,正是从这里入手一路深挖。
他们先查清循环为什么空转,再想办法让后面几轮真正干上活。
MeSH:同时解决「计算无分化」和「信息过载」
团队首先给出的解法叫MeSH,现已被ICLR 2026接收。
论文首版在2025年10月公开,等于11个月前,他们就在给循环Transformer做「体检」了。
论文拉到底,先看效果。
在Pythia-1.4B级别的实验中,循环结构通过权重共享,减少了约33%的非嵌入参数。加入MeSH后,零样本下游平均准确率反而从普通Transformer的49.50%提高到50.56%,领先1.06个百分点 。
少了三分之一的非嵌入参数,成绩反而更好。
而MeSH新增的路由器参数,仅相当于普通Transformer非嵌入参数的约0.005%。
相较基础循环模型,额外计算开销也只有约0.014%,属于花小钱,办大事。
MeSH是怎么做到的?
团队直接钻进模型内部,检查模型每一轮到底干了什么,结果一下子找到了三个「摸鱼证据」。
第一个证据,是后面的循环越来越不爱动 。
团队比较了hidden state经过每轮计算前后的变化幅度,结果发现第一个core loop承担了绝大部分更新,到了后面几个core loop,状态变化迅速缩小。
第二个证据,是前后几轮越来越像 。
团队使用CKA分析不同循环之间的表示相似度,然后发现相邻轮次的hidden state高度接近。
同一组网络转了一圈又一圈,吐出来的东西却差不多,啊这!!
更扎心的是,第三个证据显示hidden state还越算越「单一」 。
奇异值谱分析显示,循环进行之后,模型表示逐渐挤进一个低维空间。
原本可以从多个方向表达的信息,被压缩到少数几个方向上,表达越来越单一。
三个证据摆在一起,模型的摸鱼套路就很清楚了:
第一个core loop猛干,后面几个core loop合着纯纯陪跑。
为什么会这样?这篇论文给出了两个诊断。
一个是「计算无分化」 。同一组网络反复使用,又缺少明确的轮次信息,很难在不同阶段形成分工,容易沿用相似的计算方式。
另一个是「信息过载」 。同一份hidden state既要保存原始输入,又要装下前几轮结果,还得承担当前计算。长期记忆和临时加工全挤在一起,最后谁也干不好。
说到底,得重新研究循环之间怎么「交接工作」。
传统循环模型里,上一轮算完,直接把hidden state整份递给下一轮,再由同一组网络接着算。
虽然后来大家打过补丁,怕它算着算着忘了原题,就把最初的状态重新加回来,但不管算到第几轮、当前处理哪个token,信息的搭配规则都是写死的。
MeSH想了一招:
不如干脆给模型加一个可以动态存取的「资料柜」?
这个资料柜叫Memory Buffer,由多个记忆槽组成,用来保存原始输入和循环过程中积累的信息,不必全部挤在当前hidden state里。
接着,MeSH给资料柜配了两个管理员。
而且,这些管理员各有各的工作方式。
每轮循环都有自己的路由器,每个token也能得到不同的读写权重。
新信息各存多少,历史信息各取多少,都由模型自己学习。
看到这里,关注过前段时间Hyper-Connections、mHC讨论的朋友,可能已经有点眼熟了。
它们在计算形式上,确实有相似之处 。
Hyper-Connections把原先单路传递的残差信息扩展成多路,再通过可学习的映射,组合出交给计算层的输入,并把计算结果分配回多路状态。mHC进一步约束这些连接,改善深层传播的稳定性。
MeSH则把类似的信息调配方式用在 循环之间 ,同时缓解了前面两个问题:
Memory Buffer把历史信息分流出去,hidden state终于能专心处理当前轮次。
动态读写路由器则为每轮搭配不同的信息,让共享网络逐渐形成分工,减少重复劳动。
这时候再用同样的三项指标重新检查,模型摸鱼时呈现的三个症状,果然都有了明显改善。
不过,循环之间有了分工,还有一件事没变:
每一轮依然要在完整token序列上计算 。
这就像明明只想先看清一座城市的整体布局,却还是得沿着每条街挨家挨户走上一遍。
信息会分工了,计算的尺度却还是固定的。
这就轮到第二篇论文SpiralFormer登台了。
SpiralFormer:让每一轮看不同尺度的世界
这篇论文继续往下追问:
SpiralFormer给出的答案,是把每轮循环的序列长度seq_len也变成可调的。这一成果刚被EMNLP 2026接收。
简单来说,他们受Coconut等隐式思考工作的启发,意识到模型中间的「思考」并不一定每一步都要维持完整、显式的token序列,也可以先压缩成更紧凑的表示,在潜空间中继续计算。
将相关思路运用到SpiralFormer里,效果居然还不错。
在Pythia-1.4B级别的实验中,SpiralFormer-L和普通Transformer的参数量基本相同,计算量却从14.08T FLOPs降到13.13T,5-shot下游平均准确率则从51.93%提高到54.37% 。
算得更少,成绩反而更高。
具体思路是,别让模型每一轮都用同样的分辨率看问题 。
它会先把相邻token压缩成更短的序列,再按照从粗到细的顺序循环。
论文采用的一种典型方案,是先从原序列的1/8长度开始,之后依次扩展到1/4、1/2,最后回到完整序列。
举个例子,这就像看地图。
第一轮先看城市全貌,弄清不同区域之间的关系,然后逐步放大,看到街区和道路,最后再落到具体位置。
回到论文就是,SpiralFormer在每轮循环开始前,都会对序列做一次「缩放」:
把相邻token划成一组,通过可学习的权重聚合成一个更粗的表示。压缩完的序列更短,Attention要算的token少了,计算量自然往下掉。
算完之后,再把结果分配回原来的token位置,交给下一轮继续处理。
这里需要注意,考虑到模型生成文本时不能偷看后面的内容,SpiralFormer还对写回结果做了右移,避免压缩操作泄露未来信息。
就这样,压缩、计算、还原……
每循环一轮,序列分辨率就提高一级,模型也从观察整体逐渐转向处理细节。
不过这里还有一个疑问:
这套「先看全局、再抠细节」的说法,到底只是设计者的一厢情愿,还是模型真的学会了?
团队接着钻进Attention里,做了两项probing实验。
先是观察Attention看得有多散 。
结果显示,早期的低分辨率循环中,注意力分布得更广,会同时关注较大范围的信息,而到了后期的高分辨率循环,注意力开始集中到少数关键位置。
然后直接检查Attention有多关注附近的token 。
随着分辨率提高,他们发现落在局部范围内的注意力越来越多。
也就是说,模型到了后面几轮,确实更倾向于处理局部关系。
这也就引出了SpiralFormer的核心发现:
相比之下,始终处理完整token序列的普通LoopedFormer,虽然也会出现类似变化,但趋势更弱,也不够稳定。
这说明,从全局到局部的分工并不会随着循环自动出现,多分辨率设计才是关键驱动因素。
团队还保持参数量和训练计算预算不变,只调整循环层所占的比例。
结果形成了一条U形曲线 :
随着循环比例提高,模型表现先变好,在30%到40%左右达到最佳,继续增加循环,过度共享参数又会拖累效果。
SpiralFormer也由此打开了另一个可以探索的Scaling维度:
除了循环多少次,还能调整每轮把序列压缩到什么尺度 。
一篇管信息,一篇管尺度
回头再看,这两篇论文其实补上了循环Transformer最缺的东西:
没错,正是分工!!
MeSH解决每轮「拿什么算」,SpiralFormer解决每轮「以什么粒度算」。
两块拼起来,也让循环架构走向下一代高效LLM,多了几分底气。
过去大模型要想Scaling,主要靠参数、数据和训练算力这三大支柱。推理模型兴起后,又多了一种做法,即让模型生成更长的思维链,用更多token换更好的答案。
现在呢?循环Transformer又提供了一种选择:
计算可以在hidden state里继续进行,同一组参数反复使用,模型规模可以不变,内部计算却能一层层加深 。
虽然这并不意味着可以白捡算力,毕竟循环结构省下的是参数,不是计算。
但只要让多出来的每一轮都算得值,用更少的参数撑起更强的模型,就有了可能。
这也是MeSH和SpiralFormer存在的意义,它们正是在把这种可能一步步做实。
围绕Astra和Mythos,外界还在热议「到底有没有用循环架构」「这会不会成为下一代路线」。
而阿里及合作高校团队已经把问题拆到了循环内部:
从查病因,到改结构,再到验证效果,这条路线上的具体卡点,就这样被逐个拆开了 。
MeSH获ICLR 2026接收,SpiralFormer获EMNLP 2026接收,顶会的认可也算是给这番持续深挖增加了更多含金量。
只能说,为了走到今天这一步,前人已经在这条路上踩了不少坑,也填了不少坑。
早在2018年的Universal Transformer中,研究者就开始尝试反复使用共享层。
近几年,Looped Transformer、recurrent depth和latent reasoning等研究又陆续出现,背后都是同一个念头:
模型想变强,除了继续长大,能不能也让现有参数多想几轮?
Astra的出现,更是把这条原本偏学术的路线,一把推到了行业聚光灯下。
至于下一代高效大模型会不会从这里长出来,现在下结论确实还有点早。
那就,让子弹再飞一会儿吧。
MeSH::
版权所有,未经授权不得以任何形式转载及使用,违者必究。什么是“GPT”(Guid Partition Table)?
GPT,即Guid Partition Table的缩写,中文直译为GUID分区表。 这是一种在计算机领域中广泛应用的术语,主要用于标识硬盘上的分区。 这个英文缩写在技术文档和驱动程序中具有4346的流行度,主要应用于Computing领域,特别是在文件系统管理和硬盘分区设置中。 当说到GPT,它代表的不仅仅是简短的缩写,而是包含了详细的分区表结构,使得操作系统能够准确识别和管理不同的文件系统,如Linux、NTFS和FAT。 然而,需要注意的是,仅凭分区表的GUID(全局唯一标识符)无法单独区分这些不同的文件系统,因为它们的标识可能相同。 GPT的使用广泛,例如在硬盘分区设置时,专业技术人员会利用它来创建、管理和维护多个分区。 此外,由于版权问题,本文提供的信息仅用于学习和交流,使用者需自行甄别其适用性,以确保信息的准确性和安全性。
什么是 GPT?在中国有开放使用吗?
GPT(生成式预训练模型,Generative Pre-trained Transformer)是由 OpenAI 开发的一种自然语言处理(NLP)模型。 在中国,直接开放使用 OpenAI 的 GPT 模型存在一定的限制,但通过本地化替代方案和合作方式,类似的技术依然可以得到广泛应用。 以下是对 GPT 的详细介绍以及在中国使用情况的说明:
GPT 简介GPT 利用深度学习技术,通过对大量文本数据进行预训练和微调,能够生成高质量的自然语言文本。 其核心技术是基于 Transformer 架构,这种架构在处理语言任务时表现出色。 GPT 的发展历程经历了 GPT-1、GPT-2、GPT-3 和 GPT-4 四个版本,每个版本都在前一个版本的基础上进行了优化和升级,提高了生成文本的质量和多样性。
GPT 的技术原理GPT 基于 Transformer 架构,由多个层级的注意力机制组成。其技术原理主要包括预训练和微调两个步骤:
GPT 的应用领域GPT 在多个领域中得到了广泛应用,包括但不限于:
GPT 的优点与挑战GPT 具有以下优点:
然而,GPT 也面临一些挑战和局限,如数据偏见、计算资源需求大以及内容控制难度等。
GPT 在中国的使用情况在中国,GPT 的使用情况有其独特的背景和限制:
法律与合规中国对于人工智能技术的使用有严格的法律法规和政策要求,包括数据隐私、内容审核和信息安全等方面。 因此,任何在中国开发和使用生成式预训练模型的行为都需要遵守相关法律法规。
未来展望尽管目前在中国直接使用 OpenAI 的 GPT 存在一定的限制,但随着中美科技合作的深入和本地化替代方案的不断发展,未来中国用户可能会看到更多类似 GPT 的高性能语言模型在市场上的应用。 国内的技术公司也在积极推动这一领域的发展,力求在生成式预训练模型技术上取得更多突破。
综上所述,GPT 是一种强大的自然语言处理工具,在中国虽然无法直接开放使用 OpenAI 的 GPT 模型,但通过本地化替代方案和合作方式,类似的技术依然可以得到广泛应用。 未来,随着政策和技术的进一步发展,中国在生成式预训练模型领域可能会有更多的创新和应用。
电脑装系统gpt是什么意思请问GPT和MBR的区别和联系
❶ 请问GPT和MBR的区别和联系
一、性质不同
1、gpt:GPT意为GUID分区表,这是一个正逐渐取代MBR的新标准。
2、mbr:MBR的意思是“主引导记录”。
二、劣势不同
1、gpt:同时还支持几乎无限个分区数量,限制只在于操作系统,Windows支持最多128个GPT分区。
2、mbr:一旦启动代码被破坏,系统就没法启动,只有通过修复才能启动系统。
三、特点不同
1、gpt:由UEFI辅住而形成的,这样就有了UEFI用于取代老旧的BIOS,而GPT则取代老旧的MBR。
2、mbr:最大支持2TB容量,在容量方面存在着极大的瓶颈,那么GPT在今后的发展就会越来越占优势,MBR也会逐渐被GPT取代。
GPT分区模式使用GUID分区表,是源自EFI标准的一种较新的磁盘分区表结构的标准。 与普遍使用的主引导记录(MBR)分区方案相比,GPT提供了更加灵活的磁盘分区机制。
GUID分区表(简称GPT。 使用GUID分区表的磁盘称为GPT磁盘)是源自EFI标准的一种较新的磁盘分区表结构的标准。 与普遍使用的主引导记录(MBR)分区方案相比,GPT提供了更加灵活的磁盘分区机制。 它具有如下优点:
1、支持2TB以上的大硬盘。
2、每个磁盘的分区个数几乎没有限制。 为什么说“几乎”呢?是因为Windows系统最多只允许划分128个分区。 不过也完全够用了。
3、分区大小几乎没有限制。 又是一个“几乎”。 因为它用64位的整数表示扇区号。 夸张一点说,一个64位整数能代表的分区大小已经是个“天文数字”了,若干年内你都无法见到这样大小的硬盘,更不用说分区了。
4、分区表自带备份。 在磁盘的首尾部分分别保存了一份相同的分区表。 其中一份被破坏后,可以通过另一份恢复。
5、每个分区可以有一个名称(不同于卷标)。
既然GUID分区方案具有如此多的优点,在分区时是不是可以全部采用这种方案呢?不是的。 并不是所有的Windows系统都支持这种分区方案。
以上内容参考:GPT磁盘_网络
❷ 重装系统时怎么把系统盘设置为GPT
GPT(GUID Partition Table)是指全局唯一标示磁盘分区表格式,它是可扩展固件接口EFI(被Intel用于替代个人计算机的BIOS)标准的一部分。一句话说GPT的好处:支持2TB以上的硬盘,数据读取效率比MBR分区更高,GPT比MBR启动快
安装须知:1、gpt分区安装系统需要主板支持UEFI模式,而且系统必须是64位系统2、本文介绍的是uefi pe安装ghost win10,大家务必备份转移硬盘所有重要数据3、如果是要将win8/win10改成win7,可以参考这两个教程:
一、安装准备
1、支持UEFI启动的电脑,8G容量u盘
2、系统镜像下载:ghost win10 64位官方极速版V2017.07
3、uefi启动u盘:uefi pe启动盘制作教程
二、启动设置
电脑设置UEFI启动的方法
U盘装系统启动热键大全
如果你的BIOS里有这些选项请设置如下:
Secure Boot 设置为Disabled【禁用启动安全检查,这个最重要】
OS Optimized设置为Others或Disabled【系统类型设置】
CSM(Compatibility Support Mole) Support设置为Yes或Enabled
UEFI/Legacy Boot选项选择成Both
UEFI/Legacy Boot Priority选择成UEFI First
三、gpt分区安装ghost 64位系统步骤如下
1、以安装ghost win10 64位为例,制作好uefi pe启动盘之后,将ghost win10 64位系统iso镜像直接复制到U盘gho目录下;
如果你使用一键重装工具重装系统遇到“目标分区为动态磁盘的GPT分区类型,需要在PE环境下进行备份或还原!”,就根据提示使用上面的方法进入uefi pe下安装系统。
本文地址: https://p3g.5slw.cn/article/2449.html




























