
股票中的配资
这项由谷歌与谷歌DeepMind联合开展、并与石溪大学合作完成的研究,于2026年7月发布在预印本平台arXiv,论文编号为arXiv:2607.13188v1。对这一领域感兴趣的读者可以通过该编号查询完整论文。
教室里,一位老师在黑板前边说边画。她嘴里讲着"三角形的三个角之和等于180度",手上同时在黑板上画出一个三角形,三个角的弧度随着她的话语一起出现。这里没有"先说完再画",也没有"先画完再说"——说话和画图是同时发生、互相影响的。她解释一个角,另一个角的画法就随之调整;她画出一条边,下一句话的措辞也会顺势改变。
现在的AI做不到这一点。大多数AI要么先生成文字,再把文字交给另一个系统去画图;要么虽然文字和图像同时在"生成中",但两只手其实各顾各的,右手画的东西左手并不知道,等到最后合拢来一看,常常对不上。谷歌这支研究团队就是冲着这个问题来的——他们想让AI真正做到"边说边画、边画边说",两个模态在每一个瞬间都互相知晓对方在想什么,还能在发现矛盾时及时纠正自己。
他们提出的解决方案叫做"自修正耦合马尔可夫跳跃过程"(SC-CMJP),并在此基础上设计了一个叫做CO?Jump的实际生成器。这套系统不需要改动底层模型的任何结构,不需要额外训练一个"监督者",只需要在推理阶段改变采样方式,就能让文字生成和图像生成真正耦合在一起、互相纠错。研究团队还为此专门创建了三个大规模数据集,涵盖图像编辑、迷宫求解和数织(Nonogram)三个任务,并将这些数据集和模型权重对外开放。
一、"同时说话又画图"为什么这么难
要理解这项研究在解决什么问题,先从一个更熟悉的场景说起。
假设你让一个朋友帮你写一封信,同时帮你画一张配图。如果你们两个人在不同的房间里,各自完成自己的部分,最后拼在一起,很可能信里写的是"一只蓝色的猫坐在沙发上",而配图里画的是一只橙色的猫站在地上。这就是"独立并行"带来的问题:各做各的,没有实时沟通。
现在改成你们坐在同一张桌子上,但规定每人只能看到对方上一步做了什么,不能看到对方这一步正在做什么。这稍微好一些,但还是会出问题:你刚在信里写了"猫的眼睛是绿色的",而对方这一步正在把眼睛涂成黄色,等他涂完你才能看见,那时候再改就麻烦了。这就是现有大多数"并行多模态生成"方法的本质困境——看似同时在生成,实则每一步只能参考对方上一步的状态,不能参考对方当下正在决定的内容。
更麻烦的是,现有的"掩蔽扩散模型"(MDM,一种主流的并行生成框架)还有一个额外限制:一旦某个词或图像块被"定稿",就再也不能反悔。这就好比你写信时,每写一个字就立刻用不可擦除的墨水刻在石板上——就算后来意识到写错了,也改不了。结合上面说的"各顾各"问题,两边都无法实时沟通、又都没有反悔的机会,一旦文字和图像在某一步产生了矛盾,这个矛盾就会一直延续到最终结果里。
谷歌的团队同时解决了这两个问题。他们的核心思路是:让文字的生成速度受到图像当前状态的影响,让图像的生成速度也受到文字当前状态的影响,两者在每一步都实时交换"我现在有多自信"的信号;同时,如果一个已经确定的词或图像块,事后因为另一方的信息而显得不对了,系统有权把它重新盖掉,重新生成。
二、掩蔽扩散模型是怎么工作的
在深入了解这套新方法之前,需要先理解它所依托的底层框架——掩蔽扩散模型。
回到那个"刻字在石板"的比喻。掩蔽扩散模型的工作方式是:一开始,文字和图像的所有位置都被一个特殊符号"[MASK]"盖住,你看到的是一张全是空格的纸。然后,模型一步一步地把这些空格填满。每一步,模型根据已经填好的内容以及整体上下文,判断哪些空格应该在这一步被揭开,揭开时填入哪个具体的词或图像块。这个过程从高度模糊到逐渐清晰,就像照片在暗房里慢慢显影。
这个框架天然适合并行生成,因为文字和图像可以被放在同一张纸上,用同一套规则同时填充。但正如前面说的,标准版本有两个问题:文字和图像各填各的(只参考对方上一步的状态),以及已填的内容不能修改。
谷歌团队引入的"马尔可夫跳跃过程"(MJP)是一种数学工具,专门用来描述某个系统在不同状态之间跳来跳去的随机过程——比如一个气体分子在不同能量状态之间的跳跃,或者一个网页链接在被点击和不被点击之间的切换。掩蔽扩散模型可以被精确地用这种数学语言来描述:每个词或图像块以某个"速率"从"被掩蔽"状态跳到"被揭开"状态。这个速率就是可以被调控的关键。
三、新方法的核心:让两只手实时对话
研究团队的创新在于,他们把原本独立的两套跳跃过程"耦合"在了一起。
具体来说,当系统在某一步决定是否揭开某个图像块时,不再仅仅看这个图像块本身的内容置信度,还要看文字那边当前的状态——文字已经确定了哪些词,这些词对图像块的内容有什么暗示,文字整体上有多"自信"。如果文字那边已经清晰地描述了"左下角有一棵树",那么图像那边在处理左下角时,就会得到一个来自文字的额外信号,提示这里应该优先画树。
这个信号的传递机制叫做"跨模态注意力"(cross-modal attention)。这是一种在模型内部已经存在的结构——原本模型就会在计算时让不同位置的信息互相关注,研究团队只是把这种内部的关注关系提取出来,用于调节生成速率,并不需要给模型添加任何新的结构。这样一来,每一步的图像生成都带有当前文字状态的"意见",反过来也是一样。
但这里有一个微妙的不对称设计,值得仔细理解。在推理时,文字先被更新,然后图像的更新会参考这一步文字的状态。研究团队用链式法则的数学分解来解释这个设计的合理性:联合生成文字和图像的概率,可以自然地分解为"先生成文字的概率"乘以"在已知文字条件下生成图像的概率"。文字那边只需要看自己,图像那边需要参考文字。这个不对称设计让图像那边额外多了一个来自文字的参考信号,而文字那边保持纯粹的自我评估。
四、"自信心"的计算方式
系统在每一步需要判断"哪些内容应该被揭开,哪些应该被收回",这个判断依赖于一个叫做"置信度"(Confidence)的分数。
对于文字的每个位置,置信度的计算比较直接:模型预测这个位置最可能的词,然后看模型对这个预测有多确定——如果模型认为"99%的可能性是'猫'",那置信度就高;如果模型认为"猫和狗各占50%的可能性",那置信度就低。
为了让预测不总是落入最保险的选项,系统还加入了一点随机扰动(Gumbel噪声)。这就好比你在选择午饭时,不总是选最喜欢的那道菜,偶尔给其他选项一点机会,避免生成结果过于单调。
对于图像的每个位置,置信度的计算更复杂,因为它需要融合两个信号:一是图像位置自身的置信度(自信号),二是从文字那边通过跨模态注意力传来的置信度(跨模态信号)。两个信号按照一定比例混合,最终得到"耦合置信度"(CoupledConf)。
混合的比例不是固定的,而是根据当前文字和图像各自的"混乱程度"动态调整。这里用了一个叫做"信息熵"的概念——熵越高,表示这个模态当前越不确定、越混乱。当图像那边非常混乱而文字那边比较清晰时,图像就应该多听文字的意见,跨模态信号的权重增加;反过来,当文字那边更混乱,图像就更依赖自己的判断。这个动态调节的过程有一个专门的名字叫"基于熵的门控"(Entropy-Based Gating),用希腊字母λ来表示这个比例。
研究团队还发现了一个有趣的现象:在生成过程的早期,图像那边因为有来自原始图像的先验知识而相对有把握,文字那边却因为刚开始什么都不确定;但随着生成推进,文字逐渐确定下来,图像需要生成新的内容,开始变得不确定。λ的值会随着这个过程动态变化,早期接近0(图像靠自己),后期接近0.85(图像大量参考文字)。这个动态变化恰好契合了生成过程的实际需要,而这个特性完全是自动涌现的,不需要人工设计。
还有一个小细节值得一提:文字和图像用的词汇库大小不同(文字的词汇量远比图像的码本大得多),这导致两边的置信度数值天然不在同一个尺度上,不能直接比较。研究团队用了"百分位排名"(Percentile Rank)来解决这个问题,把各自模态内部的置信度换算成在自身分布中的相对位置,确保两边的信号可以公平混合。
五、"反悔机制":发现错了就收回来
现在来说第二个创新:反悔机制。
前面提到,标准掩蔽扩散模型一旦揭开一个词或图像块就不能改了。研究团队借鉴了一个叫ReMDM的方法,允许已经被揭开的内容以一定概率重新被掩盖。CO?Jump在此基础上做了关键改进:触发"重新掩盖"的信号,不再只看这个位置自己的问题,而是同时考虑跨模态的矛盾。
在每一步,系统会对所有已经揭开的图像位置,用耦合置信度打分。得分最低的那些位置——意味着它们要么自己就很不确定,要么与文字的指示不符——会被重新盖上掩码,相当于"反悔"。之后在同一步的"揭开"阶段,系统会从所有被掩盖的位置中,选出耦合置信度最高的那些来揭开。
这个"收回再揭开"的过程就像是两步走:第一步,把质量最差的已有内容清掉;第二步,用当前最好的判断重新填充。这就使得整个生成过程不再是单向的"从模糊到清晰",而是一个双向的"不断调整"过程——揭开、发现不对、收回、重新揭开。研究团队把这个机制叫做"死亡跳跃"(Death Jump,对应收回)和"诞生跳跃"(Birth Jump,对应揭开),合在一起就是一个生死循环的自修正过程。
收回的数量和揭开的数量都由一个数学约束来控制,确保整个过程的统计性质保持正确,不会违背扩散模型的基本原理。这是一个精心设计的平衡:既允许反悔,又不破坏整体的生成框架。
六、三个任务,三个数据集
为了验证这套方法,研究团队创建了三个全新的数据集,分别对应三种由浅入深的多模态任务。
第一个任务是图像编辑。给定一张原始图像和一段文字指令(如"把那两个小丑换成穿休闲服的老年音乐家"),模型需要同时生成编辑后的图像,以及对原图和编辑图的文字描述(包括每个物体的位置框信息)。这个数据集叫JEdit-1M,包含100万个样本,来源是两个公开的图像编辑数据集(ImgEdit和OmniEdit)经过增强后的结果。增强的方式是用另一个大型视觉语言模型(Qwen3-VL-235B)对每对图像生成场景图理解和推理轨迹。
第二个任务是迷宫求解。给定一张迷宫图(有绿色起点和红色终点),模型需要同时生成画有蓝色路径的答案图,以及描述这条路径的坐标序列文字。这个任务的关键在于:文字给出的路径坐标和图像里画的路径必须完全一致,任何一处矛盾都会被算作错误。数据集叫JMaze-200K,包含20万个不同大小(6×6到20×20)的迷宫。
第三个任务是数织(Nonogram/Picross)。给定一个带有行列线索数字的空白格子图,模型需要同时生成涂黑后满足所有线索的图像,以及描述每行哪些格子该涂黑的文字。数织是一个逻辑约束很强的任务,行约束和列约束互相制衡,必须同时满足。数据集叫JNono-200K,包含20万个5×5到25×25大小的数织题。
这三个任务的难度依次升高:图像编辑相对宽泛,答案不唯一;迷宫有唯一正确路径但视觉结构相对简单;数织有严格的逻辑约束且规模可以很大。研究团队还特意设计了分布外(OOD)测试集,用比训练集更小或更大的迷宫和数织来测试模型的泛化能力。
七、实验结果:联合胜过各自为战
所有实验都在同一个基础模型(Lumina-DiMOO,一个能处理文字和图像的掩蔽扩散大模型)上进行,区别仅在于推理阶段使用哪种采样器。这样的设计确保了对比的公平性:模型能力相同,只有生成策略不同。
与CO?Jump竞争的基线方法有三种。第一种是MDM(标准掩蔽扩散采样),文字和图像完全独立更新,没有反悔机制。第二种是ReMDM,在MDM基础上加了反悔机制,但文字和图像仍然独立,不交换信号。第三种是MMaDA-Parallel,文字和图像交替更新,但每一步内部仍然独立,没有跨步骤内的实时耦合。
在图像编辑任务上,核心指标是"图像理解的mAP"(类似目标检测中的平均精度,衡量模型生成的文字描述与图像内容的对应程度)和"ImgEditBench评分"(用另一个大模型打分,衡量图像编辑的质量)。CO?Jump在目标mAP(0.346)和整体mAP(0.369)上均高于其他所有方法,ImgEditBench评分(1.93)也是最高的。
一个特别有说服力的对比是:Qwen3-VL-8B是一个专门做图像理解的大模型,并不生成图像,研究团队给它直接看CO?Jump生成的目标图像,让它描述图像内容。然而即使这样,CO?Jump自己生成的文字描述,在准确度上仍然超过了Qwen3-VL-8B事后分析的结果(0.346 vs. 0.330,整体0.369 vs. 0.360)。CO?Jump边生成图像边描述图像,结果比另一个专门盯着图像看再描述的系统还要准确。
在迷宫和数织任务上,评价标准更加严格:只有文字路径/解答和图像路径/解答同时正确,才算这道题答对。CO?Jump在所有六个测试列(迷宫分布内、迷宫分布外、迷宫总体,数织分布内、数织分布外、数织总体)上都排名第一,领先幅度从0.008到0.062不等。
分布外泛化的结果特别值得注意。在数织任务上,MDM从分布内的0.110骤降到分布外的0.050,跌幅超过一半;MMaDA-Parallel从0.143降到0.113,跌幅约21%;而CO?Jump从0.167到0.175,不但没有下降,反而略有上升。跨模态的耦合信号似乎帮助模型建立了一种更通用的"理解规律",在没见过的规模上也能保持稳定。
扩展采样步数的实验则展示了CO?Jump的另一个独特特性:它是四种方法中唯一一个在增加采样步数时持续变好的方法。当采样步数从8增加到512时,CO?Jump的ImgEditBench评分从1.72上升到1.93,整体mAP从0.074上升到0.369;而其他方法要么在某个点开始停滞,要么(如MMaDA-Parallel)反而出现下滑。更多的步数意味着更多的跨模态交流和自修正机会,这些机会会积累成质量的提升,而不是浪费在无意义的重复上。
八、拆掉其中一个零件会怎样
研究团队还做了消融实验,逐个移除CO?Jump的各个组件,观察哪个部分贡献最大。
移除"百分位排名归一化"的影响主要体现在图像编辑质量上(评分从1.93降至1.87),原因是文字和图像的置信度不在同一尺度,硬要混合的话,其中一方会无条件主导另一方,跨模态的信号实际上失效了。
移除"基于熵的门控"(固定一个常数混合比例,不动态调整)对图像编辑质量影响不大,但目标mAP从0.346降到0.316,整体mAP从0.369降到0.354。这说明门控机制的主要作用在于生成过程后期:当目标图像的新内容需要在文字已经确定的基础上被画出来时,动态地把信任转向文字才能画准。
移除"自修正"(反悔机制)是损失最大的:整体mAP从0.369骤降到0.337,图像编辑评分从1.93降到1.92。没有反悔机制,晚期发现的跨模态矛盾就无法修复,这个积累的代价在最终结果上非常明显。
从"耦合象限"图(图7b)可以看到,图像侧的反悔事件主要集中在"自信心低且跨模态信号也低"的区域,这些是真正的错误内容;另有一个较小的热点在"自信心高但跨模态信号低"的区域,这是纯粹由跨模态矛盾驱动的反悔——图像本来觉得自己没问题,但文字那边说不对,于是被推翻重来。正是后一类事件,制造了有反悔机制和没有反悔机制之间的性能差距。
九、这套方法在真实样本上怎么表现
论文里附有若干完整样例,值得具体描述。
在图像编辑样例中,输入是一张海边步道的照片和一条指令"在土路上加一个面朝大海、背着背包、穿休闲徒步服的行人"。CO?Jump的文字分支先在文字描述中确定了这个人应该出现的位置框(像素坐标789到940,305到745),然后图像分支在同一轮生成中把人画在了这个框里。没有第二次前向传播,没有额外的目标检测模型——一遍走完,文字和图像里的人出现在同一位置。
在迷宫样例中,12×12的迷宫,起点是(8,1),终点是(6,10)。CO?Jump的文字推理先做了整体分析:上半部分(0-5行)基本都是死路,主干道在下部的横向走廊之间;然后描述了路径是如何在底部绕一个大弧,再从右侧往上接近终点的。最终给出了完整的坐标序列,图像分支在迷宫上画出的蓝色路径与这个坐标序列完全吻合,逐格对应。
在数织样例中,7×7的数织,CO?Jump的文字推理没有从第0行开始逐行解,而是先找到了约束最强的行和列——那些线索之和加上必须的间隔恰好等于格子总数的行,这些行是确定的。然后利用这些确定行对列的约束,再反过来确定其他行,最终给出了每行的涂黑范围。图像分支按照这个方案涂黑,所有行线索和列线索都得到满足。
归根结底,这项研究讲的是一件很简单的事:当你同时输出两种内容时,让它们真正互相参考、互相约束,而不是各自为政。做到了这一点,不仅结果更准确,还能随着计算量的增加持续变好——这才是一个真正扎实的方法应有的样子。至于这套框架能不能推广到音频、视频,或者更复杂的多模态组合,研究团队在论文末尾留下了开放的问题,也许下一步就有人去做了。对这个方向感兴趣的读者,可以通过arXiv编号2607.13188查找完整论文,研究团队也计划开放代码、数据集和模型权重。
Q&A
Q1:CO?Jump和现有的多模态生成方法有什么本质区别?
A:现有方法在同时生成文字和图像时,两个模态每一步只能看到对方上一步的结果,不能参考对方当步正在做的决定,本质上还是"各顾各"。CO?Jump通过跨模态注意力机制,让图像每一步的生成速率直接受文字当前置信度影响,反之亦然。更重要的是,CO?Jump允许已经生成的内容被"收回"重来——一旦跨模态信号发现矛盾,低置信度的内容就会被掩盖并重新生成,实现了真正的双向实时耦合与自修正。
Q2:SC-CMJP框架里"熵门控"具体是怎么工作的?
A:熵门控用信息熵衡量文字和图像各自当前的不确定程度。图像的平均熵除以两个模态熵之和,得到一个0到1之间的λ值。λ值高说明图像比文字更混乱,图像就应该多参考文字那边的信号;λ值低说明文字更混乱,图像就更依赖自身判断。这个比例每步自动计算,不需要人工设定,在生成过程中自然地从"图像主导"过渡到"文字主导",恰好对应了从复用原图先验到生成新内容的需要。
Q3:JMaze和JNono数据集的推理轨迹为什么要专门用"并行形式"来写?
A:掩蔽扩散模型在推理时是并行揭开多个位置的股票中的配资,不像自回归模型那样严格按顺序生成。如果训练数据里的迷宫路径用"向左、向右、向上"这种相对方向描述,那这个描述必须知道前一步在哪才有意义,与并行生成的特性不符。改用绝对坐标(如"(3,5)")后,任何一个坐标无论在什么时刻被揭开,意义都是确定的,不依赖其他位置是否已经揭开。数织的推理也类似,强调行列约束的双向传播而非逐行解,这样的监督形式让模型更好地适应了并行解码的实际工作方式。
文章为作者独立观点,不代表联华证券-专业炒股配资门户-炒股交易软件观点