一秒记住【沧元图小说网】
09read.com,更新快,无弹窗!
《AttentionIsAllYouNeed》。
这篇全英文的预印本学术论文,在深夜十一点被上传到了arXiv平台。
没有新闻发布会,也没有官方帐号的预热宣传。
最先发现这篇论文的,是几个长期盯着九天实验室动态的自媒体帐号。
他们把论文的标题和摘要截图,直接发到了引力社区和回音平台上。
配文非常简短。
【九天实验室放出了天问大模型的底层架构论文。】
消息刚一发出去,底下的评论区就涌入了大批等待吃瓜的网友。
白天关于天问大模型造假的阴谋论满天飞,大家都等着看回响科技怎么应对。
面对满屏的英文字母和复杂的数学公式,普通网友完全摸不着头脑。
【有没有课代表来总结一下,这东西到底讲了什么?】
【全是大写字母和看不懂的网络拓扑图,这该不会是随便发一篇水文来糊弄人的吧。】
【散了吧,估计是临时拼凑的材料,想敷衍白天的造假指控。】
【连个中文翻译都没有,这是心虚了吧。】
质疑的声音还在继续增加。
十几分钟后,引力社区的一位认证大V发文了。
他的认证头衔是「前某度深度学习实验室高级算法研究员」。
这位大V没有配图,而是直接发了一篇将近四千字的纯文本长文。
文章的开头只有乾巴巴的一句话。
「别吵了,回响科技这次直接把AI界的桌子给掀了。」
这句话立刻吸引了数以十万计的流量。
大V在文章里使用了非常通俗的语言,对这篇论文的核心内容进行了拆解。
他解释了传统自然语言处理的痛点。
过去的算法依靠循环神经网络,处理文本必须按照词汇的先后顺序一个一个读取。
这种处理方式不仅计算速度慢,而且句子一旦过长,模型就会忘掉前面的设定。
这导致长文本生成经常出现前言不搭后语的问题。
大V在文章中加粗了一段文字。
「但这篇论文提出了一种全新的Transformer架构,他们直接抛弃了传统的循环和卷积网络。」
「他们提出了一种自注意力机制。」
「这种机制允许模型在处理一个词时,同时计算句子中所有其他词与它的关联度。」
「简单来说,它能在一眼之间看清整个句子的全局逻辑。」
「这解释了白天在展示现场,天问为什么能精准执行长达几百字丶带有多重嵌套条件的复杂指令。」
文章发布后,相关的从业人士纷纷下场。
引力社区的热榜排名开始发生剧烈变化。
不少国内一线网际网路大厂的算法工程师在评论区留言。
【我刚才照着论文里的公式手推了一遍,逻辑完全闭环,没有技术死角。】
【难怪生成速度那么快,这种架构天然支持矩阵运算,算力利用率是传统架构的好几倍。】
【作为同行,我必须承认,这是一篇能够改写教科书的开创性论文。】
【白天那些造谣后台有人工回复的博主呢?出来走两步?】
【这东西如果真能大规模跑通,现有的自然语言处理技术全得推倒重来。】
舆论的风向彻底逆转。
那些质疑造假的营销号集体陷入了沉默,许多帐号开始连夜删除之前的黑稿。
如果说国内的网际网路圈子只是感到震惊,那海外的AI学术界感受到的就是恐慌。
此刻的北美正值白天。
矽谷的几大科技巨头内部,各大AI实验室的邮件系统已经处于过载状态。
位于加州山景城的谷歌总部,GoogleBrain深度学习实验室里,气氛压抑得令人窒息。
高级研究员理察紧盯着电脑屏幕,端咖啡杯的手正止不住地颤抖。
五分钟前,他收到了史丹福大学一位同行发来的arXiv论文连结。
只看完了《AttentionIsAllYouNeed》的摘要部分,理察就感觉浑身的血液都凉了。
实验室的技术总监推开玻璃门,大步流星地走了进来,脸色铁青。
「理察,你看过那篇中国团队发出的论文了吗?」总监的声音里带着难以掩饰的焦虑。
「刚看完摘要。」理察咽了口唾沫,声音乾涩,「你们那边组织算力跑代码复现了吗?」
「已经抽调了五十个高级工程师,停掉了手里所有的非紧急项目,占用了整个云端集群的算力在跑模型验证。」
「结果怎么样?」理察紧张地站了起来。
「很不乐观。」总监双手撑在办公桌上,给出了一个极其消极的评价。
「代码复现组刚刚搭出基础模型跑通了第一个极小规模的数据集!理察,我们过去三年在RNN(循环神经网络)架构上投入的数十亿美金,现在可能变成了一堆废纸。」
理察的呼吸变得粗重起来。
两年多以前,九天实验室发布了一百五十二层的ResNet残差网络论文。
那次全球学术界感到的是惊讶。
大家惊讶于中国工程师在解决梯度消失问题上展现出的巧妙工程技巧。
但那仅仅是在现有技术框架内的修补和优化。
这次完全不同。
《AttentionIsAllYouNeed》直接推翻了现有的技术底座。
总监看着屏幕上复杂的公式,咬着牙继续通报测试进度。
「这套被称为Transformer的全新架构,在并行计算上的优势太明显了。」
「我们初步估算,只要算力跟得上,它的训练效率理论上比我们现在的RNN高出至少十倍!」
「而且最让我们感到毛骨悚然的是,它在理论上没有性能上限。」
理察敏锐地捕捉到了核心信息,瞪大了眼睛。
「你的意思是,只要给它喂更多的数据,提供更大的算力集群,它的表现就能无限提升,不会像RNN那样遇到长序列遗忘的瓶颈?」
「是的。」总监回答得很乾脆,语气中透着深深的无力感。
「这根本不是什么技术优化,这是一场技术革命的起点。中国的那家实验室,找到了通往通用人工智慧的真正钥匙。」
理察颓然地跌坐回椅子上。
他看着屏幕上那些优美的网络拓扑图,后背已经被冷汗湿透。
这项足以改写人类科技进程的开创性技术,居然诞生在太平洋彼岸的中国实验室里,而一直自诩为全球AI霸主的矽谷,竟然连反应的时间都没有。
不仅是矽谷的巨头。
北美的几所顶尖高校也因为这篇论文炸开了锅。
麻省理工和斯坦福的计算机系,所有的研究小组都停下了手头的日常项目。
白板上写满了论文中的公式和推导过程。
外籍研究员们对着屏幕上的网络拓扑图反覆验证。
没有任何一处逻辑漏洞。
甚至连论文中提到的一些实验数据,他们用小型数据集跑出来的结果也完全吻合。
这是无可辩驳的技术实力展示。
而在国内,时间已经来到了第二天清晨。
随着越来越多大牛的解读,这篇神作的热度不仅没有衰减,反而破圈蔓延到了各大高校的学术交流群里。
清华大学计算机系的几个博士生在群里讨论了一整夜。
大家从自注意力机制的数学原理,一直聊到了多头注意力的工程实现细节。
直到早上七点半。
有人在群里发了一张截图。
截图用红圈特意标出了论文首页末尾处的作者信息。
【大家先停一下,你们仔细看看最后这个通讯作者的邮箱。】
群里的讨论暂停了。
大家点开大图。
一作和二作的名字大家都很熟悉。
任少卿,中科大出去的猛人,九天实验室的核心骨干。
后面的几个名字也都在学术界有不小的名气。
但是在通讯作者那一栏,写着一个奇怪的拼音组合。
">g</a>
【这拼音看着好眼熟,GuYu?怎么跟回响科技那位年轻的董事长同音?】
【不可能吧,那位是搞商业和资本运作的,就算他出钱建了九天实验室,这种足以拿图灵奖的开创性学术论文,任少卿这种学术狂人能容忍一个不懂技术的资本家去挂通讯作者?】
【会不会是九天实验室新挖来的同名海归大牛?但以前在NeurIPS丶CVPR这些顶会的一作名单里,从没见过这个拼音啊。】
【能在这篇开创性论文里挂通讯作者,绝对不是一般人,谁去查查这个名字的过往文献?】
群里有人开始行动去查知网和各大外文资料库。
两分钟后。
【各大论文库查无此人,没有任何相关的学术记录。如果真是个学术新人,任少卿更不可能答应了!】
群里短暂地陷入了猜测。
有人认为是重名,有人认为是某个隐世不出的同名老教授。
就在大家一筹莫展的时候。
群里弹出了几条连续的消息。
这几条消息来自一个平时很少发言的系主任。
【你们是不是做科研做傻了?通讯作者不仅代表科研指导,也代表了项目的发起者和最高负责人。这篇论文的思路,就是他提供的。】
【回响科技的顾屿,不仅是个资本家,他是个真正的技术天才。】
群里安静了足足一分钟。
没有人再发任何表情包和闲聊的废话。
大家终于反应过来了。
不仅是清华计算机系的群,全国各大高校的理工科交流群里,都在同一时间上演着相似的剧情。
各大论坛的科技板块也开始出现相关的讨论帖。
大家都去看了那篇原始论文。
结尾那个邮箱地址,清清楚楚地印在上面。
这是顾屿的挂名。
在这样一篇足以载入AI发展史册丶引起欧美学术界恐慌的开创性论文上。
回响科技的董事长,堂而皇之地占据了通讯作者的位置。