滚烫Deepseek一夜刀掉英伟达4万亿除夕又搞了个大的

火星财经 • 2025年1月28日下午3:00 • 行业 • 阅读 157

DeepSeek大爆出圈，现在连夜发布新模型——

多模态Janus-Pro-7B，发布即开源。

在GenEval和DPG-Bench基准测试中击败了DALL-E 3和Stable Diffusion。

想必大家这几天完全被DeepSeek刷屏了吧。

它长时间霸榜热搜第一，甚至AI第一股英伟达直接被干崩了——最大跌幅近17%，一夜蒸发5890亿美元（约合人民币4.24万亿元），创下美股单日跌幅最大纪录。

而Deepseek神话还在继续，春节假期中全国人民都开始体验了，Deepseek服务器还一度卡到宕机。

值得一提，同一夜，阿里旗下大模型通义千问Qwen也更新了自己的开源家族：

视觉语言模型Qwen2.5-VL，包括3B、7B 和 72B三种尺寸。

真~今夜杭州都不睡，起舞竞速大模型。

DeepSeek连夜发布新模型

先来看看DeepSeek新模型，这其实是此前Janus、JanusFlow的高级版本和延续。

一作为博士毕业于北大的陈小康。

具体来说，它基于DeepSeek-LLM-1.5b-base/DeepSeek-LLM-7b-base构建的，是一个统一理解和生成的多模态大模型。整个模型采用自回归框架。

它通过将视觉编码解耦为单独的路径来解决以前方法的局限性，同时仍然使用单一、统一的转换器架构进行处理。

这种解耦不仅缓解了视觉编码器在理解和生成中的角色冲突，还增强了框架的灵活性。

对于多模态理解，它使用SigLIP-L作为视觉编码器，支持 384 x 384 图像输入。对于图像生成，Janus-Pro使用LIamaGen中的VQ标记器，将图像转换为离散的ID，下采样率为16。

ID序列被扁平化为一维后，他们使用生成适配器将每个ID对应的代码库嵌入映射到 LLM 的输入空间中。然后，将这些特征序列连接起来，形成一个多模态特征序列，随后将其输入 LLM 进行处理。

除了 LLM 内置的预测头，还在视觉生成任务中使用随机初始化的预测头进行图像预测。

相较于前一个版本Janus的三个训练阶段，团队发现这一训练策略并不理想，会大大降低计算效率。

对此，他们做了两处大的修改。

第一阶段Stage I的长时间训练：增加了第一阶段的训练步骤，以便在 ImageNet 数据集上进行充分的训练。研究结果表明，即使在 LLM 参数固定的情况下，模型也能有效地模拟像素依赖性，并根据类别名称生成合理的图像。

第二阶段Stage II:的集中训练：在第二阶段，放弃了 ImageNet 数据，直接利用常规文本到图像数据来训练模型，以生成基于密集描述的图像。

此外在第三阶段的监督微调过程中，还调整了不同类型数据集的数据比例，将多模态数据、纯文本数据和文本图像数据的比例从 7:3:10 调整为 5:1:4。

通过略微降低文本到图像数据的比例发现，这一调整可以让在保持强大的视觉生成能力的同时，提高多模态理解性能。

最终结果显示，实现了与现有视觉理解生成SOTA模型持平的水准。

△GenEval基准

△DPG-Bench基准

与上一个版本 Janus相比，它可以为简短提示提供更稳定的输出，具有更好的视觉质量、更丰富的细节以及生成简单文本的能力。

更多多模态理解和视觉生成能力的定性结果。

DeepSeek征服全球用户

想必这两天一定是被DeepSeek刷屏了——

是科技圈非科技圈、七大姑八大姨都搁那讨论的程度。

像同为杭州六小龙的游戏科学，其创始人CEO、《黑神话：悟空》制作人也专门发微博支持：顶级科技成果，六大突破。

还有DeepSeek自称MOSS，也被流浪地球导演郭帆注意到了。

好好好，DeepSeek是不是直接预订下一部主角了（Doge）。

而这故事的一开始，正是前几天刚刚开源的推理模型R1，以其低廉的成本、免费的使用以及完全不输o1的性能，征服了全球用户，直接引发行业地震。

仅仅花费560万美元训练的R1，相当于Meta GenAI团队任一高管的薪资，在很多AI基准测试中已经达到甚至超越OpenAI o1模型。

而且DeepSeek是真的免费，而ChatGPT虽然在免费榜上，但要是想解锁它的完全体，还是要掏上200美元。

于是乎，大家开始纷纷转向DeepSeek来构建一切，也就迅速登顶美区苹果应用商店免费App排行第一，超越了ChatGPT和Meta的Threads等热门应用。

用户量的激增也导致DeepSeek服务器多次宕机，官方不得不紧急维护。

而聚焦于行业内，大家对于DeepSeek的关注，在于如何在有限的资源成本情况下，实现与OpenAI持平的水准。

相比于国外动辄百亿千亿美元成本、几十上百万张卡这种粗放的模式，用DeepSeek很多技术细节都放在如何降低成本开销上。

比如蒸馏。R1总共开源了6个在R1数据上的蒸馏小模型，蒸馏版Qwen-1.5B都能在部分任务上超过GPT-4o。

还有就是纯强化学习，抛弃SFT环节，通过数千次的强化学习来提升模型的推理能力，然后在AIME 2024上的得分与OpenAI-o1-0912的表现相当。

也正因为这样，让人不免想到OpenAI前几天砸5000亿美元建数据中心以及英伟达长时间以来在高端GPU的垄断地位。

拿5000亿美元建数据中心，是有必要的吗？

大规模的AI算力投资，是有必要的吗？

这样的讨论，在资本市场得到了响应。美股开盘后，英伟达股价暴跌17%，创下自2020年3月以来最大跌幅，市值蒸发近6000亿美元，老黄自己的个人财富一夜之间也缩水了超130亿美元。

博通、AMD等芯片巨头也纷纷大幅下跌。

对此，英伟达公开回应称，DeepSeek是一项卓越的人工智能进展，也是测试时扩展的绝佳范例。DeepSeek的研究展示了如何运用该技术，借助广泛可用的模型以及完全符合出口管制规定的算力，创建新模型。推理过程需要大量英伟达 GPU和高性能网络。如今我们有三条扩展定律：持续适用的预训练和后训练定律，以及新的测试时扩展定律。

同样被动摇的还有Meta、OpenAI。

Meta内部甚至成立了专门的研究小组，试图剖析DeepSeek的技术细节，以改进其Llama系列模型，并且新年计划中预算4000亿起步搞AI，年底AI算力将达130万卡。

奥特曼也紧急透露新模型o3-mini即将免费上线ChatGPT的消息，试图挽回一点市场热度。

现在有了新模型发布，关于DeepSeek的讨论还在继续。

DeepSeek新版本疑似很快发布，时间是2025年2月25日。

杭州昨夜不眠

同一个夜晚，同一个杭州。

就在DeepSeek新模型发布不久，Qwen也更新了自己的开源家族：

Qwen2.5-VL。

这个标题怎么有三体那味了。

它有3B、7B 和 72B三种尺寸，可以支持视觉理解事物、Agent、理解长视频并且捕捉事件，结构化输出等等。

（详情内容可以参考下一篇推文）

ps，最后，继杭州六小龙之后，广东AI三杰也出现了。

（杭州六小龙分别是游戏科学、DeepSeek、宇树科技、云深处科技、强脑科技和群核科技）

他们分别是湛江人梁文锋（DeepSeek创始人），汕头人杨植麟（月之暗面、Kimi创始人）以及AI学术大佬广州人何恺明。

文章来源于网络。发布者：火星财经，转载请注明出处：https://www.sengcheng.com/article/14274.html

赞 (0)

打赏

微信扫一扫

支付宝扫一扫

0 0

华为影业上线大片《非遗春节鸿蒙新享》，华为浏览器实力抢镜！

上一篇 2025年1月28日下午3:00

2025春节档预售票房破10亿肖战《射雕英雄传：侠之大者》超3亿领跑

下一篇 2025年1月28日下午3:00

行业

首款天玑9400+性能旗舰！真我GT7跑分曝光：单核2300分

4月14日消息，真我旗下新一代性能旗舰机型真我GT7的Geekbench 跑分曝光，作为首批搭载天玑9400+芯片的性能旗舰，其单核跑分为2300分，多核7651分，性能表现亮眼。天玑9400+基于台积电3nm工艺制程打造，拥有更高的主频和更出色的能效比，采用1颗3.73GHz超大核、3颗3.30GHz大核及4颗2.4GHz核心的三丛集架构，GPU为 Ma…

火星财经
2025年4月14日
140000
行业

行业首款双核旗舰洗地机！地宝X9 PRO图赏

4月8日消息，科沃斯最近发布了新款旗舰扫拖机器人——地宝X9 PRO，它是行业首款双核旗舰洗地机器人。即同时拥有BLAST飓风吸尘技术、OZMO ROLLER恒压活水洗地技术。现在这款新品已经来到我们评测室，下面为大家带来图赏。科沃斯地宝X9 PRO行业首创科沃斯 BLAST飓风吸尘技术，机身内部搭载100W高转矩电机，单片叶轮增…

火星财经
2025年4月8日
153000
行业

微星神影16锐龙版评测：锐龙7945 HX配合RTX 5070游戏生产力兼顾体验同价无敌

一、前言：RTX 50系显卡将DLSS 4技术带到游戏本 RTX 50系显卡的DLSS 4技术，是AI技术爆发以来，桌面图形技术最大的技术进步，现在RTX 50系Laptop GPU开始大规模铺货，DLSS 4技术开始加速普及到游戏本。这次来到我们评测室的，是微星最新的神影16锐龙版2025，搭载了最新的RTX 50系Laptop GPU，在DLSS 4技…

火星财经
2025年7月28日
149000
行业

乘客在高铁上用电煮锅 12306回应：可携带但禁用

7月14日消息，据媒体报道，近日有网友发视频表示，在高铁上发现有乘客使用小型电煮锅。对此，12306工作人员表示，高铁插座仅限为手机、平板电脑等小型电子设备提供充电服务。虽然电煮锅等电器允许携带乘车，但严格禁止使用。工作人员表示，在电饭锅工作时会产生蒸汽，这可能触发列车烟雾报警系统，导致列车紧急制动，不仅会扰乱正常运输秩序，更将危及行车安全。工作人员…

火星财经
2025年7月14日
92000
行业

H20有后门风险国产厂谁还敢用！黄仁勋：正与美国洽谈拟向中国出售更先进芯片

8月23日消息，H20被迫停产后，英伟达不可能看着自己在中国的市场份额减少，所以他们也在积极行动。黄仁勋接受采访时表示，该公司正与美国政府就向中国出口一款新型、更先进的芯片进行谈判，但由美国政府决定，英伟达持续协商中，现在还太早，无法得知结果。根据之前曝光的消息看，英伟达正在为中国市场开发一款代号为B30A的新型人工智能芯片，其性能将超过H20（目前英伟…

火星财经
2025年8月23日
100000

发表回复

关注微信