滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

DeepSeek大爆出圈,现在连夜发布新模型——

多模态Janus-Pro-7B,发布即开源。

在GenEval和DPG-Bench基准测试中击败了DALL-E 3和Stable Diffusion。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

想必大家这几天完全被DeepSeek刷屏了吧。

它长时间霸榜热搜第一,甚至AI第一股英伟达直接被干崩了——最大跌幅近17%,一夜蒸发5890亿美元(约合人民币4.24万亿元),创下美股单日跌幅最大纪录。

而Deepseek神话还在继续,春节假期中全国人民都开始体验了,Deepseek服务器还一度卡到宕机。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

值得一提,同一夜,阿里旗下大模型通义千问Qwen也更新了自己的开源家族:

视觉语言模型Qwen2.5-VL,包括3B、7B 和 72B三种尺寸。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

真~今夜杭州都不睡,起舞竞速大模型。

DeepSeek连夜发布新模型

先来看看DeepSeek新模型,这其实是此前Janus、JanusFlow的高级版本和延续。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

一作为博士毕业于北大的陈小康。

具体来说,它基于DeepSeek-LLM-1.5b-base/DeepSeek-LLM-7b-base构建的,是一个统一理解和生成的多模态大模型。整个模型采用自回归框架。

它通过将视觉编码解耦为单独的路径来解决以前方法的局限性,同时仍然使用单一、统一的转换器架构进行处理。

这种解耦不仅缓解了视觉编码器在理解和生成中的角色冲突,还增强了框架的灵活性。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

对于多模态理解,它使用SigLIP-L作为视觉编码器,支持 384 x 384 图像输入。对于图像生成,Janus-Pro使用LIamaGen中的VQ标记器,将图像转换为离散的ID,下采样率为16。

ID序列被扁平化为一维后,他们使用生成适配器将每个ID对应的代码库嵌入映射到 LLM 的输入空间中。然后,将这些特征序列连接起来,形成一个多模态特征序列,随后将其输入 LLM 进行处理。

除了 LLM 内置的预测头,还在视觉生成任务中使用随机初始化的预测头进行图像预测。

相较于前一个版本Janus的三个训练阶段,团队发现这一训练策略并不理想,会大大降低计算效率。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

对此,他们做了两处大的修改。

第一阶段Stage I的长时间训练:增加了第一阶段的训练步骤,以便在 ImageNet 数据集上进行充分的训练。研究结果表明,即使在 LLM 参数固定的情况下,模型也能有效地模拟像素依赖性,并根据类别名称生成合理的图像。

第二阶段Stage II:的集中训练:在第二阶段,放弃了 ImageNet 数据,直接利用常规文本到图像数据来训练模型,以生成基于密集描述的图像。

此外在第三阶段的监督微调过程中,还调整了不同类型数据集的数据比例,将多模态数据、纯文本数据和文本图像数据的比例从 7:3:10 调整为 5:1:4。

通过略微降低文本到图像数据的比例发现,这一调整可以让在保持强大的视觉生成能力的同时,提高多模态理解性能。

最终结果显示,实现了与现有视觉理解生成SOTA模型持平的水准。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的
△GenEval基准

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的
△DPG-Bench基准

与上一个版本 Janus相比,它可以为简短提示提供更稳定的输出,具有更好的视觉质量、更丰富的细节以及生成简单文本的能力。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

更多多模态理解和视觉生成能力的定性结果。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

DeepSeek征服全球用户

想必这两天一定是被DeepSeek刷屏了——

是科技圈非科技圈、七大姑八大姨都搁那讨论的程度。

像同为杭州六小龙的游戏科学,其创始人CEO、《黑神话:悟空》制作人也专门发微博支持:顶级科技成果,六大突破。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

还有DeepSeek自称MOSS,也被流浪地球导演郭帆注意到了。

好好好,DeepSeek是不是直接预订下一部主角了(Doge)。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

而这故事的一开始,正是前几天刚刚开源的推理模型R1,以其低廉的成本、免费的使用以及完全不输o1的性能,征服了全球用户,直接引发行业地震。

仅仅花费560万美元训练的R1,相当于Meta GenAI团队任一高管的薪资,在很多AI基准测试中已经达到甚至超越OpenAI o1模型。

而且DeepSeek是真的免费,而ChatGPT虽然在免费榜上,但要是想解锁它的完全体,还是要掏上200美元。

于是乎,大家开始纷纷转向DeepSeek来构建一切,也就迅速登顶美区苹果应用商店免费App排行第一,超越了ChatGPT和Meta的Threads等热门应用。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

用户量的激增也导致DeepSeek服务器多次宕机,官方不得不紧急维护。

而聚焦于行业内,大家对于DeepSeek的关注,在于如何在有限的资源成本情况下,实现与OpenAI持平的水准。

相比于国外动辄百亿千亿美元成本、几十上百万张卡这种粗放的模式,用DeepSeek很多技术细节都放在如何降低成本开销上。

比如蒸馏。R1总共开源了6个在R1数据上的蒸馏小模型,蒸馏版Qwen-1.5B都能在部分任务上超过GPT-4o。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

还有就是纯强化学习,抛弃SFT环节,通过数千次的强化学习来提升模型的推理能力,然后在AIME 2024上的得分与OpenAI-o1-0912的表现相当。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

也正因为这样,让人不免想到OpenAI前几天砸5000亿美元建数据中心以及英伟达长时间以来在高端GPU的垄断地位。

拿5000亿美元建数据中心,是有必要的吗?

大规模的AI算力投资,是有必要的吗?

这样的讨论,在资本市场得到了响应。美股开盘后,英伟达股价暴跌17%,创下自2020年3月以来最大跌幅,市值蒸发近6000亿美元,老黄自己的个人财富一夜之间也缩水了超130亿美元。

博通、AMD等芯片巨头也纷纷大幅下跌。

对此,英伟达公开回应称,DeepSeek是一项卓越的人工智能进展,也是测试时扩展的绝佳范例。DeepSeek的研究展示了如何运用该技术,借助广泛可用的模型以及完全符合出口管制规定的算力,创建新模型。推理过程需要大量英伟达 GPU和高性能网络。如今我们有三条扩展定律:持续适用的预训练和后训练定律,以及新的测试时扩展定律。

同样被动摇的还有Meta、OpenAI。

Meta内部甚至成立了专门的研究小组,试图剖析DeepSeek的技术细节,以改进其Llama系列模型,并且新年计划中预算4000亿起步搞AI,年底AI算力将达130万卡。

奥特曼也紧急透露新模型o3-mini即将免费上线ChatGPT的消息,试图挽回一点市场热度。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

现在有了新模型发布,关于DeepSeek的讨论还在继续。

DeepSeek新版本疑似很快发布,时间是2025年2月25日。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

杭州昨夜不眠

同一个夜晚,同一个杭州。

就在DeepSeek新模型发布不久,Qwen也更新了自己的开源家族:

Qwen2.5-VL。

滚烫Deepseek一夜刀掉英伟达4万亿 除夕又搞了个大的

这个标题怎么有三体那味了。

它有3B、7B 和 72B三种尺寸,可以支持视觉理解事物、Agent、理解长视频并且捕捉事件,结构化输出等等。

(详情内容可以参考下一篇推文)

ps,最后,继杭州六小龙之后,广东AI三杰也出现了。

(杭州六小龙分别是游戏科学、DeepSeek、宇树科技、云深处科技、强脑科技和群核科技)

他们分别是湛江人梁文锋(DeepSeek创始人),汕头人杨植麟(月之暗面、Kimi创始人)以及AI学术大佬广州人何恺明。

文章来源于网络。发布者:火星财经,转载请注明出处:https://www.sengcheng.com/article/14274.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
火星财经的头像火星财经
华为影业上线大片《非遗春节 鸿蒙新享》,华为浏览器实力抢镜!
上一篇 2025年1月28日 下午3:00
2025春节档预售票房破10亿 肖战《射雕英雄传:侠之大者》超3亿领跑
下一篇 2025年1月28日 下午3:00

相关推荐

  • 立案仅11个工作日!亚辉龙蹭脑机接口热点信披违规,证监会拟罚750万元

    2 月 28 日,深圳市亚辉龙生物科技股份有限公司(下称 “亚辉龙”)发布公告披露,公司已收到深圳证监局下发的《行政处罚事先告知书》,因涉嫌蹭 “脑机接口” 市场热点、实施信息披露误导性陈述违法行为,监管部门拟对公司及相关责任人员合计处以 750 万元罚款。 记者梳理事件时间线发现,从 2 月 6 日晚间亚辉龙收到证监会立案告知书,到此次收到行政处罚事先告知…

    2026年3月1日
    34700
  • 国内首家交付破百万的新势力!理想汽车7月交付30731台

    8月1日消息,理想汽车今日公布了7月份交付数据。 2025年7月,理想汽车交付新车30,731辆。截至2025年7月31日,理想汽车历史累计交付量为1,368,541辆;并且,理想还是国内首家达成100万辆交付的新势力品牌。 目前,理想旗下共有李想L6、L7、L8、L8、i8、MEGA等六款车型在售。 其中,理想L6作为理想旗下最入门的车型,售价区间24.9…

    2025年8月1日
    30300
  • 余额宝货币基金哪个好,从这几方面考虑

    如今,余额宝已经成为绝大多数普通人的理财首选,把闲置资金放进余额宝,既能享受比银行活期存款更高的收益,又能实现随取随用,兼顾了收益性和流动性,方便日常消费、转账、还款。但很多人发现,余额宝并非只有一款货币基金,而是对接了数十款不同的货币基金产品,不同产品的七日年化收益率、万份收益、规模、赎回到账速度等都存在差异,同样是放 1 万元,有的产品一天能赚 1 块多…

    2026年1月16日
    71700
  • 日本一地出现神秘地鸣:地面轰隆作响 民众陷入担忧

    5月5日消息,据媒体报道,5月3日起,日本青森县多地出现如地鸣般的巨大声响,有居民发布事发时监控画面。多个居民表示事发时只听到震动声,但没有感受到摇晃。 出现声响的具体原因尚在调查,当地居民担忧可能与地震或火山活动有关。对此青森地方气象台的负责人表示,目前没有接到地震或火山活动相关信息。 公开资料显示,地鸣和地光一样,是一种临震前兆,往往发生在地震前的几秒、…

    2025年5月5日
    31600
  • 卷福回应为何缺席《复联5》阵容发布会:也许他们缺把椅子

    近日,首度公开解释其未出现在《复仇者联盟:毁灭之日》首波阵容名单的原因。 今年三月末,漫威工作室通过在线直播逐人公布新复仇者电影阵容,引发全球粉丝狂欢。尽管帕特里克斯图尔特、弗洛伦斯皮尤等明星的加盟令人兴奋,但卷福饰演的至尊法师却意外缺席名单。 在近期接受巴西媒体Omelete(经由X平台《复仇者更新》频道转载)采访时,卷福被问及为何奇异博士未出现在2025…

    2025年9月7日
    34400

发表回复

登录后才能评论
关注微信