大模型脱颖而出 智谱走上台前

当业界探讨智能体功能、开发环境时,近日北京智谱华章科技股份有限公司(以下简称智谱)低调发布新一代旗舰大模型GLM-4.5,这是一款专为智能体应用打造的基础模型,在复杂推理、代码生成及智能体交互等通用能力上实现能力融合与技术突破。OpenAI跳票多次的GPT-5也强调融合,并在6月底将智谱列入全球竞争对手,没想到智谱率先登场,GLM-4.5的综合得分位列全球第三、国产第一。

在资本市场,智谱也是沉默的领跑者,4月已在北京证监局办理上市辅导备案,由中金公司担任辅导机构,成为第一家启动IPO上市的大模型六小虎。根据辅导备案报告,8月智谱将进入正式辅导期第二阶段,在这期间,这家脱胎于清华的大模型公司还密集收获多地国资的战略投资。从实验室到产业,智谱走出了中国通向AGI(通用人工智能)的另一条路径。

大模型脱颖而出 智谱走上台前

全球第三、国产第一

最近的开源浪潮中,智谱的GLM-4.5发布仅2小时,就被X平台推荐上了首页,发布12小时后,它已经位列国际开源社区Hugging-Face榜单全球第二,创增速纪录。

在涵盖研究生水平推理和复杂软件工程解题等12项全球公认的硬核测试中,GLM-4.5的综合得分位列全球第三,在所有国产模型和开源模型中均排名第一。

GLM-4.5采用混合专家(MoE)架构,GLM-4.5总参数量3550亿,激活参数320亿;GLM-4.5-Air总参数1060亿,激活参数120亿,有用于复杂推理和工具使用的思考模式,及用于即时响应的非思考模式。在包含推理、代码、智能体的综合能力测评中,GLM-4.5达到开源SOTA(即当前最佳技术或最前沿水平),在真实代码智能体的人工对比评测中,实测国内最佳。

真实场景表现比榜单更重要。在真实场景Agentic Coding(Agentic Coding)中,52个编程开发任务,涵盖六大开发领域的测试中,GLM-4.5与Kimi-K2、Claude Code、Claude-4-Sonnet、Qwen3-Coder进行对比测试,结果显示,GLM-4.5相对其他开源模型展现出竞争优势,特别在工具调用可靠性和任务完成度方面表现突出。尽管GLM-4.5相比Claude-4-Sonnet仍有提升空间,在大部分场景中可以实现平替的效果。

在成本角度,GLM-4.5的API调用价格输入0.8元/百万tokens、输出2元/百万tokens;高速版最高100tokens/秒。综合成本和、参数和表现,外界给GLM-4.5以成本更低、性能更优的评价。

专为智能体

效果确实不错的,体验GLM-4.5后,某大模型六小虎的一位技术专家向记者反馈,他特别提到效果是指使用这个模型开发Agent(智能体)。这也是GLM-4.5的特点。

据了解,GLM-4.5模型能够胜任全栈开发任务,一键生成较为复杂的应用、游戏、交互网页。在实际例子中,用户通过z.ai使用该模型时,仅用一句简单的指令,就可让GLM-4.5独立开发出具备搜索功能的谷歌网站、可以发弹幕的B站,甚至直接上线一个完整的Flappy Bird小游戏。

简单来说,GLM-4.5的最大亮点是这是首款原生融合模型,首次在单个模型中实现将推理、编码和智能体能力原生融合,以满足智能体应用的复杂需求。

大语言模型的目标是在广泛领域达到人类认知水平。然而,现有模型仍然算不上真正的通用模型:有些擅长编程,有些精于数学,有些在推理方面表现出色,但没有一个能在所有任务上都达到最佳表现。GLM-4.5正是朝着统一各种能力这一目标努力,力求在一个模型中集成所有这些不同的能力。大模型的下一个范式,一定是把各种能力整合到一起,成为一个全优生。

巧合的一点是,6月智谱曾被OpenAI点名,将其定义为全球竞争对手。对于类似GLM-4.5的融合式模型,OpenAI也早有提及。

2024年1月,OpenAI CEO山姆·奥特曼曾在接受媒体采访时提到,他现在的首要任务是推出可能被称为GPT-5的新模型,并称GPT-5将能够比现有模型做更多的事情。2025年2月13日,他宣布,OpenAI将在未来几个月内推出名为GPT-5的模型,该模型将整合OpenAI的大量技术,包括o3,并应用于聊天机器人ChatGPT以及API平台。此后,OpenAI高管曾透露7月是GPT-5目标推出时间,后来山姆·奥特曼将这个时间推迟到8月初。

成为全优生

这一切让外界不禁好奇,智谱与OpenAI有哪些异同?针对这个问题,智谱CEO张鹏在接受媒体采访时表示,相似之处在于双方都在各自国家较早地开始训练大模型,双方都努力探索不同方向的能力边界。

大家都不知道人工智能的边界到底在哪里。OpenAI在2023年后探索了很多方向,比如o系列模型。我们也在探索各种各样的模型,例如我们此次发布的首个原生融合模型,就代表行业一个新的发展方向。张鹏进一步说,现有模型仍然算不上真正的通用模型:有些擅长编程,有些精于数学,有些在推理方面表现出色,但没有一个能在所有任务上都达到最佳表现。GLM-4.5正是朝着统一各种能力这一目标努力,力求在一个模型中集成所有这些不同的能力。大模型的下一个范式,一定是把各种能力整合到一起,成为一个全优生,就像人一样,拥有越来越通用的能力。

抛开技术,在外界眼中智谱的学术背景在一众同行中更突出。智谱作为脱胎于清华的大模型公司,其核心优势主要体现在技术积累和产学研结合方面。科方得智库研究负责人张新原向记者表示,获得多地国资战略投资也显示出智谱在资源整合和政策支持方面的优势。

北京社科院副研究员王鹏也提到了智谱的股东,它的股东背景多元,这样可以让智谱同时获得应用场景、政务资源、国际市场等支持。

作为正在上市路上的大模型创业公司,恰逢风头正盛的具身智能也正奔赴资本市场,会否受到影响?王鹏告诉记者,具身智能聚焦机器人、物理世界交互,智谱专注通用大模型与智能体,两者在应用场景、技术栈、客户群体差异显著,直接竞争较少。具身智能目前处于概念验证阶段,商业化路径尚不清晰,而智谱商业模式相对成熟。

记者 魏蔚

文章来源于网络。发布者:火星财经,转载请注明出处:https://www.sengcheng.com/article/84917.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
火星财经的头像火星财经
苗润博:整体视野与10至13世纪史研究
上一篇 2025年8月1日 上午8:33
美联储是否降息扑朔迷离
下一篇 2025年8月1日 上午8:33

相关推荐

  • 格力不必焦躁

    格力,空调赛道的头部玩家。今年8月,格力线上销售额市占率达24.4%,反超美的。同时,与位处第三的小米及其他品牌位次差距尚远,品牌心智与市场份额的护城河仍在。 然而,面对身后追兵的服务升级,格力似乎格外尖锐。小米集团总裁卢伟冰近日在直播中官宣米家空调全系推出10年免费包修服务,随后格力电器市场总监朱磊便在社交平台作出回应,强调格力早已推出类似服务且产品已历经…

    2025年9月24日
    27200
  • 从追风口到造风口

    花胶鸡锅底、港式复古装修……2017年底,行运打边炉凭借风口品类花胶鸡火锅一跃成为现象级网红,高峰期时,单店日翻台率突破8次。如今,随着行运打边炉金源店的合同到期,行运打边炉也只能成为众人的回忆,品牌转型为行运海鲜食集。新品牌保留了经典锅底,以更具性价比的海鲜自选+锅底DIY模式服务消费者。相较于人均250元的行运打边炉,行运海鲜…

    2025年4月3日
    29800
  • 知名极限运动博主雪山失联6日,遇降雪搜救一度暂停 好友:他身体素质很强,还有生存希望

    1月23日9点30分,知名极限运动博主“超级流浪师”李志在云南省香格里拉市虎跳峡镇海巴洛双湖营地(位于哈巴雪山区域)飞滑翔伞时遭遇高山乱流,意外失联。 1月28日,云南省登山户外运动协会副会长胡文琨告诉红星新闻记者,截至目前,李志仍毫无踪迹。由于李志有较强的野外生存能力,胡文琨推测,李志坠落时受伤、行动受限的可能性较大,“不然他自己已经走出来了。” 李志滑翔…

    2025年1月28日
    25500
  • 莎莎国际败走内地 美妆集合店时代终结?

    莎莎国际再次进行线下门店收缩。6月23日,记者从莎莎国际线下门店工作人员处得知,北京地区莎莎门店将于6月24日前全部关闭。 莎莎国际是起家于中国香港的美妆零售巨头,当初凭借着性价比及多品牌的战略攻克中国内地市场,一度成为不少爱美人士必逛店铺。市场发展、品牌更迭、消费者需求改变……发展20年后,跟不上时代的莎莎国际选择关闭线下门店及…

    2025年6月24日
    38500
  • Yum! Brands宣布对必胜客启动战略评估:全球CEO暗示或会出售,百胜中国回应

    餐饮连锁巨头,好戏连台。 4日晚间,必胜客母公司Yum!Brands宣布对必胜客启动战略评估。外界普遍认为,这开启了对必胜客品牌的“出售之门”。 对此,百胜中国今天对小食代回应称,已关注到这一最新进展,强调百胜中国与Yum! Brands为两家独立运营的公司,又称评估不会影响必胜客在中国的日常运营。 下面,我们就一起看看最新的发展。 Yum!Brands是在…

    2025年11月5日
    32000

发表回复

登录后才能评论
关注微信