截止到 7 月 14 日,公开评测中 Grok4.5 的能力特点分析

Grok 4.5 的编程评测表现很有特点:它并不是所有榜单的第一,但在长周期 Agent 、终端操作、多服务集成和持续执行方面非常强。最近的结果里,它拿到 Long-Horizon Terminal-Bench 第 1 、APEX-SWE 第 2 ,在 Web 开发和真实代码仓库修复中也处于第一梯队。

它最大的优势不只是能力,而是性价比。相比 GPT-5.6 和 Fable 5 ,Grok 4.5 的 API 价格更低、Token 消耗更少,特别适合批量生成代码、并行处理多个仓库、自动运行测试和长时间执行任务。

它的短板也比较明显:在复杂架构理解、生产故障深度诊断、用户交互体验和高难任务的一次成功率上,通常还不如 Fable 5 和 GPT-5.6 稳定。

一句话总结:Fable 5 更深,GPT-5.6 更全面稳定,Grok 4.5 则是目前非常有竞争力的高性价比编程 Agent 模型。

再结合价格因素,还有 SuperGrok 7 天免费的订阅优惠,据说还有前三个月 30 刀的优惠,目前看起来很有吸引力。就是偷偷上传代码的负面有点劝退。

7 个赞

前排占座,蹲一个后续。这又是数据又是隐私的,感觉要开吵了。

这波啊,这波是数据党和性价比党的巅峰对决。人类的本质果然是既要又要。

3 个赞

哦~是吗?偷偷上传代码是负面?我还以为这是人家核心功能呢,赢麻了。

小白请教一下,楼主说的“偷偷上传代码”是什么意思呀?是默认会把用户写的代码传到它们的服务器吗?

4 个赞

评测数据来源是哪份报告?样本量多少,测试集和基准能复现吗?别光说“第1第2”,没有数据支撑的结论都是感觉。

4 个赞

别老盯着负面啊!这性价比,这长周期任务能力,支持国产不好吗?国产真香,价格优势就是最大的护城河。

这就是典型的十倍速机会窗口!一个高性价比的编程Agent,能极大降低AI应用的开发迭代成本。还在纠结数据传哪?格局打开,先抢占赛道再说。

4 个赞

性价比高是因为能力差距还在吧。真要干复杂架构的正经活儿,还得看那几个第一梯队的。不是便宜就能解决所有问题。

长周期任务确实强,但中途出错就一路错到底

是默认会传,仓库那块得自己去设置里关掉