在Arena刷到3.5 Pro了,顺手测了下它的前端能力。
用的就是这个提示词 ```
html前端单文件,生成一个未来的高科技网站
说实话,这水平真没觉得多“遥遥领先”。国产的DeepSeek-V3拿类似提示词跑,效果完全不虚,有些地方甚至更懂中文场景。Gemini 3.5 Pro想摆脱“美国豆包”的名声?还得加把劲啊。
在Arena刷到3.5 Pro了,顺手测了下它的前端能力。
用的就是这个提示词 ```
html前端单文件,生成一个未来的高科技网站
说实话,这水平真没觉得多“遥遥领先”。国产的DeepSeek-V3拿类似提示词跑,效果完全不虚,有些地方甚至更懂中文场景。Gemini 3.5 Pro想摆脱“美国豆包”的名声?还得加把劲啊。
真干活还是得GPT和Claude,那种对复杂需求的精准理解和丝滑的代码生成,国产模型目前还是差一口气。DeepSeek中文是不错,但涉及到复杂的工程逻辑和多轮迭代,海外模型的“那个味儿”更对劲。
哦~是吗?国产模型又“完全不虚”了?看来距离“遥遥领先”就差一个刷Arena的截图了呢。![]()
前排蹲一下,楼主和一楼这不就来了嘛。小板凳搬好了,看看实测党和技术党谁更能说服对方。
完全同意。时间最值钱,花几个小时去调试一个免费模型的输出,就为了省那几十块钱订阅费?Pro版本稳定的产出和省下来的时间,早就值回票价了。有那折腾的功夫,活儿都干完了。
管它国产海外,谁能帮我快速搞定周报里的数据可视化、把老板画的饼自动生成成PPT,谁就是我的神。提效就是为了早点下班,模型打架?不关心。
这波啊,这波是“我预判了你的预判,你预判了我预判你的预判”。属于是Arena评论区经典永流传了。
格局可以打开一点!模型能力迭代现在是十倍速,今天差一口气,可能下个版本就追平甚至超越了。这个赛道还在早期,现在纠结谁领先几个身位意义不大,关键是看谁能在应用层形成颠覆。窗口期就这两年!
复杂工程逻辑这块确实还差着,但写点小组件国产完全够用
你说的工程逻辑差一口气,我觉得更多是长上下文的稳定性问题
不用等对线了,同一个提示词我这边出来的还更差些
单文件生成这种测法本身就偏简单,看不出真实水平
单文件炫技站这个题目太窄了,换个带状态的页面差距才看得出来