输入2美元输出6美元,Grok 4.7跑分却只有对手一半
输入每百万token两美元,输出每百万token六美元。这是xAI给Grok 4.7定的价。放在西方前沿模型里,这个数字低得有点扎眼——它更接近中国厂商的定价区间,而不是OpenAI、Anthropic那一档。 但价格便宜,成绩单未必好看。在独立评测机构Artificial Analysis的智能指数(v4.3.2版本)上,Grok 4.7拿到 46分 ,排在中间位置。Claude Fable 5.1和GPT-6各自拿到 53分 ,并列领先。这个指数由十项基准测试综合而成。 差距在写代码这件事上被拉大 真正让差距显形的,是智能体编程能力。在Terminal-Bench 4.0上,Grok 4.7的得分只有 26% 。作为对比,GPT-6 Astra是 60% ,Claude Fable 5.1是 55% 。 更尴尬的是,连更便宜的DeepSeek V4.1 Flash都以 27% 的成绩压过它一头。价格低、跑分也低,这个组合放在一起看,xAI这次的定位就变得耐人寻味了。 它到底强在哪 按照xAI自己的说法,Grok 4.7是他们在编程和知识工作上能力最强的一代模型。它建立在更大的基础模型之上,用了更长的强化学习训练,并且被设计成能更好地验证自己的输出。 换句话说,xAI把力气花在了"自我检查"这个环节上。模型不只是生成答案,还要对自己的答案做一轮核验。这个方向对知识工作类任务有意义,但从基准分数看,它还没能转化成编程场景里的优势。 目前Grok 4.7可以通过三个渠道使用:Grok API、Cursor,以及Grok Build。 低价策略的另一面 把定价和跑分放在同一张表里,逻辑就清楚了。Grok 4.7的价格贴近中国模型,而它在智能指数上处于中游、在编程基准上落后于头部选手。低价不是没有理由的让利,更像是能力定位的直接反映。 对开发者来说,选择变得具体:要顶尖的编程表现,GPT-6 Astra和Claude Fable 5.1摆在那里;要控制成本,Grok 4.7和DeepSeek V4.1 Flash都在射程内,而后者的Terminal-Bench成绩还略高一点。 xAI这次没有去争第一梯队的位置,而是把价格压下来,用"够用且便宜"来切一块市场。这条路能不能走通,取决于有多少任务其实并不需要60%的编程准确率。 特别
发表评论