价格打骨折!小模型卷到一分钱时代
距离上一代Haiku发布快一年,Anthropic终于更新了这条最小号的产品线。
美国当地时间10月7日,Claude Haiku 5.5正式上线。最引人注意的是价格:输入每百万token仅0.1美元,输出0.5美元,直接降至上一代Haiku 4.5的十分之一,也与OpenAI上个月发布的GPT-6 Luna持平。
但Anthropic这次显然不只是来打价格战的。
作为一款定位更轻量、速度更快的模型,Haiku 5.5这次重点补上了Haiku 4.5在编程、电脑操作和知识工作上的短板。
小模型的战争,从比谁更便宜,进入了比谁又便宜又好用的阶段。
01 小模型不再“凑合用”
Haiku 4.5发布于将近一年前。当时,它已经是Anthropic面向速度和成本优化的小模型,但放到今天的新一代模型竞争中,短板已经越来越明显。GDPval-AA知识工作测试只有735分,OSWorld电脑操作15.7%,Terminal-Bench编程干脆是0分。
Haiku 5.5则把这些短板几乎全补上了。
在知识工作、电脑操作和编程等测试中,Haiku 5.5相比上一代都有明显提升。其中,GDPval-AA v2.1拿到1620分,是Haiku 4.5的两倍多,也超过了GPT-6 Luna的1437分。
AA-Briefcase知识工作测试中,Haiku 5.5达到1578分,同样高于Luna的1336分。OSWorld 2.1离线子集得分72.4%,Luna为48.9%,Haiku 4.5则只有15.7%。
编程能力的提升尤其明显。Terminal-Bench 4.0中,Haiku 4.5此前得分为0%,Haiku 5.5已经提升至39.2%。
小模型竞速赛,左起依次为OpenAI CEO奥特曼、谷歌CEO皮查伊、Anthropic CEO阿莫迪。
第三方测评机构Artificial Analysis给出的智能指数为43分,比Haiku 4.5提升26分,略高于GLM-5.3 Flash的42分和Gemini 3.8 Flash的41分,与Kimi K3的44分相当,低于自家Sonnet 5.5的56分。
在智能知识工作上,Haiku 5.5(Max模式)在AA-Briefcase上达到1578 Elo,领先于Kimi K3和GLM-5.3等模型,与Muse Spark 1.3(Max模式)相当。
不过小模型毕竟是小模型,事实知识方面还有差距。AA-Omniscience准确率只有36%,而Gemini 3.8 Flash是55%,GPT-6 Luna是44%。
还有一项测试Haiku 5.5表现不太好:AutomationBench-AA只拿了35%,而Luna、Gemini 3.8 Flash和GLM-5.3 Flash都在53%到60%之间。Artificial Analysis指出,这可能是因为安全策略导致模型过度拒绝,Anthropic正在修复,修复后分数预计会上升。
另外,Haiku 5.5是首款支持可调模式设置的Haiku模型,默认采用Medium模式,共提供Low、Medium、High、xhigh和Max五档。模式越高,模型会投入更多计算资源,通常也能获得更好的表现,但token消耗也会随之增加。
02 便宜到可以随便用
参数和跑分是一回事,实际用起来是另一回事。Haiku 5.5发布当天,不少开发者就上手试了,留下了各种有意思的测试。
独立开发者西蒙·威廉姆森(Simon Willison)拿它试了生成鹈鹕骑自行车的SVG图。在Low模式下,Haiku 5.5 7秒钟花了0.0936美分,鹈鹕的自行车车架还算完整。Max模式下,耗时5分9秒,但也只花了3.3826美分。
生成的描述里,白鹈鹕戴着红帽子,长橙腿踩在橙色踏板上,一只灰翅膀伸出去握车把,大喙指向前方,身后有白色速度线,头顶是太阳和云彩。作为对比,一年前Haiku 4.5画的鹈鹕“身体是圆的黄褐色,喙是粉色的”,基本不对。
AI分析师@NFT_Chen做了斑马草原SVG的对比测试。
Haiku生成的斑马,条纹顺着身体走向,奔跑时前后腿错开,近草有层次、远树压在山脊上,斑马踩进草里有尘土和影子。而Luna的斑马"乱线穿腹,肚子鼓成椭圆,腿像木棍乱戳",背景的树像贴上去的剪影,斑马浮在画面中间和草地对不齐。
@NFT_Chen总结称: “同一张草原,一个在跑,一个在漂。竞争让世界更美好,前提是先画对!”
但也不是所有测试Haiku都赢。
AI基准测评账号@bridgemindai做了熔岩灯测试,Haiku 5.5“完全无法通过”,生成的东西“没有玻璃,没有熔岩,只是一个黄色圆柱体”,耗时4分34秒,成本0.03美元。而GPT-6 Luna在42.8秒内做出了一个真正的熔岩灯,成本不到一美分,速度快6倍以上。
@bridgemindai的火箭发射测试也是类似的结果。Haiku花了0.05美元、6分58秒构建了一个干净的场景,而Luna用不到一分钱、1分5秒就完成了,速度快了6倍。
企业客户的反馈更偏向实际场景。Asana的高级软件工程师亚伦·文(Aaron Vinh)说,他们把Haiku 5.5用在AI Teammates产品上,处理bug分类、项目搭建、搜索大型项目组合等任务,任务完成延迟降低了30%以上,每个代理轮次的推理速度最快提升2.5倍。
Box的AI产品副总裁亚绍达·巴夫纳尼(Yashodha Bhavnani)表示,Haiku 5.5比Haiku 4.5得分高11分,延迟只有大约一半,适合大规模运行的分析工作,比如成本报告、财务摘要和每周定期回顾。
03 90%降价背后的算盘
Haiku 5.5最引人注目的还是价格。10万token以内的请求,输入每百万0.1美元,输出0.5美元,缓存读取只要0.01美元,缓存写入0.125美元。相比Haiku 4.5的1美元输入、5美元输出,降价幅度达到90%。
不过这里有个门槛:超过10万token之后,Haiku 5.5价格涨到5倍:输入0.5美元、输出2.5美元、缓存读取0.05美元、缓存写入0.625美元。即便如此,也比上代模型便宜了50%。
Anthropic对此解释称,大约90%的Haiku 4.5请求都在10万token以下,所以对大多数用户来说,相当于直接打了一折。考虑到新的分词器会多用大约25%的token,整体平均节省大约75%。
除了Haiku本身的降价,Anthropic还顺带调了Sonnet 5.5的价格。Sonnet的缓存读取从每百万token 0.2美元砍到0.1美元,正好是原来的一半。因为缓存读取在智能体工作中占了很大比例,Anthropic估算大多数智能体任务的成本能降约20%。
还有一项新福利是给订阅用户的API积分。Max 5x用户每月100美元,Max 20x用户每月200美元,Team订阅用户最多500美元(团队共享)。积分可以用在平台上任何模型上,而且正好等于订阅费本身,相当于订阅费全额返还成API额度。威廉姆森评价这"真的很慷慨",让订阅用户用API的门槛低了很多。积分当月有效,不滚存。
04 小模型大战开打
Haiku 5.5的发布,把小模型赛道的竞争推向了白热化。
在此之前,OpenAI的GPT-6 Luna凭借0.1美元的低价和不错的性能,在小模型领域几乎没有对手。现在Anthropic直接把价格拉平,性能上还略占优势。
但如果把视野放宽到全球,情况更复杂。中国的几个小模型价格更低。Qwen3.7 Flash在阿里国际站上,3.2万token以内输入只要0.03美元、输出0.13美元;3.2万到25.6万token之间是0.1美元输入、0.4美元输出,比Haiku还便宜。智谱的GLM-5.3-Flash在GDPval-AA v2.1上拿了1647分,比Haiku 5.5的1620还略高一点。
威廉姆森提到,Haiku 4.5刚出来的时候还不算贵,但一年过去,竞品已经把价格打到了它的十分之一。这次Haiku 5.5追平Luna的价格,更像是被动应战,而不是主动引领。
从定位上看,Anthropic给Haiku 5.5安排的角色很明确——干杂活的。文档摘要、信息分类、数据库查询、给大模型当子智能体、实时客服、浏览器操作,这些量大、对速度敏感、对极致精度要求不那么高的任务,是Haiku的主战场。复杂的编码工作还是交给Sonnet和Opus。
TechCrunch记者弗雷德里克·拉迪努瓦(Frédéric Lardinois)指出,决策模型(比如Jev)现在也在这个价格带里搅局,而且价格更低。小模型的用途正在从传统的摘要分类,扩展到智能体工作流里的各种轻量任务。
对开发者来说,真正的考验,是Haiku 5.5能不能稳定、可靠地完成那些目标明确、边界清晰的任务,并且经得起反复调用。价格降了这么多,使用门槛确实低了不少,但跑分和实际体验之间仍有距离,最终能不能成为开发者愿意长期使用的工具,还需要更多项目和实际应用来验证。
