ARTICLE DETAIL

RB88手机官网 - 全新发布:Claude Haiku 5.5来袭,价格暴跌至原价的十分之一

聚焦关键信息、背景脉络与核心观点,让一篇内容不仅便于阅读,也更容易形成完整理解。

RB88手机官网 - 全新发布:Claude Haiku 5.5来袭,价格暴跌至原价的十分之一

刚刚,Anthropic 宣布推出其最新产品 Claude Haiku 5.5,令人震惊的是它的定价仅为上一代 Haiku 4.5 的十分之一,甚至是 Sonnet 5.5 的二十分之一,与 OpenAI 的 GPT-6 Luna 定价一致。根据官方披露的性能测试结果,Haiku 5.5 在六项关键指标上全面战胜 Luna,且在多项测试中压制了 Sonnet 5.5,展现出强大的竞争力。

about image

在操作系统领域,OSWorld 的得分从之前的 15.7% 飙升至 72.4%,与 Sonnet 5.5 之间仅相差 11.5 个百分点。而在终端编程的 Terminal-Bench 4.0 测试中,Haiku 5.5 也从一分未得跃升至 39.2%。在知识工作方面,GDPval-AA 的得分达到了惊人的 1620 分,超过了上一代更多的两倍。在被称为“人类最后的考试”的 HLE 测试中,Haiku 5.5 从 10.2% 攀升至 45.9%,展现了显著的能力提升。

在实际的费用计算上,Haiku 5.5 的定价相当具吸引力:每百万 Token 的输入费用仅为 0.10 美元,输出费用为 0.50 美元。这一费用适用于10万 Token 以内的请求。超过这一限额时,输入费用为 0.50 美元,输出则为 2.50 美元。缓存读取的成本为每百万 Token 0.01 美元,力度减半的批处理功能更是带来了显著的成本削减。根据官方测算,相较于 Haiku 4.5,Haiku 5.5 在相同任务上能节省约 75% 的开支,这意味着预算能支持四倍的调用量。尽管没有达到九成的节省,因超过 10 万 Token 的请求仍然享有相对较低的折扣,但因绝大多数请求仍在此范围内,新分词器技术还会增加约 30% 的 Token。 RB88手机官网

在与 GPT-6 Luna 的价格对比中,两者在10万 Token 以内的输入、输出和缓存定价几乎完全相同。只是在处理长上下文时,Luna 显得更具价格优势,直到 27 万 Token 才开始涨价,涨后输入费用为 0.20 美元,输出为 0.75 美元。同时,Sonnet 5.5 的缓存读取费用在发布当日也减半,从 0.20 美元降低至 0.10 美元,促使大多数 Agent 任务的成本下降约 20%。

同时,对于 Max 和 Team 的用户,Anthropic 还推出了月度 API 使用额度。Max 5x 用户可获得 100 美元额度,Max 20x 用户可获取 200 美元额度,而 Team 用户则有500美元的额度可供全队共享,能够在 Claude Platform 的多个模型之间使用。

尽管 Haiku 5.5 在评分上压过了 Luna,但在复杂编程任务上仍与 Sonnet 5.5 存在差距。相较于其前代产品,Haiku 5.5 的性能得到了极大的提升。在电脑操作的 OSWorld 测试中,它的得分从 15.7% 激增至 72.4%,进一步超越了 Luna 的 48.9%,在成本上也表现更加优异,为相同性能下的投入降低了不少。在知识工作方面,Haiku 5.5 的 1620 分超越 Luna 的 1437 分,虽然与 Sonnet 5.5 的 1840 分仍有差距,但在基本的 Medium 模式下,它亦能获得 1277 分的优异表现。 RB88手机官网

在长线项目的 AA-Briefcase 测试中,Haiku 5.5 的得分由先前的 614 分提升至 1578 分,Luna 在同一测试中的得分则为 1336 分。在推理及图形处理方面,Haiku 5.5 在 HLE 测试中达到 57.4%,而 Sonnet 5.5 得分为 64.5%。在专业图表的 Chartography 测试中,Haiku 5.5 的得分亦实现了明显提升,从之前的 6.4% 增至 46.4%,相比之下,Luna 为 29.1%,Sonnet 5.5 为 61.6%。在编程方面,Haiku 5.5 的 39.2% 成绩是 Luna 16.4% 的两倍多,但显然与 Sonnet 5.5 的 70.6% 仍有相距。

about image

官方也明确指出,对于复杂的 Agent 编程任务,仍建议用户选择 Sonnet 5.5 和 Opus 5.5。Haiku 5.5 的目标定位为大数据量、高效且经济实惠的应用场景,包括文本摘要、上下文压缩、数据库查询、任务分类等。作为目前速度最快的 Claude 模型,Haiku 5.5 的表现仅次于开启快速模式的 Opus,适合于实时客服和浏览器操作。

此外,官方还分享了一些在内测过程中得到反馈的明星 AI 应用公司的使用体会。 Asana 方面的测试结果显示,其任务完成的时间延迟比现有模型降低了超过三成,而 Box 的反馈则表明 Haiku 5.5 的延迟仅为 Haiku 4.5 的一半。另一个主要应用场景是将 Haiku 5.5 作为 Opus 或 Sonnet 的子 Agent,利用大模型的能力进行任务拆解与决策支持。 RB88手机官网

about image

觉得有用?分享给朋友

让更多人看到这篇内容

RECOMMENDED READS

推荐阅读