Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

📖 文章导读:
Claude Haiku 5.5 以超低定价杀入轻量级模型战场,正面对标 GPT-6 Luna。官方定位为旗舰模型的“子代理”,在高频轻量任务中极具性价比。实测验证,Haiku 5.5 在同级对比中优势明确,编程展现出更成熟的工程化思路,但面对长程复杂规划仍边界明显。降价不等于全能,本文将深入解析 Haiku 5.5 的真实能力与选型价值。

9 月 22 日,Anthropic 发 Opus 5.5 的时候,很多人都在期待着 Sonnet 5.5 和 Haiku 5.5 的更新。

10月8日,Haiku 5.5 发布,Claude 5.5 家族现已齐全:

Opus 5.5(旗舰,$4/$20)→ Sonnet 5.5(主力,$2/$10)→ Haiku 5.5(轻量,$0.10/$0.50)

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

这次发布最瞩目的信息无外乎价格:Haiku 5.5 的 $0.10/$0.50,和 OpenAI 的 GPT-6 Luna 一分不差。

你定基准,我全盘照收,两家公司这两个月打的就是这一仗:Astra/Fable/Opus 在中高端局互相贴身,到了轻量级模型,连价签都懒得错开了。

价格之外,来看性能

发布页的 benchmark 表里,有一行数据值得注意:

Terminal-Bench 4.0(命令行多步任务):Haiku 4.5 —— 0.0%。Haiku 5.5 —— 39.2%。

上一代 Haiku 在这个基准上是刺眼的零分——不是做得好不好的问题,是一件都做不完。

而这正是整个小模型品类的真实写照:过去两年,小模型的应用场景无外乎:总结、分类、改写、翻译;但凡任务需要长程规划,Sorry,做不到。

来更直观地看下 Haiku 从4.5 到 5.5 版本的提升:

基准Haiku 4.5Haiku 5.5提升
知识工作 GDPval-AA73516202.2×
办公任务 AA-Briefcase61415782.6×
计算机操作 OSWorld 2.115.70%72.40%4.6×
跨学科推理 HLE(无工具)10.20%45.90%4.5×
命令行任务 Terminal-Bench0.00%39.20%从零到有
图表理解 Chartography6.40%46.40%7.2×

提升明显,但依然别拿它和旗舰比。官方是用中端主力 Sonnet 5.5 当参照:Terminal-Bench 70.6%、OSWorld 83.9%。

这组数字真正的信息是:小模型的能力边界,从不能变成了入门。 OSWorld 72.4% 意味着 Haiku 级模型第一次能胜任真实的电脑操作任务;Terminal-Bench 39.2% 意味着它能接住四成「需要连续执行几十步」的任务。

官方给的明确定位:Subagent

官方对Haiku 5.5 给到了很明确的产品定位描述:

摘要、压缩(compaction)、数据库查询、分类,这类快速且重复的工作;加上它的高速,适合在线客服和浏览器操作这类对延迟敏感的任务;以及,作为 Opus/Sonnet 的 subagent 参与编码工作。

用过 Agent 编程的都对这个场景不陌生:Opus 在大脑里规划十分钟的代码架构,期间需要有人翻文档、查日志、跑测试、做摘要——让旗舰干这些,显然大材小用。

Haiku 5.5 的官方定位就是来干跑腿活的:它配了 5.5 家族同款自适应思考 + effort 档位调节(Haiku 级首次),任务简单就压低档位,任务复杂就调高档位;1M token 上下文窗口、128k 输出,浏览器操作工具原生支持。

榜单排名

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

目前在 Artificial Analysis 榜单中排名31位,Flash级别模型中排名第一。

用户评价

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

基准数据之外,实测见真章。302.AI将针对 Haiku 5.5 与 GPT-6 Luna 展开实测对比,看看 Haiku 5.5 能否凭借低价和能力提升,在同级模型中有着明显优势。


1. Claude Haiku 5.5 模型基础信息

(1)实测模型在 302.AI 的价格:

模型名称上下文说明302.AI内的价格
claude-haiku-5-5100000≤ 100K Tokens缓存写入 $0.1063 / 1M tokens缓存读取 $0.0085 / 1M tokens输入 $0.085 / 1M tokens输出 $0.425 / 1M tokens
> 100K Token缓存写入 $0.53125 / 1M tokens缓存读取 $0.0425 / 1M tokens输入 $0.425 / 1M tokens输出 $2.125 / 1M token
gpt-6-luna272000≤ 272K缓存写入 $0.125 / 1M tokens缓存读取 $0.01 / 1M tokens输入 $0.1 / 1M tokens输出 $0.5 / 1M tokens
1050000> 272K缓存写入 $0.25 / 1M tokens缓存读取 $0.02 / 1M tokens输入 $0.2 / 1M tokens输出 $0.75 / 1M tokens

(2)测评目的:

本评测侧重模型对逻辑,数学,编程,多模态,人类直觉等问题的测试,非专业前沿领域的权威测试。旨在观察对比模型的进化趋势,提供选型参考。

(3)测评方法:

本次测评使用302.AI收录的题库进行独立测试。模型分别就逻辑与数学(共10题),人类直觉(共7题),多模态(共20题)以及编程模拟(共12题)进行案例测试,对应记分规则取最终结果,下文选取代表性案例进行展示。

题库地址:https://docs.google.com/spreadsheets/d/1sBxs60yWsxc9I5Va8Rjc1_le1Omg2hOXbwqOzpImZio/edit?gid=0#gid=0

💡记分规则:

按满分10分记分,设定对应扣分标准,最终取每轮得分的平均值。

(4)测评工具:

  • 所有模型均在302.AI Stuidio客户端内使用对应模型,使用统一的提示词,取第一次生成结果
  • 编程测试使用302.AI Stuidio客户端的Vibe模式:调用Claude Code沙盒

编程案例分数评级:

⭐⭐⭐⭐⭐ S 级(封神): 行业标杆,重新定义标准。

⭐⭐⭐⭐ A 级(卓越): 生产力合格,无明显短板。

⭐⭐⭐ B 级(优秀): 表现中规中矩,存在短板。

⭐⭐及以下 C级(不合格): 不可用,存在明显问题。


2. Claude Haiku 5.5 测试结果总览

302.AI 多模态模型测评分数榜单:

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

3. Claude Haiku 5.5 案例展示

案例 1:多模态推理

提示词:找出与其他图形规律有区别的一项

答案:蓝色正方形

解析:每个图形都有一个对应的异色复制项,但蓝色正方形没有

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

Claude Haiku 5.5:推理正确,规律逻辑清晰。

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

GPT-6 Luna:推理错误,图形观察力不足。

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

案例 2:程序化 SVG 图形生成

绘制一幅运动员在网球对打的动态svg图

Claude Haiku 5.5 输出效果:

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

GPT-6 Luna 输出效果:

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI
绘制一幅马快跑到河边饮水的动态svg图

Claude Haiku 5.5 输出效果:

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

GPT-6 Luna 输出效果:

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

简评:

Claude Haiku 5.5 在图形构成复杂度和动态表现上都略优于 GPT-6 Luna

测评点Claude Haiku 5.5GPT-6 Luna
语义表达准确度⭐⭐⭐⭐⭐⭐⭐⭐⭐
图形构造复杂度⭐⭐⭐⭐⭐⭐⭐
动态实现质量⭐⭐⭐⭐⭐

案例 3:3D 跑酷小游戏

Create a polished 3D endless runner game as a single self-contained HTML file.
The gameplay should be inspired by the familiar mechanics of mobile endless runners: the character automatically runs forward along a multi-lane path, while the player can switch lanes, jump, slide, and dodge obstacles. Add collectible items, increasing speed, score tracking, and game-over/restart states.
Create a completely original setting, characters, environment, and visual identity. Do not copy the visual style, characters, locations, props, UI, or assets of any existing game. Use a stylized 3D aesthetic with a strong sense of depth and motion.
Include:
Smooth third-person camera following the character
Three-lane movement with responsive controls
Jumping, sliding, and obstacle avoidance
Procedurally generated sections so the run can continue
Moving obstacles and varied environmental hazards
Collectibles and score progression
Increasing difficulty and speed
Polished animations, lighting, particles, and camera effects
Keyboard and mouse controls
A clear start screen, HUD, game-over screen, and restart button
The final result should feel like a complete, polished 3D mini-game rather than a technical demo.

Claude Haiku 5.5 输出效果:

完整网页:https://brws8clozm.302ai.app

录屏展示:

简评:

✅ 核心优势:

  1. 工程化架构更强,障碍物使用对象池,赛道采用分段循环回收,状态机制清晰;
  2. 反馈与音效完善,跳跃换道/金币/撞击设有不同音效,碰撞时有屏幕震动和红屏径向渐变反馈;
  3. 玩家动画更细节,虽图形简单,但设有换道时身体侧倾、假投影随高度缩放变淡等细节;
  4. 区分了点击(短时)跳跃、横滑换道、上滑跳跃、下滑滑铲四种手势,逻辑更精细。

❌ 不足之处:

  1. 相机偏静态,缺少 FOV 随速度变化、加速时的拉远等动态效果;
  2. 金币串偶尔与障碍重叠,可能出现 z 轴与下一行障碍物在同一车道冲突,没有全局避让检查。

GPT-6 Luna 输出效果:

完整网页:https://r4q3ejznde.302ai.app

录屏展示:

简评:

✅ 核心优势:

  1. 有明确的三种障碍几何(矮/横杆/门框),视觉上区分度尚可;
  2. 玩家模型有”人形”结构,腿部有跑步摆动动画;
  3. 使用 PCFSoftShadowMap 渲染管线配置更加现代。

❌ 不足之处:

  1. 对象管理原始,每个障碍/金币都没有对象池,长时间运行会有 GC 压力;
  2. 玩法判定粗糙,只要有跳跃动作就无脑过,不考虑障碍实际高度;
  3. HUD 简单,只有距离和金币,没有速度条、没有最佳成绩、没有开始/结束画面细节。
测评点Claude Haiku 5.5GPT-6 Luna
玩法创意性⭐⭐⭐⭐⭐⭐
视觉执行力⭐⭐⭐⭐⭐⭐
技术实现⭐⭐⭐⭐⭐⭐

案例 4:网页设计

Create a polished, interactive editorial website titled “The Making of a Painting”, exploring how Vincent van Gogh created The Starry Night.
Design it as an immersive digital art exhibition, not a standard gallery or information page. Use elegant typography, generous whitespace, subtle paper textures, large artwork, and a restrained palette inspired by the painting.
Structure the experience as a visual journey:
Opening: Full-screen artwork, title, artist, year, and subtle background motion.
The Context: Explore the painting’s historical background, creation, and Van Gogh’s circumstances through archival imagery and concise text.
The Sketch: Present preparatory sketches with hover/zoom interactions and a transition from sketch to finished painting.
Color & Composition: Interactive highlights reveal how colors, stars, moon, village, and cypress tree shape the composition.
The Brushwork: Zoom into swirling brushstrokes, using subtle animation to emphasize texture and movement.
The Finished Painting: Dramatically reveal the complete artwork with essential details and a brief interpretation.
Legacy: Conclude with a visual timeline tracing the painting’s cultural influence.
Use scroll-driven transitions, parallax, image reveals, hover effects, zoomable artwork, and smooth typography animations. Keep motion subtle and purposeful, like a curated museum exhibition.
Make the website fully responsive, with coherent storytelling, strong visual hierarchy, polished interactions, and high-quality external images where appropriate. Prioritize visual storytelling, editorial design, and atmosphere over complex UI components.

Claude Haiku 5.5 输出效果:

完整网页:https://9bgyfqemop.302ai.app

录屏展示:

简评:

✅ 核心优势:

  1. 叙事结构完整,七个章节+尾声部分,视觉节奏一致,信息学术度较高;
  2. 图片策略更稳健,每张 <img> 都带备用 URL,加载失败时自动切换备用路径,性能优化意识明确;
  3. 交互设计更精细,设有线稿视图到彩绘平滑过渡、图画放大镜、增强互动感;
  4. 视觉细节考究,Hero背景采用星空插画,制造景深效果,纸纹背景区分明暗效果;

❌ 不足之处:

  1. 代码体量偏大,部分 CSS 有轻微冗余,维护成本高;
  2. 没有针对每张图做 object-position微调,某些细节可能被裁掉。

GPT-6 Luna 输出效果:

完整网页:https://b2wxfbgb0h.302ai.app

录屏展示:

简评:

✅ 核心优势:

  1. Hero 设计克制优雅,排版采用高级的编辑设计手法,字体组合具有艺术感;
  2. 响应式断点更细,对 hero、facts、timeline、footer 逐项调整,导航在移动端隐藏中间两项,处理细致;

❌ 不足之处:

  1. 叙事完整度略逊色,信息量单薄;
  2. 图片(包括Hero大图)没有做加载态,首屏负担重,部分图片可能加载不出;
测评点Claude Haiku 5.5GPT-6 Luna
视觉与交互⭐⭐⭐⭐⭐⭐⭐
技术实现⭐⭐⭐⭐⭐⭐⭐
用户意图理解⭐⭐⭐⭐⭐⭐⭐

4. Claude Haiku 5.5 模型实测结论

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

如果只看同级对手,Claude Haiku 5.5 这次确实交出了一份更有竞争力的答卷。对比 GPT-6 Luna,其基础领域的表现整体占优,编程实现也展现出更成熟的工程思路。

不过,降价解决的是使用门槛的问题,能力边界却仍不容忽视,集中表现为在复杂编程和高难度的自主执行任务上,Haiku 5.5 与旗舰模型之间仍存在差距。

1. 横向对比:同级里最能打的那一个

从本次实测来看,Haiku 5.5 在同级模型中具备相当不错的综合竞争力。

Haiku 5.5 在多模态推理和 svg 绘制均略胜 GPT-6 Luna,而真正拉开差距的部分在于编程领域,应对 3D 跑酷小游戏和主题网页设计这类更复杂的任务,Haiku 5.5 的优势进一步体现在了工程细节和内容完成度上:前者有较完整的对象管理、操作反馈和游戏状态设计,后者则通过展览级的叙事、互动性的线稿与彩绘过渡、细节放大等交互,交付了完成度更高的作品。Luna 在部分视觉设计和响应式布局上同样有亮点,但论综合功能完整度与实现质量,在这个价位能正面打赢它的,只有 Haiku 5.5。

2. 单价降九成,但账要分开算

这波降价可以说是 Haiku 有史以来最狠的一次,起步价只有上一代的十分之一。关键点在于它分了两档:10 万 token 以内的请求(占了 Haiku 4.5 九成的量),输入输出直接砍九成,每百万 token 输入 $0.10、输出 $0.50,配合首次加入的五档 effort 设置,开发者可以根据任务难度调整推理投入。摘要生成、内容分类、信息提取,以及需求和验收标准都很明确的小型编程任务,都有机会从这次升级中受益。

这批高频任务换算过来确实划算,但便宜账真的经得起细算吗?

Haiku 5.5 更换了分词器,相同内容的 Token 消耗可能增加约 30%;在高 effort 和 Agent 多轮调用场景下,额外的思考 Token、反复执行与上下文累积也会推高成本。提示词超过 10 万 Token 后,输入和输出价格还会分别提高至每百万 Token 0.50 美元和 2.50 美元。因此,评估它的性价比,最好把完整任务的成功率、Token 用量、重试次数和执行时间一起纳入计算。只看 API 单价,很容易高估它的降本幅度。

3. 执行层进化,能力边界仍明显

Haiku 5.5 的真实价值在于“被调度”,而不是“挑大梁”。

Anthropic 推荐将 Haiku 5.5 用作高阶模型的子代理,也符合它当前的能力定位:由旗舰模型负责拆解和统筹,让 Haiku 承担边界清晰、方便并行的执行工作。因为 Haiku 5.5 的进步集中在执行层:电脑操作 OSWorld 从 15.7% 冲到 72.4%,无工具 HLE 成绩从 10.2% 来到 45.9%,处理路径清晰的执行任务相当能打,做摘要、分类、压缩上下文、当子代理都是它的主场。

然而,一旦任务依赖常识和世界知识,短板就暴露了——对于需要根据现实情况自动补全的任务,其表现会明显劣化,这正是一个模型世界知识储备不足的典型特征。编程的差距最直观:Terminal-Bench 仅达到 39.2%,Sonnet 5.5 则是 70.6%,对于复杂多步的编码、跨文件重构、长周期自主规划,Sonnet 或 Opus 依然是首选。

因此,将 Haiku 5.5 放进一个由旗舰模型指挥的流水线里,才真正谈得上便宜、迅速和够用。

总体来看,Haiku 5.5 算是一次有分量的小模型升级。同级对比有优势,价格也足够有竞争力,适合高频、标准化和任务边界清楚的工作流,值得用来压低一部分任务的成本。


常见问题 FAQ

Q1:Claude Haiku 5.5 是什么?和 Haiku 4.5 有什么区别?

Claude Haiku 5.5 是 Anthropic 于 2026年9月22日发布的低价小模型,是 Haiku 系列有史以来降价最狠的一次——10 万 Token 以内的请求输入输出直接砍九成(输入 $0.10、输出 $0.50/百万 Token),并首次加入五档 effort 设置。相比 Haiku 4.5,能力实现阶跃:OSWorld 计算机操作从 15.7% 冲到 72.4%,Terminal-Bench 命令行任务从 0% 做到 39.2%,图表理解 Chartography 提升 7.2 倍。小模型的能力边界从「不能」变成了「入门」。

Q2:Claude Haiku 5.5 和 GPT-6 Luna 怎么选?

两款都是 $0.10/$0.50 的同价位轻量模型。302.AI 实测对比显示 Haiku 5.5 整体占优:多模态推理和 SVG 绘制略胜 GPT-6 Luna,编程领域差距更大——3D 跑酷小游戏有完整的对象管理、操作反馈和状态设计,网页设计交付了展览级叙事与精细交互,工程思路更成熟。如果在这个价位选执行型小模型,Haiku 5.5 目前是同级里最能打的那一个。

Q3:Claude Haiku 5.5 的价格怎么算?有哪些隐性成本?
“`html

Q4:Claude Haiku 5.5 的编程能力如何?

进步显著但仍是短板。Terminal-Bench 4.0 从零分做到 39.2%,302.AI 实测中 3D 跑酷和网页设计案例展现出对象池、分段循环回收、图片备用 URL 等成熟工程思路,在同级里最能打。但参照官方给出的中端 Sonnet 5.5(Terminal-Bench 70.6%)可以看出差距:复杂多步编码、跨文件重构、长周期自主规划,仍应首选 Sonnet 或 Opus。

Q5:什么是 Subagent 定位?Haiku 5.5 应该怎么用?

Anthropic 官方给 Haiku 5.5 的明确定位是 Subagent(子代理):由旗舰模型负责拆解和统筹,Haiku 承担边界清晰、方便并行的执行工作。它的进步集中在执行层——电脑操作、摘要、分类、信息提取这类路径清晰的任务相当能打;但任务依赖常识和世界知识、需要自动补全现实情况时表现会明显劣化。一句话:Haiku 5.5 的真实价值在于被调度,而不是挑大梁。

Q6:Claude Haiku 5.5 的能力边界在哪里?

三类任务不建议交给 Haiku 5.5:1)复杂编程——Terminal-Bench 39.2% vs Sonnet 5.5 的 70.6%,跨文件重构和多步编码会翻车;2)高难度自主执行——长周期规划、动态应变仍与旗舰有差距;3)依赖世界知识的任务——需要根据现实常识自动补全的场景表现明显劣化,这是小模型知识储备不足的典型特征。它的舒适区是高频、标准化、边界清楚的工作流。

Q7:Haiku 5.5 适合哪些场景?

适合四类高频任务:1)摘要生成、内容分类、信息提取等标准化处理;2)OSWorld 类计算机操作任务(72.4% 意味着 Haiku 级模型第一次能胜任真实电脑操作);3)流水线中的并行执行子任务——旗舰拆解后分发,多路同时跑;4)需要压低成本的批量调用。配上五档 effort 设置,开发者可以按任务难度调节推理投入,把每一分钱花在刀刃上。

Q8:如何在 302.AI 上调用 Claude Haiku 5.5 API?

在 302.AI 调用 Claude Haiku 5.5 有三种方式:1)客户端——对话框选择模型菜单输入 claude 获取对应版本;2)聊天机器人——应用超市→聊天机器人→Anthropic模型→claude-haiku-5-5→确认;3)API——API超市→语言大模型→Anthropic→claude-haiku-5-5→点击 Playground 在线调用。302.AI 按需付费、无需月费,适合把高频小任务批量迁移过来压成本。

5. 如何在 302.AI 上使用

1. 使用302.AI客户端

步骤指引:对话框内选择模型菜单

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

输入haiku即可获取相应版本调用

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

2. 聊天机器人中使用

步骤指引 :应用超市→聊天机器人→立即体验

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

选择模型:Anthropic模型→claude-haiku-5-5→确认

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

3. 使用模型 API

步骤指引:API超市→语言大模型→Anthropic→claude-haiku-5-5

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

点击【Playground】在线调用 API

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

想即刻体验 Claude Haiku 5.5 模型?

👉立即注册免费试用302.AI,开启你的AI之旅!👈

为什么选择302.AI?

● 灵活付费:无需月费,按需付费,成本可控

● 丰富功能:从文字、图片到视频,应有尽有,满足多种场景需求

● 开源生态:支持开发者深度定制,打造专属AI应用

● 易用性:界面友好,操作简单,快速上手

Claude Haiku 5.5 实测:价格砍九成,对标 GPT-6 Luna | 302.AI

All Rights Reserved by 302.AI
赞 (0)
302.AI
上一篇 2026 年 9 月 29 日 下午4:58
下一篇 2025 年 7 月 23 日 上午11:20

相关推荐

  • Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

    📖 文章导读: SpaceXAI 发布 Grok 4.7,主打性价比前沿。不是最强,但同价能力大幅升级。结合跑分与实测,其长程复杂任务表现有所提升,竞争力集中于单价与定位,然而通用能力仍有短板,且复杂任务 Token 消耗大易生隐性成本。它是“定价封顶”打法下的专项性价比之选,选型需权衡隐性消耗。 9月22日,SpaceXAI 正式推出最新旗舰模型——Gro…

    2026 年 9 月 29 日 • 基准实验室
    2.6K0
  • 务实派旗舰 GPT-6 Sol 实测:既然打不过对手,价格先砍一半 | 302.AI

    📖 文章导读:9月22日,OpenAI 推出 GPT-6 Sol 与 Luna,以直降 50% 的定价和升级的缓存机制正面硬刚 Anthropic。本期针对 GPT-6 Sol 的实测显示,模型表现稳定,工程实现力有所提升,虽未展现碾压级突破,但凭借“够用且便宜”的优势,或可成为长周期 Agent 及批量任务的高性价比首选。 9 月 22 日,Anthrop…

    2026 年 9 月 24 日 • 基准实验室
    2.0K0
  • DeepSeek-V4.1-Flash 实测:552B新架构,原生多模态,正式接棒V4 Pro | 302.AI

    📖 文章导读:9 月 10 日,DeepSeek V4.1 Flash发布。新模型采用全新架构,原生补齐多模态,大幅压缩KV Cache并下调价格,正式接棒V4 Pro。本期测评通过真实任务实测发现,其展现出逼近甚至局部超越 Pro 的能力,性价比极高。虽极限复杂任务仍有瑕疵,但“Pro 级能力、Flash 级价格”已初步坐实。一文解析其实战表现与选型参考。…

    2026 年 9 月 11 日 • 基准实验室
    2.5K0
  • GPT-6 Astra 实测:Computer Use 突破,AGI 还是高阶 Agent?| 302.AI

    📖 文章导读:AGI 时代已来?OpenAI 发布 GPT-6 Astra 引热议。新模型在推理与编程效果上表现惊艳,更带来突破性的 Computer Use 能力,让 AI 像人类一样自主操作电脑。究竟是 AGI 降临还是高阶 Agent?本期实测将其放入真实工作场景,围绕多模态、3D构建及电脑操作等维度展开实测,一探其实际表现。 每隔几个月,AI 圈就会…

    2026 年 9 月 9 日 • 基准实验室
    1.2K0

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注