刚刚,马斯克新模型撞车Claude,口碑崩了_Sonnet_Pro_上下文

完成 300 亿美元融资后,Anthropic 交出了第一份 AI 答卷。就在刚刚,Claude Sonnet 4.6 正式发布,定位是「史上最强 Sonnet」。
编程、计算机操作、长上下文推理、智能体规划,全面升级。价格没变,还是每百万 token 3 美元输入/15 美元输出,但性能直接逼近 Opus 级别。
在与 Opus 4.5 的对比测试里,用户有 59% 的时间更偏好 Sonnet 4.6。理由也很实在:过度工程化更少、幻觉更少、多步骤任务执行更稳。
💻 计算机操作能力是这次升级的重头戏。
在 OSWorld 基准测试上,Sonnet 系列过去 16 个月持续进步,现在处理复杂电子表格、填写多步骤网页表单已接近人类水平。
这个能力戳中的是一个真实痛点:很多企业的老旧软件没有现代 API 接口,过去只能专门开发连接器,现在模型直接像人一样看屏幕、点鼠标就行了,省掉了一大截工程成本。
📊 顺带一提,Excel 中的 Claude 插件这次也同步升级,新增了 MCP 连接器支持,对金融从业者来说,这个更新很实用。
Sonnet 4.6 另一个亮点是支持 100 万 token 超大上下文,足以在一次请求里塞进完整代码库、数十篇论文或一堆合同。
在 Vending-Bench Arena 这个模拟企业运营的评估里,Sonnet 4.6 摸索出一套有意思的策略:前期大举投资产能,最后阶段猛转盈利导向,靠这个转折时机甩开其他模型。支撑这套打法的,正是它的长期规划能力。
对普通用户来说,Free 和 Pro 方案的默认模型已经切换为 Sonnet 4.6,claude.ai 和 Claude Cowork 同步更新。
开发者方面,API 模型标识是 claude-sonnet-4-6,支持自适应思考、扩展思考,上下文压缩功能可以在对话快撑爆上下文时自动总结旧内容,省 token 又省心。
✊ 而就在 Sonnet 4.6 发布的同期,马斯克旗下 xAI 的 Grok 4.20 测试版也正式上线了 grok***。
Grok 4.20 支持并行调度 4 个专业智能体——Grok、Harper、Benjamin、Lucas——协同执行任务。然而整体口碑两极分化严重,且过往预期拔得太高,导致不少用户期望落空,差评偏多。
🔥 后续马斯克罕见连发多条推文灭火「救场」。他解释称,目前的 Grok 4.20 只是参数量 500B 的小型基础模型,尚处公测阶段。他还强调,Grok 4.20 的底层架构具备每周自我迭代的能力,递归式智能增长空间很大。
按他的说法,公测结束后,Grok 4.20 的智能和速度将比 Grok 4 提升约一个数量级。但这个承诺能否兑现,只能说拭目以待吧。返回搜狐,查看更多
-
{dede:pagebreak/}


网友评论:

- 大厂AI的春节焦虑:除了撒钱,别无新招?_红包_元宝_用户
- 9999人拯救天涯靠谱吗?_网友_访问_情怀
- 阿里神秘芯片公开!整体性能与H20相当,“中国版谷歌”来了?_模型_推理_Qwen
- 美团被AI扔了一个二向箔_生活_Prosus_淘宝
- 春晚同款机器人售价8.5万元?宇树客服回应:暂未上架_松延_节目_科技
- 白银跌倒,光伏能否吃饱?_凯文·沃什_黄金者_市场恐慌
- Optimus机器人泡沫破裂?马斯克承认:没有一台在工厂承担「有用的工作」_人形_特斯拉_任务
- 华米OV耀打响春节营销战:「AI年味」成为标配,今年卷出哪些新玩意?_水印_用户_功能
- 第一批跟AI“互殴”的人快要上岸了_朱旭_工具_音乐
- DeepSeek更新后被吐槽变冷变傻:比20年前的青春伤感文学还让人尴尬!业内人士:这一版本类似于极速版,牺牲质量换速度_模型_用户

- 一场伟大的胜利!国产35吨发动机横空出世,波音空客彻底慌了_中国_西方_控制市场
- 为什么车企都想要变成 AI 公司?_特斯拉_自动_人工智能
- 我国科学家世界首次发现帕金森病底层功能网络机制:临床两周有效率 55.5%,国产设备已获批_昌平_治疗
- BAT“红包大战”狂撒45亿元,谁能先超越豆包?_元宝_文心_用户
- 2026,巨头大战AI教育_作业_大厂_智学
- 一切为了Agent:千问、阶跃、Gemini打响「3.5模型大战」,春节将成关键节点?_Qwen_DeepSeek_推理
- 春晚成了机器人团建现场,「全球第一」比年货还好批发_人形_宇树_赛道
- 阿里隐藏7年的芯片王牌,终于浮出水面_国产_服务器_华为
- 咱不找机器人“代磕头”就不错了_斯基_年轻人_服务
- 千问日活逼近,豆包为什么还敢把红包留到春晚?_模型_字节_阿里


