<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>选型 on 搬砖程序员带你飞</title>
        <link>https://lpflpf.cn/tags/%E9%80%89%E5%9E%8B/</link>
        <description>Recent content in 选型 on 搬砖程序员带你飞</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-CN</language>
        <managingEditor>lipengfei634626165@163.com (lpflpf)</managingEditor>
        <webMaster>lipengfei634626165@163.com (lpflpf)</webMaster>
        <lastBuildDate>Thu, 08 Oct 2026 08:30:00 +0800</lastBuildDate><atom:link href="https://lpflpf.cn/tags/%E9%80%89%E5%9E%8B/index.xml" rel="self" type="application/rss+xml" /><item>
            <title>Mistral Large 4 先别急着接 agent——官方说 1M 上下文，你实际能调到的只有 512K</title>
            <link>https://lpflpf.cn/posts/mistral-large-4-reality-check-2026-10-08/</link>
            <pubDate>Thu, 08 Oct 2026 08:30:00 +0800</pubDate><author>lipengfei634626165@163.com (lpflpf)</author>
            <guid>https://lpflpf.cn/posts/mistral-large-4-reality-check-2026-10-08/</guid>
            <description>&lt;img src=&#34;https://cdn.lpflpf.cn/covers/mistral-large-4-reality-check-plain.jpg&#34; alt=&#34;Featured image of post Mistral Large 4 先别急着接 agent——官方说 1M 上下文，你实际能调到的只有 512K&#34; /&gt;&lt;p&gt;10 月 6 日 Mistral 发了新旗舰 Large 4，内部昵称 &lt;em&gt;le Chonk&lt;/em&gt;。发布页的卖点很整齐：开放权重、1 万亿参数、1M 上下文、&amp;ldquo;显著超越欧美所有开源模型&amp;rdquo;。如果你正在维护一个跑在现有模型上的 agent 或代码助手，看完的第一反应大概是——既便宜又强，是不是该换了。&lt;/p&gt;&#xA;&lt;p&gt;先别动。这篇把官方口径和你今天实际能拿到的东西之间的四处落差摊开：上下文是 &lt;strong&gt;512K 不是 1M&lt;/strong&gt;、预览期&lt;strong&gt;没有权重可下&lt;/strong&gt;、价格有&lt;strong&gt;两张脸&lt;/strong&gt;、跑分漂亮&lt;strong&gt;不等于能塞进 agent 循环&lt;/strong&gt;。适用对象：正在评估是否把 agent / 长文档 RAG 迁到 ML4 的 Golang / 后端 / AI 工程师。&lt;/p&gt;&#xA;&lt;h2 id=&#34;1m-上下文是官网自己的两种写法能调到的那个是-512k&#34;&gt;「1M 上下文」是官网自己的两种写法，能调到的那个是 512K&#xA;&lt;/h2&gt;&lt;p&gt;同一家公司的两页文档，给了两个数。Mistral docs 的模型卡上，Context 一栏写的是 &lt;strong&gt;1M&lt;/strong&gt;；而 OpenRouter 的模型页和第三方评测站 Vals AI 的字段都是 &lt;strong&gt;524,288（512K）&lt;/strong&gt;，输出上限 262,144。发布博客里的原话是 &amp;ldquo;frontier performance&amp;rdquo;，没给 token 数。&lt;/p&gt;&#xA;&lt;p&gt;这不是笔误级别的分歧——它直接决定你的架构。一个需要把整本技术手册塞进单次请求的 RAG，按 1M 设计就是能过，按 512K 设计就要先做分片；一个多轮 agent 循环，512K 意味着大约跑到一半就得开始考虑压缩历史。&lt;/p&gt;&#xA;&lt;p&gt;&lt;img alt=&#34;Mistral Large 4 宣传口径与实际可调用参数对照&#34; class=&#34;gallery-image&#34; data-flex-basis=&#34;354px&#34; data-flex-grow=&#34;147&#34; height=&#34;1248&#34; loading=&#34;lazy&#34; sizes=&#34;(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px&#34; src=&#34;https://cdn.lpflpf.cn/images/posts/ml4-reality-check-2026-10-08.png&#34; srcset=&#34;https://cdn.lpflpf.cn/ml4-reality-check-2026-10-08_12630478657684834107_hu_be3f7f60e0240f97.png 800w, https://cdn.lpflpf.cn/ml4-reality-check-2026-10-08_12630478657684834107_hu_858d9548ee764c0.png 1600w, https://cdn.lpflpf.cn/images/posts/ml4-reality-check-2026-10-08.png 1845w&#34; width=&#34;1845&#34;&gt;&#xA;&#xA;&lt;em&gt;四处落差：上下文 1M 对 512K、开放权重对预览期无权重、折扣价对常态价、自报跑分对第三方横向排名。数据来源：Mistral docs 模型卡、OpenRouter、Vals AI，2026-10-08 访问&lt;/em&gt;&lt;/p&gt;&#xA;&lt;p&gt;按能调用的 API 参数来算，把 ML4 当&amp;quot;1M 上下文模型&amp;quot;立项，是个会中途返工的假设。&lt;strong&gt;选型时以模型卡下方的参数、而不是页面顶部的宣传 tagline 为准。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;预览期没有可以下载的权重数据主权团队现在只能等&#34;&gt;预览期没有可以下载的权重，数据主权团队现在只能等&#xA;&lt;/h2&gt;&lt;p&gt;&amp;ldquo;Open-weight&amp;rdquo; 是这场发布最响的词，也是今天最用不上的词。发布博客写得清楚：这是 &lt;strong&gt;public preview（v26.10）&lt;/strong&gt;，今天能在 Mistral Studio 上试 API，&lt;strong&gt;权重本月底才放&lt;/strong&gt;（多家媒体引 Reuters 的口径指向 10 月 27 日前后，官方博客只给&amp;quot;月底&amp;quot;）。预览期他们还拉着网络安全客户和政府机构做红队测试，给的是降低审核、放开 cyber 能力的同一个模型。&lt;/p&gt;&#xA;&lt;p&gt;对绝大多数团队，这不是问题：调 API 就行。但如果你的立项理由里有一条是&amp;quot;数据不出内网&amp;quot;&amp;ldquo;上线前要能在自己机器上跑一遍安全评估&amp;rdquo;——那这条理由今天不成立，最快也要等到月底，而且要注意的是，权重放出来时架构细节、更多 benchmark 和后训练方法也会一并公布，届时才是真正的验收时点。&lt;/p&gt;&#xA;&lt;p&gt;OpenRouter 给这个模型的许可标注甚至不是 open-weight，它当前的托管属性是专有的。这不是矛盾，只是提醒一句：&lt;strong&gt;&amp;ldquo;承诺开放权重&amp;quot;和&amp;quot;现在能自部署&amp;quot;是两件事，中间隔着一个月。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;价格有两张脸136418-是常态068209-是折扣价&#34;&gt;价格有两张脸：$1.36/$4.18 是常态，$0.68/$2.09 是折扣价&#xA;&lt;/h2&gt;&lt;p&gt;Mistral docs 的价格栏同时列了两组数——&lt;strong&gt;输入 $1.36 / 输出 $4.18 / 缓存读 $0.14&lt;/strong&gt;（每百万 token），旁边一列是 &lt;strong&gt;$0.68 / $2.09 / $0.07&lt;/strong&gt;。OpenRouter 那边直接标了 &lt;strong&gt;&amp;ldquo;50% off&amp;rdquo;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;也就是说，打折那一档是限时状态，不是定价。用折扣价立项，等于把一个临时状态写进你的单位成本模型——三个月后折扣结束，你的成本表直接翻倍，而这时候代码已经上线了。&lt;/p&gt;&#xA;&lt;p&gt;财务上稳妥的做法只有一种：&lt;strong&gt;用 $1.36 / $4.18 这一档算上界&lt;/strong&gt;。举个可核对的例子：某任务每轮输入 40 万 token、输出 2 万 token，按常态价一轮就是 &lt;code&gt;0.4 × 1.36 + 0.02 × 4.18 ≈ $0.63&lt;/code&gt;，折后约 $0.32——这个数字是照着官方价目表算的推演，不是实测。差价看着不大，但 agent 循环跑十轮、每天几千次调用，量级就出来了。真要压成本，关键在&lt;strong&gt;缓存读（$0.14）能不能命中&lt;/strong&gt;，而不是赌折扣还在不在。&lt;/p&gt;&#xA;&lt;h2 id=&#34;跑分漂亮但第三方排名和厂商自报差着一个量级&#34;&gt;跑分漂亮，但第三方排名和厂商自报差着一个量级&#xA;&lt;/h2&gt;&lt;p&gt;发布页给了六张 benchmark 图，成绩很漂亮：Cybench 93%、Cyber Index 单测 82%、DeepSWE 61.7%。这些都是&lt;strong&gt;厂商自报&lt;/strong&gt;。第三方评测站 Vals AI 把它放进 44 个模型里排，结果是 &lt;strong&gt;第 32 名（Quad Index 48.05%）&lt;/strong&gt;；Terminal-Bench 4.0 一项 Vals 记的是 &lt;strong&gt;22.73%，20/44&lt;/strong&gt;，发布页给的是 28.3%。唯一站得住脚的高位是 Harvey 法律 Agent benchmark，第 6/75。&lt;/p&gt;&#xA;&lt;p&gt;两个数都是真的，只是它们量的不是同一件事。厂商给的是精挑过的单项（它最强的那几项），第三方给的是横向可比的口径。发布页还有一句&amp;quot;显著超越任何美国或欧洲开发的开源权重模型&amp;rdquo;——按 Vals 的横向排名，这句话在综合口径上很难成立。&lt;/p&gt;&#xA;&lt;p&gt;真正需要警惕的是接下来的信号。多篇上手报道提到，把 ML4 接进 OpenCode 这类 agent harness 时，&lt;strong&gt;推理 token 会跑飞、快速耗干上下文，而且不报错&lt;/strong&gt;。这是媒体报道和用户反馈，Mistral 官方没确认，所以别当成定论；但它和你本来就要防的风险指向同一处——&lt;strong&gt;1T 参数的推理模型，输出里混着大量看不见的思考 token，长循环下最先耗尽的不是钱而是上下文窗口。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;迁移前先跑一遍这张四行验收表再接流量&#34;&gt;迁移前先跑一遍这张四行验收表，再接流量&#xA;&lt;/h2&gt;&lt;p&gt;把上面四处落差收敛成一张能在半天内跑完的清单。&lt;strong&gt;任何一项没过，都不要切生产流量。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;每任务 token 中位数&lt;/strong&gt;：拿你现有模型跑同一个真实任务集，记录单任务的输入/输出 token 中位数。这是你算成本上界和判断上下文够不够的唯一依据。ML4 的推理 token 藏在输出里，务必按 &lt;code&gt;usage&lt;/code&gt; 里的 output 数取，不要按界面看到的回答长度估。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;上下文耗尽率&lt;/strong&gt;：统计有多少任务的实际用量逼近 512K。超过 20% 的任务顶到上限，说明这个模型不适合你这条链路，换更长的上下文模型或先做历史压缩。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;工具调用成功率&lt;/strong&gt;：ML4 支持 &lt;code&gt;tools&lt;/code&gt; / &lt;code&gt;tool_choice&lt;/code&gt; 和 &lt;code&gt;response_format&lt;/code&gt; 的 JSON schema 结构化输出，但结构化输出的合规率要在你的 schema 上实测——尤其在多轮里，一次格式漂移就会让整条流水线返工。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;缓存命中后的真实单价&lt;/strong&gt;：缓存读 $0.14 和输入 $1.36 差近十倍，但只有前缀稳定才命中。把你实际的命中率乘进去，算出真实单价，再和现有模型比。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;接入本身不难，它是 OpenAI 兼容口径：换 base URL，模型 slug 用 &lt;code&gt;mistral-large-4-0&lt;/code&gt;。但顺手要加三道硬约束，否则高上下文模型的默认行为会让你在账单和上下文两边同时失控——&lt;strong&gt;给每次调用设 &lt;code&gt;max_tokens&lt;/code&gt;、设请求超时、并在 agent 循环上挂一个 token 熔断（跑到 N 万 token 就中断）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;最后是三类不该切的情况，说在前面：要满足数据主权、坚持本地自部署的——本月不行；单次任务真的需要超过 512K 上下文的——这个模型给不了；日常只是一批低延迟的小请求（分类、抽取、短问答）——1T 的 MoE 在这个场景下不如 Small 系列，为用不上的上下文付溢价不划算。&lt;/p&gt;&#xA;&lt;p&gt;所以动作很简单：先别改代码，把现在这条 agent 链路的 &lt;code&gt;usage&lt;/code&gt; 日志调出来，按验收表第一项算一遍每任务 token 中位数。就这一个数字，能告诉你 ML4 该进选型清单，还是直接划掉。&lt;/p&gt;&#xA;</description>
        </item></channel>
</rss>
