Google I/O 2026 上最值得玩味的一个动作,是他们把曾经的廉价版 Gemini 3.5 Flash 彻底扶正成了主力 Agent 底座。

Flash 不再只是低配代名词,它把 CoT 思考过程直接做成了 API 可调的旋钮。


一、 把思考过程做成开放旋钮

原生思维链(CoT)早就不新鲜了。Gemini 3.5 Flash 真正实用的地方,是把思考过程的黑盒通过 API 暴露了出来。

在最新的 API 规范中,Google 开放了 thinkingLevel 参数:

  • minimal:极速响应,适合单步执行或格式化转换。
  • medium:均衡模式。
  • high:全力推理,模型会在吐出第一个 Token 之前进行多轮反思。

配合 IncludeThoughts: true,开发者可以直接在回包里抓到模型内部的推理草稿。这对于调试多 Agent 协作中的逻辑偏差极其好用。

Gemini 3.5 Flash 核心定价与参数特写 1M 上下文下,$1.50 的百万 Token 输入定价,让大规模长上下文推理变得非常平民。


二、 终端与协议跑分

选择题式的 MMLU 已经测不出模型的工程能力了。Google 这次搬出了两个实战指标:

  1. Terminal-Bench 2.1 (76.2%):模型在真实 Linux 终端下解决 Git 冲突、排查 Python 依赖地狱。76.2% 的通过率已经接近上一代旗舰 Pro。
  2. MCP Atlas (83.6%):衡量对 Model Context Protocol(MCP)跨平台工具调用的解析与执行成功率。

Artificial Analysis 综合情报板 Artificial Analysis 评估中,Gemini 3.5 Flash 的 Intelligence Index 达到 55,明显拉开了与同价位小模型的差距。


三、 吞吐量对 Agent 的决定性影响

单步调用的 TPS(每秒输出 Token 数)直接决定了多 Agent 流水线的可用性。

在长链路 Agent 中,一个 5 步协作的任务,如果每一步都等 6 秒,整条链路立刻卡成 30 秒;Flash 的吞吐量把这个延迟压到了 8 秒以内。

Intelligence Index 排名趋势特写 智商与速度象限中,Flash 处于吞吐与推理的平衡点。


四、 核心价值

Google 的意图很直接:把推理能力打成廉价工业燃料。

它为智能体场景提供了三张底牌:

  1. 低成本 1M 上下文:足以一次性塞进全套项目代码。
  2. 按需调节的推理深度:自由在速度与智商之间切换。
  3. 原生 MCP 工具调用:天生适合充当流水线里的工兵节点。

参考资料

FIN