gemini-3.5-flash-lite

gemini-3.5-flash-lite

Google 7月推出的极速轻量主力模型
2026-07-22
语言大模型
Model capability: imageModel capability: function_call
输入:
$0.3/1M tokens
输出:
$2.5/1M tokens
大额采购联系客户经理享专属优惠

API介绍

Gemini-3.5-flash-lite 是Google 全新一代面向高并发生产管线与子智能体集群打造的“极致吞吐”大模型。作为 Gemini 3.5 世代中最敏捷、性价比极高的轻量内核,该模型专门针对多 Agent 框架中的特定步骤执行、高频代码小步迭代以及海量文本/多模态数据提取进行了深度优化。它不仅完美继承了 Gemini 家族对文本、代码及多模态资产的原生理解能力,更将响应延迟与 Token 消费成本拉低至全新临界点,是企业承接日均数十亿级高高并发流量的优选。

───────────────────────────────────────────────────────────────────

核心能力

子智能体高效执行: 专为复杂多智能体系统(Multi-Agent System)中的并行子任务量身定制。在 Swarm 或 Agentic 工作流中,能够以极高的指令遵循率和低至毫秒级的首字响应,高可靠地执行条件判断、JSON 结构化提取和特定 API 工具调用。

跨越式智效比与高吞吐: 相比上一代,3.5 Flash-Lite 在保持极低门槛成本的同时,逻辑推理与文本生成质量迎来了显著提升。每秒吞吐量(TPS)大幅领先同级竞品,能轻松承受大型企业级并发峰值。

百万级长上下文与高保真召回: 默认支持高达 100 万 Token 的超大上下文窗口与最高 65,536 Token 的单次输出限制。即使面对庞大的工程文档、长日志流或连续多轮历史对话,也能实现极高精度的无损召回。

透明 Prompt 缓存与极致控本: 原生支持 Google 极致优化的 Context Caching 机制。在固定系统提示词(System Prompt)或高频知识库检索场景下,缓存命中的输入成本可再降低 90%,极大释放了企业搭建长记忆 Agent 的隐性账单压力。

Playground

登录后,探索更多精彩功能! 点击登录

API统计

API列表 (4)

API描述接口地址请求方法稳定性参数说明
v1beta(官方格式-聊天)
POST
稳定
查看详情
v1beta(官方格式-流式)
POST
稳定
查看详情
Chat(聊天)
POST
稳定
查看详情
Chat(分析图片)
POST
稳定
查看详情

API价格表

$
模型说明上下文官网原价302.AI价格官网价差

gemini-3.5-flash-lite

-
1000000

缓存写入$0.03 / 1M tokens
缓存读取$0.03 / 1M tokens
输入$0.3 / 1M tokens
输出$2.5 / 1M tokens

输入$0.3 / 1M tokens
输出$2.5 / 1M tokens

原价