Gemini 2.5 Flash-Lite

gemini-2.5-flash-lite

Gemini 2.5 Flash-Lite 是 Google Gemini 2.5 系列中最快、最省成本的选项。官方文档强调低延迟、低成本、多模态支持、thinking budget,以及 grounding 和代码执行等工具集成。它适合分类、翻译、路由、抽取和大规模高频任务。

上下文窗口

1M Token

最大输出

65.5K Token

发布日期

2025年6月17日

模态

Gemini 2.5 Flash-Lite 价格

输入价格输出价格缓存读取
$0.1/M$0.4/M$0.01/M

Gemini 2.5 Flash-Lite API 能力

推理

支持

工具调用

支持

Temperature 参数

支持

附件

支持

知识库

2025-01-01

Endpoint 协议

Completions APIMessages APIgemini

Gemini 2.5 Flash-Lite 模型亮点

Gemini 2.5 Flash-Lite 侧重低延迟与高效多模态处理,适合大规模运行高频轻量任务。

低延迟处理

模型针对轻量请求的快速执行进行了优化,可用于交互式应用和高频处理流程。

广泛的多模态输入

模型能够理解文本、图像、视频、音频和 PDF 文件,并为下游应用生成文本结果。

大输入窗口

1,048,576 token 的输入上限让轻量处理也能覆盖长文档和较大内容集合,减少拆分请求的需要。

Gemini 2.5 Flash-Lite 使用场景

Gemini 2.5 Flash-Lite 适合高吞吐分类、简单信息提取以及对延迟敏感的内容处理任务。

高吞吐分类

快速为大量文本和多模态内容分配类别、优先级或审核标签。

简单数据提取

从消息、表单、图像或 PDF 文件中提取常规字段和事实,用于索引与后续自动化。

快速文档摘要

将长文档和 PDF 压缩为简短概览、关键要点或分发元数据,供内容流水线使用。

如何通过 TokenHub API 使用 Gemini 2.5 Flash-Lite

创建 API key
import OpenAI from "openai"

const client = new OpenAI({
  apiKey: process.env.TOKENHUB_API_KEY,
  baseURL: "https://us-api.tokenhub.com/v1",
})

const result = await client.chat.completions.create({})
console.log(result.choices[0]?.message?.content)

Gemini 2.5 Flash-Lite 基准测试

指数分数
Artificial Analysis 综合能力指数Artificial Analysis 综合能力评分11.4
Artificial Analysis 代码能力指数Artificial Analysis 软件任务评分9.5
Artificial Analysis 数学能力指数Artificial Analysis 数学推理评分53.3
知识与推理
MMLU-Pro高难度多任务知识评测75.9%
GPQA高阶科学问题求解62.5%
HLE广泛专家级考试集合6.4%
代码与工程
LiveCodeBench近期编程题评测59.3%
SciCode科学计算代码挑战19.3%
Terminal-Bench Hard高难度终端任务执行4.5%
数学能力
MATH-500高难度数学解题96.9%
AIME数学竞赛题70.3%
AIME 2025数学竞赛题53.3%
指令遵循与 Agent 任务
IFBench指令约束遵循49.9%
AA-LCR长上下文推理51.3%
τ²-BenchAgent 工作流任务18.4%

指标来源 Artificial Analysis

媒体与讨论

精选与此模型相关的公开视频和帖子。

X (Twitter)

View post on X
View post on X
View post on X

Reddit

YouTube

Watch on YouTube
Watch on YouTube
Watch on YouTube

关于 Gemini 2.5 Flash-Lite 的常见问题

了解 Gemini 2.5 Flash-Lite 的定位、适合处理的任务、主要优势、使用限制,以及在 TokenHub 中接入时需要注意的事项。

Gemini 2.5 Flash-Lite 是一款什么类型的模型?+

Gemini 2.5 Flash-Lite 是 Google 在 Gemini 2.5 系列中最经济的一款模型,适合简单、高频的多模态处理。它仍是明确的模型版本,但新项目评估时通常也应比较同系列更新型号。

团队可以用 Gemini 2.5 Flash-Lite 做什么?+

它适合大规模分类与路由、简单结构化数据提取以及大规模翻译。上线前应使用有代表性的输入进行测试,并制定可衡量的验收标准。

Gemini 2.5 Flash-Lite 在哪些技术方面更有优势?+

它最实用的优势包括较好的成本效率、较快的响应速度以及支持多种多模态输入。这些特点对简单结构化数据提取尤其有价值。

什么情况下应该选择其他模型,而不是 Gemini 2.5 Flash-Lite?+

如果任务包含高难度多步推理、项目可以采用更新一代 Gemini,或重要决策流程无法安排人工复核,可以考虑其他模型。涉及事实、法律、财务、医疗或运营的重要结果,应由具备相关资质的人员复核。

通过 TokenHub 接入 Gemini 2.5 Flash-Lite 前需要检查什么?+

在 TokenHub 中,请选择页面显示的 Gemini 2.5 Flash-Lite 精确模型标识,使用账号文档中指定的接口,并通过 TokenHub 凭证完成认证。请确认 TokenHub 实际开放的输入类型、工具、信息依据选项和模型生命周期,不要默认与 Gemini API 完全一致。

准备调用 Gemini 2.5 Flash-Lite?

通过一个 API Key 接入 Gemini 2.5 Flash-Lite 与更多 AI 模型。

创建 API Key