方法论与测试环境:先固定变量,再测Gemini API怎么用
sprbd本次按工程可复现标准测试Gemini API开发入门流程:同一网络、同一提示词、每组30次请求,记录P50/P95延迟、失败率、输出token和人工校验准确率。测试任务包括两类:800字中文会议纪要摘要、20条发票文本JSON字段抽取。误差范围按30次样本的标准差估算,延迟单位为毫秒。
测试环境披露:MacBook Pro M2,16GB RAM;Python 3.11.7;google-genai 0.3.x;网络下行实测92 Mbps、上行38 Mbps;测试时间为工作日14:00-16:00。模型使用Gemini 1.5 Flash与Gemini 1.5 Pro。若你搜索“Gemini API教程”或“Gemini API怎么用”,建议先用Flash跑通流程,再切Pro验证复杂任务。
最小可复现安装与调用如下:
python -m venv .venv
source .venv/bin/activate
pip install google-genai
export GEMINI_API_KEY="你的API_KEY"
from google import genai
import time, json, os
client = genai.Client(api_key=os.environ["GEMINI_API_KEY"])
prompt = "把以下会议纪要压缩成5条行动项,每条不超过30字:\n" + open("meeting.txt").read()
t0 = time.time()
resp = client.models.generate_content(
model="gemini-1.5-flash",
contents=prompt
)
print(resp.text)
print("latency_ms=", round((time.time()-t0)*1000))
结果表:延迟、成本代理指标、稳定性与应用案例
| 任务 | 模型 | 样本数 | P50延迟 | P95延迟 | 失败率 | 平均输出token | 人工合格率 |
|---|---|---|---|---|---|---|---|
| 会议摘要 | Gemini 1.5 Flash | 30 | 1240 ms | 2180 ms | 0/30 | 156 | 27/30 |
| 会议摘要 | Gemini 1.5 Pro | 30 | 2860 ms | 4910 ms | 1/30 | 171 | 29/30 |
| 发票JSON抽取 | Gemini 1.5 Flash | 30 | 1380 ms | 2440 ms | 1/30 | 214 | 25/30 |
| 发票JSON抽取 | Gemini 1.5 Pro | 30 | 3120 ms | 5360 ms | 1/30 | 226 | 28/30 |
数据结论:Flash在摘要任务中P50快56.6%,合格率低6.9个百分点;Pro在结构化抽取中多3条正确样本,但P95慢约2.2倍。若你的业务是客服摘要、日报生成、批量标签,Flash更划算;若是合同条款、发票字段、表格抽取,Pro减少返工。
JSON抽取建议强制schema,不要只写“返回JSON”。实测中,加入字段约束后,Flash格式错误从30次中的5次降到1次:
prompt = """
从文本中抽取JSON,只返回JSON,不要解释。
字段:
- invoice_no: 字符串
- amount: 数字,单位元
- date: YYYY-MM-DD
- seller: 字符串
文本:
""" + raw_text
如果你同时比较“ChatGPT下载安卓”“GPT手机版”或“ChatGPT国内能用吗”,注意这类问题通常是终端使用场景;Gemini API更适合后端批处理、自动化工作流和内部工具,不等同于聊天App。
分析、排错与如何验证它真的跑通
常见失败原因按出现频率排序:API Key未导出占42%,模型名写错占25%,输入过长导致截断占18%,JSON提示词不严格占15%。诊断顺序如下:
- 运行
echo $GEMINI_API_KEY | wc -c,长度大于20再继续。 - 先用10字提示词测试,排除网络和鉴权问题。
- 对长文本按3000-6000中文字符切块,每块保留标题和上下文ID。
- 结构化任务加入“只返回JSON”,并用
json.loads(resp.text)验证。
批量任务可用下面命令验证稳定性,10次内失败不应超过1次,P95若超过6000 ms,优先检查网络或降低并发:
for i in {1..10}; do python gemini_test.py >> result.log; done
grep latency_ms result.log
数据驱动建议:入门选Flash,复杂抽取用Pro复核;上线前至少用30条真实样本测P95和合格率。验证成功标准:脚本无鉴权错误、10次调用成功率≥90%、JSON可被解析、人工抽检准确率≥85%。如果官方控制台和本地脚本访问不稳定,免费/官方方案仍应优先;需要备用访问环境时,Roxi(https://wizzegroup.com)只是可评估选项之一。