AI翻译接入指北,沉浸式翻译自定义思考强度

介绍

由于AI的发展,本文主要介绍沉浸式翻译的配置及模型推荐。沉浸式翻译这个浏览器插件最近已经显著扩大了影响力,但是由于其免费模型的限制愈发严格,例如:强制登录、限流等。

不如自己接入更好的模型,并且不花一分钱。那么选择谁呢,居然是美国大豆包,Gemini系列的免费版!

接入

免费模型

Google AI Studio 提供很多可用模型,其中提供用量最多的为 Gemma 4Gemini 3 Flash Lite,所以我们尽量使用这些模型。

截至发布时,各项模型参数及限额如下。

模型 RPM(每分钟请求数) TPM(每分钟Token数) RPD(每日请求数) 模型ID
Gemini 3.1 Flash Lite 15 250K 500 gemini-3.1-flash-lite
Gemini 3.5 Flash Lite 15 250K 500 gemini-3.5-flash-lite
Gemma 4 26B 30 16K 14.4K gemma-4-26b-a4b-it
Gemma 4 31B 30 16K 14.4K gemma-4-31b-it

可以看到 Google 为 Gemma 提供最多的并发,但是最少的TPM,如果翻译的内容较少但是要求稍快一点的速度,可以选择 gemma-4-26b-a4b-it

目前经过测试,Gemini 3.1 Flash Lite的token输出速率最快,在本文撰写时虽然无法达到官方宣称的300+token/s,但是也能做到205token/s的速度。

Gemini 3.5 Flash Lite则稍慢些,在测试时仅能提供199token/s的速度。

Gemma 4 26B,测试时能够提供48token/s,双倍并发,和最多的每日请求数。

获取 API Key

访问 https://aistudio.google.com/ 获取你的API KEY,无需绑卡。

如果你是在非沉浸式翻译平台中使用,Google的 OpenAI 兼容接口为 https://generativelanguage.googleapis.com/v1beta/models/{model}:generateContent?key={key}

配置

在沉浸式翻译配置中,选择自定义模型,添加自定义翻译服务,并选择Gemini。

使用之前获取的 API Key,并在插件中填入。

模型选择以上推荐的免费模型,每秒最大请求数调整为以上 RPM 除以 60 的值即可,可选调大段落数。

解决缓慢

完成以上配置后,你会发现翻译的速度极其缓慢,这是由于默认开启了思考导致的。

打开沉浸式翻译的开发者设置,选择Edit Full User Config,并在gemini-xxxxxx子项的APIKEY同级配置中增加

1
2
3
4
5
6
7
"bodyConfigs": {
"generationConfig": {
"thinkingConfig": {
"thinkingLevel": "minimal"
}
}
}

降低思考强度会显著提升速率。

以上内容仅供参考。


AI翻译接入指北,沉浸式翻译自定义思考强度
https://swai.top/2026/08/04/AI翻译接入指北/
作者
ShallowAi
发布于
2026年8月4日
许可协议