概览会话测试图片生成视频 / 异步任务自由请求历史与计费连接设置

会话测试

对话 / 多模态 / 思维链 / 工具调用,支持流式与非流式,参数可逐项开关

请求
参数与请求体

已启用 3 / 27 个参数,未启用的字段不会出现在请求体里

生成长度
通用

本次回复最多生成多少 token(不含输入)。写满就被截断,此时 finish_reason 会变成 length 而不是 stop。new-api 校验上限是 MaxInt32/2,超了直接 400。转发到 OpenAI o 系列时会被自动改写成 max_completion_tokens。

范围 1 ~ 1073741823 · 勾选后填入 1024

OpenAI 系 / 推理模型

OpenAI 的新字段,作用同 max_tokens,但明确只统计「补全」部分——推理模型的思维链也算在内。和 max_tokens 建议只传一个,同时传时以渠道适配器的取舍为准。

范围 1 ~ 1073741823 · 勾选后填入 1024

采样
通用

采样随机性。越低越确定(趋向选高频词),越高越发散。测复现性设 0,测创造力往上调。注意部分渠道会改写:Moonshot 的 kimi-k2.6 被强制为 1,OpenAI o1 系列会被置空。

范围 0 ~ 2 · 勾选后填入 0.7

通用(部分渠道夹值)

核采样:只在累积概率前 p 的候选词里选。和 temperature 二选一调,别同时大幅改。注意通义千问会把它夹进 0.01~0.99,智谱 GLM 和 Perplexity 会夹到最大 0.99——传 1 不会原样到达上游。

范围 0 ~ 1 · 勾选后填入 1

Gemini / 国产模型

只保留概率最高的 k 个候选词再采样,0 一般表示不限制。OpenAI 官方接口不支持这个字段,主要是国产模型和 Gemini(转成 topK)在用。

最小 0 · 勾选后填入 50

通用

按 token 已出现的「次数」施加惩罚,越大越不容易复读。负值反而鼓励重复。适合治理车轱辘话。

范围 -2 ~ 2 · 勾选后填入 0

通用

按 token「是否已出现过」施加惩罚,鼓励换新话题。与 frequency_penalty 的区别是它不看出现了几次,只看有没有出现。

范围 -2 ~ 2 · 勾选后填入 0

Gemini / Ollama / 通义千问

固定随机种子,让相同输入尽量得到相同输出。只是「尽力复现」,模型侧和硬件差异仍可能导致结果不同。new-api 不校验取值,按渠道转成对应类型透传。

勾选后填入 42

部分渠道

一次返回几条候选回复。计费按输出 token 总量算,n=4 就是约四倍输出费用。chat 接口 new-api 不设上限(只有图片接口有 128 的上限)。很多国产渠道不支持,会照旧只返回 1 条。

最小 1 · 勾选后填入 1

通用

命中其中任意一个字符串就立刻停止生成,且停止串本身不会出现在结果里。多数上游最多接受 4 个。此时 finish_reason 为 stop。

流式
仅流式有效

让流式响应的最后一个 chunk 带上 usage —— 不开就拿不到流式调用的 token 统计,也就无法和实际扣费对账。new-api 侧有渠道支持名单(OpenAI / Claude / Gemini / 通义 / 智谱 / 豆包 / DeepSeek / Moonshot / MiniMax / SiliconFlow 等),名单外的渠道即使开了也可能没有。

勾选后填入 true

true
思维链
通义千问 / GLM / SiliconFlow

布尔开关,控制模型是否输出思维链。混合推理模型(如 Qwen3)关掉它就退化为普通回答,能明显省 token。

勾选后填入 true

仅通义千问

思维链最多允许用多少 token。注意 new-api 只对通义千问系模型放行这个字段,其他模型在序列化时会被直接丢掉,传了也不会生效——想给别家限制思考长度请用 thinking 或 reasoning_effort。

最小 0 · 勾选后填入 1024

Claude / 豆包 / DeepSeek

对象形式的思维链配置,Claude 风格:{"type":"enabled","budget_tokens":1024}。type 还可取 adaptive,display 可取 summarized / omitted。火山豆包的 deepseek-thinking 系列由 new-api 自动注入 {"type":"enabled"};转发到 Anthropic 时会被换成 OpenRouter 的 reasoning 结构。

推理模型

用档位而非具体 token 数来控制推理投入,档位越高越慢越贵。各家认的档位不同:OpenAI 收 minimal/low/medium/high/none/xhigh,DeepSeek v4 只收 none/max,Claude 映射到 output_config.effort,Gemini 拿它去夹 thinking_budget。xAI grok-3-mini 则是从模型名后缀(-high/-low)解析。

可选 minimal / low / medium / high / xhigh / max / none · 也可自填 · 勾选后填入 medium

结构化输出
通用

强制输出格式。{"type":"json_object"} 要求返回合法 JSON;{"type":"json_schema","json_schema":{...}} 还能用 schema 严格约束字段。用 json_object 时提示词里通常也要明确写「用 JSON 回答」,否则部分模型会报错。Gemini 会映射成 response_json_schema,Ollama 另有转换。

工具调用
通用

声明模型可以调用的函数(function calling)。模型不会真的执行函数,只会返回它想调用哪个函数、传什么参数,由你的代码执行后再把结果以 role:"tool" 的消息回传。转发到 Claude / Gemini 时 new-api 会做结构转换。

通用

控制是否/如何调工具。auto 交给模型判断,none 禁止调用只出文本,required 强制至少调一个。也可以自填 {"type":"function","function":{"name":"get_weather"}} 指定必须调某个函数。

可选 auto / none / required · 也可自填 · 勾选后填入 auto

部分渠道

允许模型在一轮回复里同时返回多个工具调用,省一次往返。关掉则一轮只调一个。new-api 原样透传,不是所有上游都支持。

勾选后填入 true

联网搜索
通义千问

通义千问(DashScope)的联网搜索开关。开启后模型会先检索再回答,输出里通常带引用来源,且会额外计费。

勾选后填入 true

百度文心 v2 / 透传

对象形式的联网配置。new-api 侧只有百度文心 v2 会特殊处理:模型名带 -search 后缀时自动注入 {"enable":true,"enable_citation":true,"enable_trace":true}。其他渠道原样透传,能否生效取决于上游是否认这个字段。

OpenAI 风格 / Claude

OpenAI 风格的联网配置。search_context_size 只接受 high / medium / low,不传按 medium,传别的值 new-api 直接返回 400。还支持 user_location 限定检索地域。转发到 Claude 时会被翻译成 web_search_20250305 工具,并按档位换算最大检索次数(low≈3 / medium≈5 / high≈10)。

其他
Dify / Coze / 百度

终端用户的稳定标识,供上游做滥用监控与限流,不影响生成结果。new-api 会把它映射成 Dify、Coze、百度各自的用户字段,其余渠道原样透传。

OpenAI 系

返回每个输出 token 的对数概率,用来观察模型的确信度、排查「模型为什么选了这个词」。OpenAI o1 系列会被 new-api 置空,Claude 不支持。

勾选后填入 true

OpenAI 系

每个位置额外返回前 N 个候选词及其概率。必须同时开启 logprobs,否则上游会报错。

范围 0 ~ 20 · 勾选后填入 5

Gemini 有专用解析 / 其余透传

任意透传字段,用来传渠道私有参数。特别地,Gemini 渠道会从这里读 google.thinking_config(thinking_budget / include_thoughts / thinking_level)和 google.image_config(aspect_ratio / image_size)并做校验。其他渠道原样带给上游。

vLLM / SiliconFlow 自建

传给上游推理框架的聊天模板变量,new-api 只透传不解析。vLLM / SGLang 一类自建部署常用它来开关思维链,例如 {"enable_thinking": false}。

输出

还没有输出,点击「发送」开始测试。

用量与计费

发送一次请求后这里会显示 token、时延与真实扣费。

响应 JSON

发送请求后显示完整响应(流式会展示聚合结果与原始 chunk)