填入 API Key 后,按模型 ID 直接调用
一、先看这三个参数
NVIDIA Build 的云端接口是 OpenAI 兼容格式。任何客户端(Python、Cursor、Cherry Studio、curl)都只需要填三项:
| 参数名 | 应该等于 | 说明 |
|---|---|---|
| base_url | https://integrate.api.nvidia.com/v1 | 接口地址,必须带到 /v1 |
| api_key | nvapi-开头的密钥 | 在 build.nvidia.com/settings/api-keys 生成 |
| model | 厂商/模型名 | 必须填官方 ID,不能只填页面短名 |
glm-5-3,真正要填的是 z-ai/glm-5.3;页面上写 kimi-k3,真正要填的是 moonshotai/kimi-k3。二、调用程序示例
1. 把密钥放进 .env
不要把密钥写进代码。在同目录建 .env:
NVIDIA_API_KEY=nvapi-你的密钥
NVIDIA_BASE_URL=https://integrate.api.nvidia.com/v1
NVIDIA_TEST_MODEL=nvidia/nemotron-3.5-lightning-30b-a3b2. Python(推荐,OpenAI SDK)
先安装:pip install openai python-dotenv。想换模型,只改 model= 这一行。
import os
from openai import OpenAI
from dotenv import load_dotenv
load_dotenv()
client = OpenAI(
base_url=os.environ["NVIDIA_BASE_URL"], # https://integrate.api.nvidia.com/v1
api_key=os.environ["NVIDIA_API_KEY"], # nvapi-...
)
completion = client.chat.completions.create(
model="nvidia/nemotron-3.5-lightning-30b-a3b", # 想调哪个就换这里
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "用一句话介绍你自己"},
],
temperature=0.6,
max_tokens=1024,
stream=False,
)
print(completion.choices[0].message.content)3. curl 一行测试
curl https://integrate.api.nvidia.com/v1/chat/completions \
-H "Authorization: Bearer $NVIDIA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "nvidia/nemotron-3.5-lightning-30b-a3b",
"messages": [{"role":"user","content":"连通测试,回复OK"}],
"max_tokens": 32,
"temperature": 0.2,
"stream": false
}'4. 图形客户端怎么填
Cursor、Cherry Studio、OpenClaw、NextChat 这类「自定义 OpenAI 接口」按下面填:
| 界面上的栏 | 填什么 |
|---|---|
| API 地址 / Base URL / 接口 | https://integrate.api.nvidia.com/v1 |
| API Key / 密钥 | nvapi- 开头的完整密钥 |
| 模型 / Model | 下表「model 参数应等于」那一列,原样复制 |
| API 类型 | OpenAI / OpenAI Compatible |
三、请求参数怎么设
聊天接口固定打 POST https://integrate.api.nvidia.com/v1/chat/completions,请求体常用字段如下。
| 字段 | 必填 | 建议值 | 作用 |
|---|---|---|---|
| model | 是 | 见下一章完整 ID | 决定调用哪一个模型。必须完全一致。 |
| messages | 是 | [{{role, content}}] | 对话数组。role 只能是 system / user / assistant。 |
| max_tokens | 否 | 256~4096 | 最多生成多少 token。测通时用 8~64 即可。 |
| temperature | 否 | 0.2 测通 / 0.6 日常 | 越大越随机。探测连通性时建议 0~0.2。 |
| top_p | 否 | 0.95 或 1 | 核采样。一般保持默认。 |
| stream | 否 | false 测通 / true 聊天 | 流式输出。排查问题时先关。 |
| extra_body | 否 | 按模型而定 | 部分 Nemotron 用来开 thinking。 |
Nemotron 旗舰若要打开思考过程,在 Python 里额外传:
extra_body={"chat_template_kwargs": {"enable_thinking": True}}看图模型(如 meta/llama-3.2-11b-vision-instruct)的 user content 要写成数组:
{
"role": "user",
"content": [
{"type": "text", "text": "这张图里有什么?"},
{"type": "image_url", "image_url": {"url": "https://example.com/a.jpg"}}
]
}四、当前账号实测可用(优先用这些)
下面这些模型在本机用同一把 API Key 调用 /v1/chat/completions 返回了 HTTP 200。点击模型 ID 即可复制,粘到程序的 model= 后面。
| model 参数应等于 | 厂商 | 适合做什么 | 实测耗时 | 试探回复 |
|---|---|---|---|---|
| deepseek-ai | 长上下文编程与对话 | 6.14s | 1. The user asks to reply | |
| Google Diffusion LLM,并行出词,适合低延迟文本 | 0.87s | 有返回 | ||
| meta | 看图问答 | 1.73s | OK | |
| nvidia | 量子计算校准图解读专用,不适合日常闲聊 | 1.99s | OK | |
| nvidia | NVIDIA 通用推理/Agent 模型,适合对话、编程、工具调用 | 0.63s | The user asks: "Reply with the | |
| nvidia | NVIDIA 旗舰推理模型,能力更强、响应更慢 | 1.04s | The user wants me to reply with the | |
| nvidia | 内容安全审核,返回是否安全,不是聊天助手 | 1.42s | User Safety: safe | |
| nvidia | 更快的 Agent 模型,适合日常对话和多步任务 | 6.79s | Here's a thinking process: 1. | |
| nvidia | 文档/图片解析,适合 OCR 与版面提取,不是通用聊天 | 0.7s | ........ | |
| nvidia | 翻译模型(约 12 种语言) | 0.97s | Reply with the single word OK. | |
| nvidia | 翻译模型(约 37 种语言) | 0.74s | Svar med ett enkelt ord OK |
按用途怎么选
日常对话 / 写代码:nvidia/nemotron-3.5-lightning-30b-a3b(更快)或 nvidia/nemotron-3-super-120b-a12b。
最强推理:nvidia/nemotron-3-ultra-550b-a55b。
看图:meta/llama-3.2-11b-vision-instruct。
翻译:nvidia/riva-translate-4b-instruct-v2。
文档解析:nvidia/nemotron-parse-2.0。
安全审核:nvidia/nemotron-3.5-content-safety。
deepseek-ai/deepseek-v4-flash-0731 虽然现在能调,但官方已标弃用,几天内会下线。五、本机曾调通、复测可能超时
mistralai/mistral-nemotron 在建立测试脚本时成功返回「连通测试成功。」,随后高峰复测超时。热门模型 glm-5.3、kimi-k3、gpt-oss-20b、gemma-4-31b-it 当前是「连上 TLS 后一直不回包」。这通常是账号缺少 Public API Endpoints 权限,或该模型当前排队,不是 Key 填错。
| model 参数应等于 | 本次探测结果 | 说明 |
|---|---|---|
| 超时无响应 | 通用对话/编程 | |
| 超时无响应 | GLM 5.3 文本推理 | |
| 超时无响应 | GLM 5.3 Flash,更快、支持多模态 | |
| 超时无响应 | 长程编程、看图、工具调用 | |
| 超时无响应 | 较小的开源推理模型 | |
| 超时无响应 | Gemma 4 31B 推理模型 |
六、如何自己测某一个模型
把下面命令里的 MODEL 换成你想试的官方 ID。成功时 HTTP 状态码是 200,并且 choices[0].message.content 有字。
export NVIDIA_API_KEY=nvapi-你的密钥
export MODEL=nvidia/nemotron-3-super-120b-a12b
curl -sS --http1.1 --max-time 30 \
https://integrate.api.nvidia.com/v1/chat/completions \
-H "Authorization: Bearer $NVIDIA_API_KEY" \
-H "Content-Type: application/json" \
-d "{\"model\":\"$MODEL\",\"messages\":[{\"role\":\"user\",\"content\":\"Reply OK\"}],\"max_tokens\":8,\"stream\":false}"也可以先列出账号当前看得到的全部模型 ID:
curl -sS https://integrate.api.nvidia.com/v1/models \
-H "Authorization: Bearer $NVIDIA_API_KEY"本仓库已提供一键脚本:在 nvidia-api 目录执行 python3 test_nvidia_api.py。它会读取 .env 里的 NVIDIA_API_KEY 和 NVIDIA_TEST_MODEL。
| 测试现象 | 含义 | 怎么办 |
|---|---|---|
| HTTP 200 且有 content | 这个模型当前可用 | 把该 ID 填进 model= |
| HTTP 404 Function not found | 目录能看到,但账号没有推理权限 | 换已验证可用的模型,或向 NVIDIA 申请 Public API Endpoints |
| HTTP 410 Gone | 模型已下线 | 换新 ID |
| HTTP 429 | 触发免费档限速(常见约 40 次/分钟) | 降速重试,过几秒再打 |
| HTTP 000 / 超时 0 字节 | TLS 已连上但模型不回包 | 多半是权限或排队,换可用模型 |
| HTTP 400 / 500 / 503 | 入参不对或服务端忙 | 检查是否误把 embedding 模型拿去 chat;稍后重试 |
七、完整模型目录(当前账号可见 82 个)
「model 参数应等于」这一列就是程序里要写的字符串。状态为「可用」的可直接用;「列表可见但账号无权调用」复制过去会 404;「超时无响应」可以再试,但不保证。
| model 参数应等于 | 厂商 | 实测状态 | 耗时 | 类型/备注 |
|---|---|---|---|---|
| 01-ai | 列表可见但账号无权调用 | 0.72s | 目录中可见。是否能调取决于账号权限。 | |
| adept | 列表可见但账号无权调用 | 0.73s | 目录中可见。是否能调取决于账号权限。 | |
| ai21labs | 列表可见但账号无权调用 | 0.43s | 目录中可见。是否能调取决于账号权限。 | |
| aisingapore | 列表可见但账号无权调用 | 0.44s | 目录中可见。是否能调取决于账号权限。 | |
| bigcode | 列表可见但账号无权调用 | 0.47s | 代码模型。 | |
| databricks | 列表可见但账号无权调用 | 0.39s | 目录中可见。是否能调取决于账号权限。 | |
| deepseek-ai | 列表可见但账号无权调用 | 0.46s | 代码模型。 | |
| deepseek-ai | 可用 | 6.14s | 长上下文编程与对话。官方已宣布弃用,约 2026-09-19 起停、09-21 下线,不建议当主力。 | |
| 列表可见但账号无权调用 | 0.69s | 代码模型。 | ||
| 列表可见但账号无权调用 | 0.95s | 代码模型。 | ||
| 列表可见但账号无权调用 | 0.4s | 目录中可见。是否能调取决于账号权限。 | ||
| 可用 | 0.87s | Google Diffusion LLM,并行出词,适合低延迟文本。 | ||
| 列表可见但账号无权调用 | 0.83s | 目录中可见。是否能调取决于账号权限。 | ||
| 列表可见但账号无权调用 | 0.6s | 目录中可见。是否能调取决于账号权限。 | ||
| 列表可见但账号无权调用 | 1.49s | 目录中可见。是否能调取决于账号权限。 | ||
| 超时无响应 | 20.02s | Gemma 4 31B 推理模型。当前账号常见超时。 | ||
| 列表可见但账号无权调用 | 0.53s | 目录中可见。是否能调取决于账号权限。 | ||
| ibm | 列表可见但账号无权调用 | 0.96s | 目录中可见。是否能调取决于账号权限。 | |
| ibm | 列表可见但账号无权调用 | 0.48s | 目录中可见。是否能调取决于账号权限。 | |
| ibm | 列表可见但账号无权调用 | 1.54s | 代码模型。 | |
| ibm | 列表可见但账号无权调用 | 1.44s | 代码模型。 | |
| meta | 列表可见但账号无权调用 | 0.47s | 代码模型。 | |
| meta | 可用 | 1.73s | 看图问答。messages 里可同时放 text 和 image_url。 | |
| meta | 超时无响应 | 20.02s | 视觉语言模型。 | |
| meta | 超时无响应 | 20.03s | 安全审核模型。 | |
| meta | 列表可见但账号无权调用 | 1.46s | 目录中可见。是否能调取决于账号权限。 | |
| meta | 超时无响应 | 20.04s | 目录中可见。是否能调取决于账号权限。 | |
| microsoft | 列表可见但账号无权调用 | 1.02s | 目录中可见。是否能调取决于账号权限。 | |
| microsoft | 列表可见但账号无权调用 | 0.46s | 视觉语言模型。 | |
| microsoft | 列表可见但账号无权调用 | 1.66s | 目录中可见。是否能调取决于账号权限。 | |
| mistralai | 列表可见但账号无权调用 | 1.5s | 代码模型。 | |
| mistralai | 列表可见但账号无权调用 | 0.41s | 目录中可见。是否能调取决于账号权限。 | |
| mistralai | 列表可见但账号无权调用 | 0.43s | 目录中可见。是否能调取决于账号权限。 | |
| mistralai | 列表可见但账号无权调用 | 0.71s | 目录中可见。是否能调取决于账号权限。 | |
| mistralai | 超时无响应 | 20.03s | 通用对话/编程。本机曾成功返回中文,高峰时可能超时,可再试。 | |
| mistralai | 列表可见但账号无权调用 | 0.41s | 目录中可见。是否能调取决于账号权限。 | |
| moonshotai | 列表可见但账号无权调用 | 0.43s | 目录中可见。是否能调取决于账号权限。 | |
| moonshotai | 超时无响应 | 20.02s | 长程编程、看图、工具调用。当前账号常见超时。 | |
| nv-mistralai | 列表可见但账号无权调用 | 1.14s | 目录中可见。是否能调取决于账号权限。 | |
| nvidia | HTTP 500 | 1.22s | 目录中可见。是否能调取决于账号权限。 | |
| nvidia | 列表可见但账号无权调用 | 0.46s | 目录中可见。是否能调取决于账号权限。 | |
| nvidia | 列表可见但账号无权调用 | 1.06s | 向量/检索模型,不要用 chat/completions。 | |
| nvidia | 可用 | 1.99s | 量子计算校准图解读专用,不适合日常闲聊。 | |
| nvidia | 超时无响应 | 20.03s | 安全审核模型。 | |
| nvidia | HTTP 500 | 0.64s | 安全审核模型。 | |
| nvidia | 列表可见但账号无权调用 | 0.43s | 目录中可见。是否能调取决于账号权限。 | |
| nvidia | 列表可见但账号无权调用 | 0.41s | 目录中可见。是否能调取决于账号权限。 | |
| nvidia | 超时无响应 | 20.03s | 安全审核模型。 | |
| nvidia | 列表可见但账号无权调用 | 0.41s | 目录中可见。是否能调取决于账号权限。 | |
| nvidia | 列表可见但账号无权调用 | 0.46s | 向量/检索模型,不要用 chat/completions。 | |
| nvidia | 列表可见但账号无权调用 | 0.49s | 向量/检索模型,不要用 chat/completions。 | |
| nvidia | 列表可见但账号无权调用 | 1.39s | 向量/检索模型,不要用 chat/completions。 | |
| nvidia | 列表可见但账号无权调用 | 0.56s | 目录中可见。是否能调取决于账号权限。 | |
| nvidia | 列表可见但账号无权调用 | 0.45s | 目录中可见。是否能调取决于账号权限。 | |
| nvidia | 列表可见但账号无权调用 | 1.63s | 向量/检索模型,不要用 chat/completions。 | |
| nvidia | HTTP 503 | 1.32s | 目录中可见。是否能调取决于账号权限。 | |
| nvidia | 可用 | 0.63s | NVIDIA 通用推理/Agent 模型,适合对话、编程、工具调用。 | |
| nvidia | 可用 | 1.04s | NVIDIA 旗舰推理模型,能力更强、响应更慢。可开 thinking。 | |
| nvidia | 可用 | 1.42s | 内容安全审核,返回是否安全,不是聊天助手。 | |
| nvidia | 可用 | 6.79s | 更快的 Agent 模型,适合日常对话和多步任务。推荐首选。 | |
| nvidia | 列表可见但账号无权调用 | 0.4s | 目录中可见。是否能调取决于账号权限。 | |
| nvidia | 列表可见但账号无权调用 | 0.41s | 目录中可见。是否能调取决于账号权限。 | |
| nvidia | 列表可见但账号无权调用 | 0.6s | 目录中可见。是否能调取决于账号权限。 | |
| nvidia | HTTP 400 | 1.17s | 文档解析 / OCR。 | |
| nvidia | 可用 | 0.7s | 文档/图片解析,适合 OCR 与版面提取,不是通用聊天。 | |
| nvidia | 列表可见但账号无权调用 | 0.63s | 目录中可见。是否能调取决于账号权限。 | |
| nvidia | 列表可见但账号无权调用 | 0.61s | 向量/检索模型,不要用 chat/completions。 | |
| nvidia | 列表可见但账号无权调用 | 0.39s | 目录中可见。是否能调取决于账号权限。 | |
| nvidia | 列表可见但账号无权调用 | 0.4s | 翻译模型。 | |
| nvidia | 可用 | 0.97s | 翻译模型(约 12 种语言)。 | |
| nvidia | 可用 | 0.74s | 翻译模型(约 37 种语言)。 | |
| nvidia | 列表可见但账号无权调用 | 0.43s | 目录中可见。是否能调取决于账号权限。 | |
| openai | 超时无响应 | 20.03s | 较小的开源推理模型。当前账号常见超时。 | |
| poolside | HTTP 503 | 1.54s | 目录中可见。是否能调取决于账号权限。 | |
| snowflake | 列表可见但账号无权调用 | 0.52s | 向量/检索模型,不要用 chat/completions。 | |
| writer | 列表可见但账号无权调用 | 1.53s | 目录中可见。是否能调取决于账号权限。 | |
| writer | 列表可见但账号无权调用 | 0.47s | 目录中可见。是否能调取决于账号权限。 | |
| writer | 列表可见但账号无权调用 | 1.42s | 目录中可见。是否能调取决于账号权限。 | |
| writer | 列表可见但账号无权调用 | 0.43s | 目录中可见。是否能调取决于账号权限。 | |
| z-ai | 超时无响应 | 20.03s | GLM 5.3 文本推理。页面短名是 glm-5-3,参数必须写成 z-ai/glm-5.3。当前账号常见超时。 | |
| z-ai | 超时无响应 | 20.02s | GLM 5.3 Flash,更快、支持多模态。当前账号常见超时。 | |
| zyphra | 列表可见但账号无权调用 | 0.59s | 目录中可见。是否能调取决于账号权限。 |
八、用量与限制
NVIDIA Build 的托管接口定位是开发试用,不绑信用卡。现在不再用旧的 credits 点数,而是按模型限速。
免费档常见上限大约每分钟 40 次请求,热门大模型会更紧。超了返回 429。
Key 可以长期用,但不是生产级无限量。要稳定高并发,需要自己部署 NIM 或走付费 Partner Endpoints。
密钥获取地址:https://build.nvidia.com/settings/api-keys
模型目录地址:https://build.nvidia.com/models
点进某个模型页后,看代码示例里的 model="...",那一串才是正确 ID。
九、最小可运行对照
假设你已经把 nvapi- 密钥放进环境变量,下面就是一次完整调用的对应关系:
| 你想做的事 | 代码里写 |
|---|---|
| 指定接口 | base_url = "https://integrate.api.nvidia.com/v1" |
| 带上密钥 | api_key = os.environ["NVIDIA_API_KEY"] |
| 选日常对话模型 | model = "nvidia/nemotron-3.5-lightning-30b-a3b" |
| 选看图模型 | model = "meta/llama-3.2-11b-vision-instruct" |
| 选翻译模型 | model = "nvidia/riva-translate-4b-instruct-v2" |
| 选最强推理 | model = "nvidia/nemotron-3-ultra-550b-a55b" |