INTERACTIVE
NVIDIA 免費 AI API 上手:GLM、MiniMax、Kimi 與 DeepSeek 串接實戰
AI 工具教學2026年4月21日

NVIDIA 免費 AI API 上手:GLM、MiniMax、Kimi 與 DeepSeek 串接實戰

Lucus

·

the 牛 B 俠

2026/04/21

免費 AI API 進入戰國時代,NVIDIA 也正式下場

這一年,AI API 市場最明顯的變化,不只是模型愈來愈強,而是入口愈來愈多。NVIDIA 透過 build.nvidia.com 與統一的 OpenAI 相容介面,把多家模型放進同一個開發入口,讓開發者可以用相對低成本的方式,同時試跑不同模型、比對風格、驗證工作流。

真正有價值的地方,不只是免費,而是你不需要為了每一家模型重寫一整套串接方式。只要統一用同一份 SDK,再切換 model 名稱,就能快速比較 GLM、MiniMax、Kimi、DeepSeek 這些熱門模型到底誰更適合你的產品。

先花 3 分鐘申請 API Key

開始之前,你需要先申請 NVIDIA 的 API Key。官方說明可以看 Get an API Key。流程很短:

  1. 打開 NGC API Keys 頁面

  2. 點擊 Generate Personal Key

  3. 幫金鑰取名字

  4. 在 Expiration 選擇是否長期有效

  5. 在 Services Included 勾選 NGC CatalogPublic API Endpoints

  6. 建立後把 key 複製保存

接著在本機環境變數中設定:

export NVIDIA_API_KEY='你的 NVIDIA API Key'

如果你是 Windows PowerShell:

$env:NVIDIA_API_KEY='你的 NVIDIA API Key'

先看清楚:目前可直接測的免費模型有哪些?

截至 2026 年 4 月 21 日,我查到下列幾個與文字生成最相關、而且目前在 NVIDIA 平台上明確標示為 Free Endpoint 的模型:

  • MiniMax M2.7:適合 coding、reasoning、office 與 agent workflow

  • GLM-4.7:適合 multilingual agent、tool use、coding 與 UI 任務

  • Kimi K2 Thinking:適合長鏈推理、研究助理與多步規劃

  • DeepSeek-V3.2:適合推理、長上下文與 agentic 任務

要注意的是,不是所有看得到頁面的模型都屬於同一種可用狀態。像某些型號會標成 Free Endpoint,有些則可能是 Downloadable 或其他部署形式。所以實作前最好直接點開模型頁再次確認。

NVIDIA 這套 API 為什麼好接?

因為根據 NVIDIA 官方 LLM API 文件,文字模型主要走 OpenAI 相容格式,端點為 NVIDIA LLM API Reference 中的 https://integrate.api.nvidia.com/v1/chat/completions。這代表如果你本來就用 OpenAI SDK,多半只需要改三件事:base_urlapi_keymodel

共用設定:先把基本串接完成

pip install openai
from openai import OpenAI
import os

client = OpenAI(
    base_url='https://integrate.api.nvidia.com/v1',
    api_key=os.environ['NVIDIA_API_KEY']
)

如果你用 Node.js,也可以這樣寫:

import OpenAI from 'openai'

const client = new OpenAI({
  baseURL: 'https://integrate.api.nvidia.com/v1',
  apiKey: process.env.NVIDIA_API_KEY
})

MiniMax M2.7 串接教學

MiniMax M2.7 目前在 NVIDIA 平台上是很適合用來測 coding、reasoning、agent workflow 的模型之一,模型頁可直接參考 MiniMax M2.7 model card

from openai import OpenAI
import os

client = OpenAI(
    base_url='https://integrate.api.nvidia.com/v1',
    api_key=os.environ['NVIDIA_API_KEY']
)

resp = client.chat.completions.create(
    model='minimaxai/minimax-m2.7',
    messages=[
        {'role': 'system', 'content': '你是資深後端工程師。'},
        {'role': 'user', 'content': '請用 FastAPI 設計一個 AI chat 服務,包含 /health、/chat、/metrics 三個端點。'}
    ],
    temperature=0.6,
    max_tokens=1200
)

print(resp.choices[0].message.content)

GLM 串接教學

如果你想測多語、工具調用與代理式工作流,GLM-4.7 是很值得先試的一支,模型頁可看 GLM-4.7 model card

from openai import OpenAI
import os

client = OpenAI(
    base_url='https://integrate.api.nvidia.com/v1',
    api_key=os.environ['NVIDIA_API_KEY']
)

resp = client.chat.completions.create(
    model='z-ai/glm4.7',
    messages=[
        {'role': 'system', 'content': '你是企業 AI 架構顧問。'},
        {'role': 'user', 'content': '請設計一個企業知識庫客服系統,包含檢索、FAQ、人工轉接、工單與對話摘要。'}
    ],
    temperature=0.5,
    max_tokens=1400
)

print(resp.choices[0].message.content)

Kimi 串接教學

如果你想測研究助理、長鏈推理與多步規劃,Kimi K2 Thinking 是目前 NVIDIA 免費入口中很有代表性的一個選項,模型頁可看 Kimi K2 Thinking model card

from openai import OpenAI
import os

client = OpenAI(
    base_url='https://integrate.api.nvidia.com/v1',
    api_key=os.environ['NVIDIA_API_KEY']
)

resp = client.chat.completions.create(
    model='moonshotai/kimi-k2-thinking',
    messages=[
        {'role': 'system', 'content': '你是研究型 AI 助理。'},
        {'role': 'user', 'content': '請規劃一個多代理研究流程,包含資料蒐集、來源評分、摘要生成、觀點整合與最終報告。'}
    ],
    temperature=0.6,
    max_tokens=1600
)

print(resp.choices[0].message.content)

DeepSeek-V3.2 串接教學

DeepSeek-V3.2 也是目前很值得一起納入比較的模型,模型頁可看 DeepSeek-V3.2 model card

from openai import OpenAI
import os

client = OpenAI(
    base_url='https://integrate.api.nvidia.com/v1',
    api_key=os.environ['NVIDIA_API_KEY']
)

resp = client.chat.completions.create(
    model='deepseek-ai/deepseek-v3.2',
    messages=[
        {'role': 'system', 'content': '你是技術策略顧問。'},
        {'role': 'user', 'content': '比較 RAG、微調與工作流編排三種企業 AI 導入策略的成本與風險。'}
    ],
    temperature=0.5,
    max_tokens=1400
)

print(resp.choices[0].message.content)

做成可切換模型的通用函式,才是真正實戰

from openai import OpenAI
import os

client = OpenAI(
    base_url='https://integrate.api.nvidia.com/v1',
    api_key=os.environ['NVIDIA_API_KEY']
)

def ask(model_name, prompt, system='你是專業 AI 助理。'):
    resp = client.chat.completions.create(
        model=model_name,
        messages=[
            {'role': 'system', 'content': system},
            {'role': 'user', 'content': prompt}
        ],
        temperature=0.6,
        max_tokens=1200
    )
    return resp.choices[0].message.content

print(ask('minimaxai/minimax-m2.7', '設計一個 AI 文件問答服務'))
print(ask('z-ai/glm-4.7', '設計一個具備工具調用的內部助理'))
print(ask('moonshotai/kimi-k2-thinking', '規劃一個研究型多代理流程'))
print(ask('deepseek-ai/deepseek-v3_2', '比較三種 AI 產品商業模式'))

你真正該把握的是:先把選型做對

這套免費資源最珍貴的地方,不只是省錢,而是讓你可以在真正投入正式成本之前,先完成一輪像樣的模型比較。對開發者來說,這比急著押單一模型重要得多。

參考資料

FAQ

常見問題

NVIDIA 免費 AI API 最適合拿來做什麼?+
最適合拿來做模型選型、PoC、工作流驗證、多模型比較與 agent 原型,而不是一開始就直接承載正式高流量生產環境。
目前有哪些文字模型可直接免費測?+
截至 2026 年 4 月 21 日,我確認 MiniMax M2.7、GLM-4.7、Kimi K2 Thinking、DeepSeek-V3.2 都在 NVIDIA 平台上標示為 Free Endpoint,可作為文字生成與代理工作流測試的起點。
為什麼要用 OpenAI 相容介面串接 NVIDIA 模型?+
因為這樣可以最大幅度降低切換成本。你只要改 base_url、api_key 與 model,就能讓現有 OpenAI SDK 程式直接測試 NVIDIA 平台上的模型。

Next Step

如果這篇內容剛好對到你現在的問題,下一步就不要只停在閱讀。

你可以直接把目前的流程、卡點或想導入的方向告訴我們;如果你還在評估,也可以先去看〈 英特 Ai 〉或其他正式解決方案,確認哪一條路最適合現在的公司狀況。

Line
1