Components
langchain-nvidia-ai-endpoints 包提供由 NVIDIA AI 驱动的 LangChain 集成,支持聊天、嵌入、重排序和检索——包括 Nemotron,这是 NVIDIA 为智能体 AI 构建的开放模型系列,以及 NVIDIA API Catalog 上的数百个社区模型。
模型运行在 NVIDIA NIM 微服务上:这些容器镜像会暴露标准的 OpenAI 兼容 API,并通过 TensorRT-LLM 进行优化,以在 NVIDIA 硬件上实现最高吞吐量。你可以通过托管的 API Catalog 访问它们,也可以在本地自托管。
| Component | Class | Description |
|---|---|---|
| 聊天 | ChatNVIDIA | 使用任何 NVIDIA 托管模型或本地 NIM 进行聊天补全 |
| 聊天(Dynamo) | ChatNVIDIADynamo | 带有 Dynamo 部署 KV 缓存路由提示的 ChatNVIDIA |
| 嵌入 | NVIDIAEmbeddings | 用于语义搜索和 RAG 的稠密向量嵌入 |
| 重排序 | NVIDIARerank | 根据查询相关性对文档进行重排序 |
| 检索 | NVIDIARAGRetriever | 从 NVIDIA RAG Blueprint 服务器进行检索 |
Chat: ChatNVIDIA
ChatNVIDIA 基于 NVIDIA 托管模型和本地 NIM 部署提供聊天补全。它支持工具调用、结构化输出、图像输入和流式传输。
Install
Access the NVIDIA API Catalog
- 在 NVIDIA API Catalog 上创建一个免费账户并登录。
- 点击你的个人资料图标,然后点击 API Keys > Generate API Key。
- 复制该密钥并将其保存为
NVIDIA_API_KEY。
Nemotron: featured models for agentic AI
Nemotron 是 NVIDIA 专为智能体 AI 设计的开放模型系列。这些模型采用混合 Mamba-Transformer 专家混合架构,在提供高吞吐量并支持最多 100 万 token 上下文窗口的同时,实现了领先的基准测试性能。Nemotron 模型权重、训练数据和实现方案都根据 NVIDIA Open Model License 公开发布。ChatNVIDIA 集成页面,了解包括工具调用、多模态输入和 Nemotron 专用示例在内的完整文档。
Chat: ChatNVIDIADynamo
ChatNVIDIADynamo 是 ChatNVIDIA 的直接替代品,用于 NVIDIA Dynamo 部署。它会自动向每个请求注入 KV 缓存路由提示,使 Dynamo 调度器能够优化内存分配、负载路由和请求优先级。
ChatNVIDIA 集成页面,了解完整的 ChatNVIDIADynamo 参考信息,包括单次调用覆盖和流式传输。
Embeddings: NVIDIAEmbeddings
NVIDIAEmbeddings 会生成稠密向量嵌入,用于语义搜索和 RAG 流水线。
NVIDIAEmbeddings 集成页面 了解完整文档。
Reranking: NVIDIARerank
NVIDIARerank 使用 NeMo Retriever 重排序 NIM,根据与查询的相关性对文档列表进行重排序。
Retrieval: NVIDIARAGRetriever
NVIDIARAGRetriever 将 LangChain 连接到正在运行的 NVIDIA RAG Blueprint 服务器,并通过 /v1/search 端点检索相关文档。它支持重排序、查询重写和元数据过滤。
NVIDIARAGRetriever 集成页面 了解完整文档。
Self-host with NVIDIA NIM Microservices
当你准备部署 AI 应用时,可以使用 NVIDIA NIM 自托管模型。更多信息请参考 NVIDIA NIM Microservices。Accelerate LangGraph with NVIDIA
langchain-nvidia-langgraph 包为 LangGraph 图提供 NVIDIA 优化的执行策略。它提供两种在编译时应用的互补优化:
- 并行执行:自动识别独立节点并并发运行,消除不必要的顺序瓶颈。
- 推测执行:条件边的两个分支会同时运行;一旦路由条件确定,就丢弃错误的分支。
Install
Parallel execution
将 LangGraph 中的StateGraph 替换为 langchain_nvidia_langgraph.graph 中的 StateGraph。图定义的其余部分保持不变。
StateGraph:
Speculative execution
在编译时通过OptimizationConfig 启用推测执行。执行器会并行运行条件分支,并保留与路由决策匹配的结果。
NeMo Agent Toolkit Optimizations with LangSmith Telemetry
NVIDIA NeMo Agent Toolkit 是一个开源 AI 工具包,用于构建、分析和优化智能体。开发者可以在只做少量代码修改的情况下,将 LangChain 与 NeMo Agent Toolkit 一起使用,以启用性能分析、评估、GPU 容量规划和自动优化。NeMo Agent Toolkit 可与 LangSmith 互操作。Full Stack Blueprints
NVIDIA 和 LangChain 合作推出了全栈示例,展示如何将这些组件组合起来用于两个企业用例,并重点关注生产就绪性:- NVIDIA AI-Q 是一个使用 LangChain Deep Agents 跨企业数据源进行深度研究的蓝图
- NVIDIA VSS 是一个使用 LangChain 和 LangGraph 进行视频搜索与摘要的蓝图
Additional Resources
langchain-nvidia-ai-endpoints包 READMElangchain-nvidia-langgraph包- Nemotron 模型系列
- 面向大型语言模型(LLMs)的 NVIDIA NIM 概览
- NeMo Retriever Embedding NIM 概览
- NeMo Retriever Reranking NIM 概览
ChatNVIDIA模型- 用于 RAG 工作流的
NVIDIAEmbeddings模型 NVIDIARAGRetriever- NVIDIA Dynamo
Connect these docs to Claude, VSCode, and more via MCP for real-time answers.

