使用 NVIDIA TensorRT 优化大语言模型推理,实现最高吞吐量和最低延迟。用于在 NVIDIA GPU(A100/H100)上进行生产部署,当您需要比 PyTorch 快 10-100 倍的推理性能,或需要支持量化(FP8/INT4)、飞行中批处理和多模型并发服务时使用……
在 Hermes Agent 中使用
这是 Hermes Agent 安装后自带的 Skill。实际可用能力、依赖和路径请以 Hermes Agent 当前版本的 Skill Catalog 文档为准。
使用 NVIDIA TensorRT 优化大语言模型推理,实现最高吞吐量和最低延迟。用于在 NVIDIA GPU(A100/H100)上进行生产部署,当您需要比 PyTorch 快 10-100 倍的推理性能,或需要支持量化(FP8/INT4)、飞行中批处理和多模型并发服务时使用……
适合:使用 NVIDIA TensorRT 优化大语言模型推理,实现最高吞吐量和最低延迟。用于在 NVIDIA GPU(A100/H100)上进行生产部署,当您需要比 PyTorch 快 10-100 倍的推理性能,或需要支持量化(FP8/INT4)、飞行中批处理和多模型并发服务时使用……
先确认你的 Agent 支持 Skill,再按原文说明完成安装。
这是 Hermes Agent 的内置 Skill,安装 Hermes Agent 后可按官方 Skill Catalog 调用。
执行安装命令前,请检查仓库来源、依赖、权限和脚本内容,不要把密钥直接写进命令或公开配置。
从公开说明中提炼的能力与适用范围。
使用 NVIDIA TensorRT 优化大语言模型推理,实现最高吞吐量和最低延迟。用于在 NVIDIA GPU(A100/H100)上进行生产部署,当您需要比 PyTorch 快 10-100 倍的推理性能,或需要支持量化(FP8/INT4)、飞行中批处理和多模型并发服务时使用……
这是 Hermes Agent 安装后自带的 Skill。实际可用能力、依赖和路径请以 Hermes Agent 当前版本的 Skill Catalog 文档为准。
快速判断它是否适合你的任务。
适合已经使用 Hermes Agent,并希望直接调用内置能力的用户。
安装和功能变化以原始资料为准。