audiocraft-audio-generation
用于音频生成的 PyTorch 库,包括文本到音乐(MusicGen)和文本到声音(AudioGen)。当需要根据文本描述生成音乐、创建音效或进行旋律条件下的音乐生成时使用。
适合用于音频生成的 PyTorch 库,包括文本到音乐(MusicGen)和文本到声音(AudioGen)。当需要根据文本描述生成音乐、创建音效或进行旋律条件下的音乐生成时使用。
汇集公开精选榜单与 Hermes Agent 内置能力。先看用途和适用场景,再复制安装命令或打开原文核对。
6 个结果
用于音频生成的 PyTorch 库,包括文本到音乐(MusicGen)和文本到声音(AudioGen)。当需要根据文本描述生成音乐、创建音效或进行旋律条件下的音乐生成时使用。
OpenAI 的模型,连接视觉与语言。支持零样本图像分类、图像-文本匹配以及跨模态检索。在 4 亿张图像-文本对上训练。适用于无需微调即可进行图像搜索、内容审核或视觉-语言任务。适用于通用用途…
大型语言与视觉助手。支持视觉指令调优和基于图像的对话。结合 CLIP 视觉编码器与 Vicuna/LLaMA 语言模型。支持多轮图像聊天、视觉问答和指令遵循。适用于视觉-语言对话…
图像分割的基础模型,支持零样本迁移。当需要使用点、框或掩码作为提示来分割图像中的任意对象,或自动生成图像中所有对象的掩码时使用。
基于 HuggingFace Diffusers 的先进文本到图像生成模型(Stable Diffusion)。适用于根据文本提示生成图像、执行图像到图像转换、图像修复(inpainting),或构建自定义扩散流水线。
OpenAI 的通用语音识别模型。支持 99 种语言,具备转录、翻译为英语以及语言识别功能。提供六种模型尺寸,从 tiny(3900 万参数)到 large(15.5 亿参数)。适用于语音转文字、播客转录或多语言音频处理…
条目根据公开目录和原始文档摘要整理,保留来源与原文入口。安装前请查看原文中的依赖、权限和安全说明;热度指标仅用于发现内容,不代表绝对质量。