RunInfra优化开源模型用于生产,提供可导出的部署堆栈和API。
RunInfra是一个聊天原生AI模型优化和基础设施平台,其主要功能是帮助开发者优化和部署开源模型。该平台通过描述用户想要构建的AI应用,选择兼容的模型,对GPU进行基准测试,优化支持的运行时和内核,并部署支持的基础设施。其重要性在于为AI开发提供了高效、可定制的模型部署解决方案。主要优点包括:能够根据用户需求选择合适的模型和GPU,优化运行时和内核以提高性能,提供可导出的部署堆栈让团队自主掌控,支持多种模型类型和部署方式,提供基于证据的部署和成本控制,以及提供与OpenAI兼容的API端点。产品背景是为了解决AI模型部署过程中的复杂性和成本问题。价格方面,提供从50美元到1000美元不等的定价方案,以美元为货币单位。该产品的定位是面向软件开发者、ML工程师和基础设施团队的AI基础设施平台。
NVIDIA GPU上加速LLM推理的创新技术
ReDrafter是一种新颖的推测性解码方法,通过结合RNN草稿模型和动态树注意力机制,显著提高了大型语言模型(LLM)在NVIDIA GPU上的推理速度。这项技术通过加速LLM的token生成,减少了用户可能经历的延迟,同时减少了GPU的使用和能源消耗。ReDrafter由Apple机器学习研究团队开发,并与NVIDIA合作集成到NVIDIA TensorRT-LLM推理加速框架中,为使用NVIDIA GPU的机器学习开发者提供了更快的token生成能力。
实时让肖像动起来!支持onnx/tensorrt
FasterLivePortrait是一个基于深度学习的实时肖像动画化项目。它通过使用TensorRT在RTX 3090 GPU上实现30+ FPS的实时运行速度,包括预处理和后处理,而不仅仅是模型推理速度。该项目还实现了将LivePortrait模型转换为Onnx模型,并在RTX 3090上使用onnxruntime-gpu实现约70ms/帧的推理速度,支持跨平台部署。此外,该项目还支持原生gradio app,速度提升数倍,并支持多张人脸的同时推理。代码结构经过重构,不再依赖PyTorch,所有模型使用onnx或tensorrt进行推理。
AI实时对话,超低延迟
WhisperFusion是一款基于WhisperLive和WhisperSpeech功能的产品,通过在实时语音转文字流程中集成Mistral大型语言模型(LLM)来实现与AI的无缝对话。Whisper和LLM均经过TensorRT引擎优化,以最大程度提升性能和实时处理能力。WhisperSpeech则使用torch.compile来优化。产品定位于提供超低延迟的AI实时对话体验。
基于TensorRT框架的大规模语言模型推理加速库
SwiftInfer是一个基于Nvidia TensorRT框架的大规模语言模型(LLM)推理加速库,通过GPU加速,极大提升LLM在生产环境中的推理性能。该项目针对流式语言模型提出的Attention Sink机制进行了实现,支持无限长度的文本生成。代码简洁,运行方便,支持主流的大规模语言模型。
© 2026 AIbase 备案号:闽ICP备08105208号-14