开源高吞吐 LLM 推理与服务引擎,通过 PagedAttention 高效管理显存,支持连续批处理与 OpenAI 兼容 API,适合本地或生产环境部署开源大模型。
暂无评价
本页信息可能来自公开信息、站点公开页面或用户提交,仅供介绍与索引参考。
访问外部网站前,请自行判断其内容、服务与相关风险。
如有信息错误、版权或展示异议,可通过反馈、举报或邮箱联系我们处理。
Copyright © 2026 G-Hubs
联系邮箱: support@g-hubs.com