CVPR 2025 Highlight,通过智能缓存跳过冗余时间步,无需重训模型即可大幅加速扩散模型推理。支持Wan2.1/FLUX/HunyuanVideo等20+主流模型
1000+图像视频音频3D模型一行API调用,自研推理引擎比竞品快10倍,H100低至$1.2/小时,SOC2企业合规
讯飞开放的大模型一站式服务平台,聚合科大讯飞、阿里、深度追求、智谱、Kimi 等62+模型
antirez新作:DeepSeek V4 Flash的Metal/CUDA原生推理引擎,2-bit量化128GB Mac跑百万token上下文
无需量化/蒸馏/剪枝,在单张4GB GPU上运行70B大模型推理,支持Llama3.1 405B仅8GB VRAM
微软删除官方 TTS 推理代码后,社区 fork 保留的 PyTorch 完整实现。支持单卡/多卡推理、语音克隆、Gradio Demo。