站内搜索「推理」共 86 条结果

推荐MacOS
vibevoice-mlx - VibeVoice TTS MLX 推理实现(Mac Studio 部署指南)微软删除官方推理代码后,社区补上的完整 MLX 实现。支持 1.5B/7B 语音合成、零样本语音克隆、量化加速。
5个月前

推荐程序员
VibeVoice 社区版 - PyTorch/CUDA 多 GPU 推理完整代码微软删除官方 TTS 推理代码后,社区 fork 保留的 PyTorch 完整实现。支持单卡/多卡推理、语音克隆、Gradio Demo。
5个月前

推荐模型
TeaCache - 扩散模型免训练推理加速,视频/图片/音频生成提速神器CVPR 2025 Highlight,通过智能缓存跳过冗余时间步,无需重训模型即可大幅加速扩散模型推理。支持Wan2.1/FLUX/HunyuanVideo等20+主流模型
3个月前

推荐模型
Honcho - AI Agent 推理优先的记忆基础设施Agent记忆不是存文本块做匹配,而是从对话中提取结论,持续理解用户和Agent。支持MCP集成Claude Code/OpenCode/Hermes等,托管或自托管。
3个月前

推荐模型
DFlash - 块扩散加速LLM推理的推测解码方案轻量级块扩散模型,专为 LLM Speculative Decoding 设计,支持 vLLM/SGLang/MLX,已适配 20+ 主流大模型
4个月前

推荐程序员
DwarfStar 4 — DeepSeek V4 Flash 本地推理引擎antirez新作:DeepSeek V4 Flash的Metal/CUDA原生推理引擎,2-bit量化128GB Mac跑百万token上下文
4个月前

推荐程序员
NInfer - 只认RTX 5090的Qwen3.8-27B极限推理引擎(从零手搓CUDA,单卡并发破千tok/s)从零手搓的C++/CUDA推理引擎,只认RTX 5090一张卡:Qwen3.8-27B八路并发767 tok/s、AIME双96.7%不掉点,240K上下文还能看图看视频,5090党的天花板玩法。
8天前

推荐MacOS
mlx-engine - LM Studio官方MLX推理引擎(多轮缓存+批量读图)LM Studio跑MLX模型的官方引擎:多轮对话缓存命中秒回、同图追问只算一次视觉编码。99%的人不用装(LM Studio自带),自建MLX服务的值得抄它的缓存设计。
7天前

推荐模型
Bonsai 2 27B - 54GB压到5.9GB还留98%智力的三值模型(Qwen3.8-27B官方压缩,笔记本能跑满血27B推理)发布3天下载破150万!54GB的Qwen3.8-27B压到5.9GB还留98.2%智力,传统2bit崩掉的数学题它守住95分,低比特本地部署天花板。
8天前

推荐玄学基础
MingLi-Bench - 中文命理LLM评测基准(八字+紫微斗数)评估大语言模型在八字和紫微斗数方面的推理能力,160道全球算命师大赛真题,支持 GPT/Claude/Gemini/DeepSeek 等主流模型
4个月前
推荐模型
gemma-skills - Google Gemma 官方 AI 编码技能包Google 官方出品的 Gemma 模型技能库,让 AI 编码助手自动掌握 Gemma 选型、部署、MTP 加速推理,支持 Vercel/Context7 CLI 一键安装
3个月前








