LM Studio跑MLX模型的官方引擎:多轮对话缓存命中秒回、同图追问只算一次视觉编码。99%的人不用装(LM Studio自带),自建MLX服务的值得抄它的缓存设计。
一个库在Apple Silicon上原生跑LTX-2.3和Wan2.2两大视频模型,纯MLX加速,CLI一行出片,比PyTorch MPS快1.7倍
微软删除官方推理代码后,社区补上的完整 MLX 实现。支持 1.5B/7B 语音合成、零样本语音克隆、量化加速。