字
字节笔记本
2026年9月18日
FreeToken:1.3 万星边缘 MoE 推理引擎,游戏 PC 上跑 290B 前沿模型
API中转
¥120
本文介绍 FlashML-org 开源的 FreeToken(1.3 万 stars,Apache-2.0)——边缘原生的 MoE 推理引擎:把 290B+ 参数的前沿 MoE 大模型跑在你的游戏 PC 上,还能保持可交互的速度。桌面 App 或 pip 安装,接 Claude Code/Codex 当本地后端都行。
项目简介
开源 MoE 模型(DeepSeek-V4-Flash、Qwen3.6-35B-A3B、GLM-5.2 这类)参数大但激活稀疏,家用硬件跑不好往往不是算力不够,而是内存带宽和管理策略不行。FreeToken 的思路是把 GPU、CPU、主机内存、互联当作一个统一弹性平台来调度:带宽自适应的 CPU-GPU 协同执行、全层双缓冲 prefill 流水、全局 LRU 专家缓存,配合自研的 FTW 快速权重格式。
核心特性
- 语义感知缓存:语义锚点 checkpoint 让 agent 场景里的上下文编辑(工具调用、thinking 块)不必重算整段 KV——对跑 coding agent 尤其友好
- 弹性显存管理:专家缓存和 KV 内存之间运行时动态重分配 VRAM,不重启引擎、不重载权重
- 量化格式广:MXFP4、NVFP4、FP8、BF16 都支持
- API 兼容:Anthropic / OpenAI 兼容接口,Codex、Claude Code、OpenCode、OpenClaw、DeepSeek Harness 直接接
- 硬件跨度大:RTX 30/40/50 系游戏卡到工作站 GPU,笔记本也能跑
快速开始
桌面版(Windows/Linux)去 flashml.ai 下载,装完即有跑模型、聊天、调引擎的 GUI。命令行党:
bash
uv pip install "freetoken[accel]"适用场景
- 想在消费级硬件上本地跑 290B 级前沿 MoE 模型的玩家
- 给 coding agent 配大参数本地后端:API 兼容层是现成的
- 追求隐私与成本的团队:一次硬件投入换长期推理自由
注意事项
- 290B 级模型对内存总量和带宽仍有要求,配置不够先从中等规模 MoE 起步
- 项目 7 月开源,版本迭代快,遇到问题先看 docs 再提 issue
- Windows/Linux 优先,macOS 支持情况看官方文档
项目链接
- GitHub 仓库:https://github.com/FlashML-org/FreeToken
- 官网下载:https://www.flashml.ai/
- 安装与快速开始:仓库 docs/install.md、docs/quickstart.md
分享: