Cactus Compute
Cactus Compute(cactuscompute.com)做「面向微型设备的自动化基础模型」:旗舰模型 Needle 3 仅 8–29MB、2-bit 量化,可完全本地运行(不上云、可离线),端侧解码最快约 4k tokens/sec,支持 tool calls、结构化抽取与 embeddings。它覆盖手机、可穿戴、AR 眼镜、智能家居、机器人、车机、PC、游戏机、电视乃至微控制器,让设备端直接跑「自动化」而非依赖云端大模型。Needle 在 GitHub 开源(Apache-2.0,13k+ stars)可自由使用与微调,并有面向设备厂商的「Platform / Whistle」商业平台(公开定价缺失、需联系销售)。投资方与 Raspberry Pi 创始人 Eben Upton、Pebble 创始人 Eric Migicovsky 公开背书。
核心功能
- ✓ 文本生成
- ✓ 智能体
- ✓ 开源
- ✓ 本地部署
- ✓ 提供API
- ✓ 模型微调
👍 优点
- + 极致小、真·端侧:Needle 仅 8–29MB、2-bit 量化,能在手机、可穿戴、AR 眼镜、智能家居、机器人、车机、PC、游戏机、电视甚至 MCU 上本地跑,无需联网、不上云,隐私与离线可用性拉满
- + 速度可观:端侧可达约 4k tokens/sec 解码速度,对「微型设备」而言是很高水准,足以支撑实时语音/控制类交互(如 Pebble 戒指本地响应)
- + 能力不缩水太多:开源模型支持 tool calls、结构化抽取与 embeddings,能直接服务于设备端自动化与 agent,而不只是简单文本生成
- + 开源且背书强:Needle 在 GitHub 13k+ stars、Apache-2.0,可被自由使用/微调;投资方与 Raspberry Pi 创始人 Eben Upton、Pebble 创始人 Eric Migicovsky 公开背书,可信度高
- + 覆盖广、落地场景实:从消费电子到机器人/汽车/家电,统一一套「自动化基础模型」范式,降低每类设备单独训模型的工程量
👎 缺点
- - 模型规模决定天花板:8–29MB 的 2-bit 模型智能上限有限,复杂推理、长上下文、知识密集型任务远不及云端大模型,只适合「窄而快」的端侧动作
- - 公开定价缺失、平台商业化形态不明:/pricing 404,Needle 开源免费但「Platform / Whistle」商业形态与企业报价不透明,企业落地成本与 SLA 需直接咨询
- - 生态与工具链仍在早期:相比成熟端侧框架,周边 SDK、部署示例、跨芯片(NPU/MCU)适配广度可能有限,集成到具体硬件仍需工程投入
- - 适用面偏设备厂商而非普通用户:价值主要在 OEM/开发者把模型烧进产品,个人消费者难直接「用」,门槛在嵌入式工程而非提示词
- - 量化到 2-bit 的质量折损:极度压缩必然带来精度/稳定性损失,对可靠性要求极高的安全/医疗场景需充分验证
适合人群
最适合: 做消费电子/嵌入式/机器人/车机/IoT 的硬件厂商与开发者:需要在手机、可穿戴、AR 眼镜、智能家居、MCU 等微型设备上本地、离线、低延迟地跑 AI(语音指令、工具调用、结构化抽取、端侧 agent),又不愿把数据传云;重视隐私与离线可用性、且希望用开源(Apache-2.0)免授权成本、可自由微调的团队;想用统一一套「自动化基础模型」范式替代为每类设备单独训模型的工程;需要 Pebble 戒指式「无屏即响应」实时交互体验的产品。
不适合: 需要云端大模型级复杂推理、长上下文、知识密集型问答的普通用户——Needle 只有 8–29MB、2-bit,智能上限有限,只适合「窄而快」的端侧动作;想要明码标价、自助订阅的团队——其商业平台公开定价缺失、需销售洽谈;没有嵌入式/NPU 工程能力、只想要现成 App 的消费者——Cactus 价值在 OEM 集成而非直接使用;对 2-bit 量化精度折损零容忍的安全/医疗关键场景(需充分验证);只认单一云端 API、不考虑端侧部署的人。