

Cue
说一句,就搞定
智能体
通用助手

关于 Cue
Cue 是一款运行在 Mac 和 Windows 桌面上的语音 AI 智能体,用户只需按下快捷键并开口说话,无论是任意应用中的语音听写,还是需要理解屏幕内容、调用工具并执行的复杂任务,Cue 都能精确完成。它的核心愿景很直接——让 AI 成为人们通过语音而非打字与计算机交互的自然延伸,键盘在日常计算中应该是”可选”而非”必需”。
Cue 的操作逻辑非常简洁:按下快捷键唤醒(Fn 键),Cue 会出现在屏幕顶部;说出需求,无论简单还是复杂,Cue 都会理解当前场景并自主规划执行步骤;等待完成,用户可以去喝杯咖啡,回来就是成品,下一次它已经记住你的偏好。这种”零配置、零集成”的设计让 Cue 可以在 20 多种语言、几乎所有主流应用中直接使用,包括微信、WhatsApp、Gmail、Notion、Figma、Cursor、终端等。
语音输入本质上是原始的语音转文本流,包含语气词、缺失标点、同音字错误和自我修正,把这些转化为干净、高保真的文本且不能拖慢体验,是语音优先界面的核心工程难题。
集成 Gemma 4 E4B 模型后,润色延迟大幅降低了 44%,中位数延迟从 876 毫秒降至 488 毫秒,让”润色”步骤始终能在用户感知不到卡顿的时间预算内完成。Cue 的架构设计非常简单:用户说话后,音频通过云端语音转文本被转录为原始文本,再通过 Ollama 发送给本地运行的 Gemma 4 模型,配合约 400 个 Token 的系统提示词,完成标点恢复、语气助词去除、同音字修正以及依据输入框类型自动调整格式(例如终端命令不加句号,邮件则保留完整标点)。整个从说话到润色再到插入光标位置的闭环流程能在一秒内完成。
由于 Gemma 4 E4B 完全在端侧运行,润色步骤的边际成本降到零,这使得 Cue 可以对所有用户(包括免费用户)提供无限次听写。
除了听写,Cue 的智能体能力可以直接完成具体任务:分析财报并给出自由现金流趋势和风险信号、把旅行照片自动生成带图的演示文稿、扫描收据文件夹并输出费用报表、将 CSV 数据一句话生成仪表盘、会议结束后自动总结并把待办事项添加到 Notion 等。在商业场景中,Cue 还能帮用户起草并调整报价邮件。
在隐私设计上,Cue 采用本地优先的模式:登录后对话可同步,但请求会按需处理,截图仅用于处理不做存储,闲置时也没有后台进程持续运行。




