少数派

等不及 Apple Intelligence,我用「快捷指令」手搓了系统级 AI 助手……

OpenAI 发布的 ChatGPT-3 是我第一次接触大语言模型(large language model,LLM),那时我觉得这样一个对话模型好像只能用来自娱自乐。但是将时间快进到 2026 年,LLM 已经完成了一次又一次的升级与进化。从一开始的简单对话,到如今的复杂图片创作;从一开始的终端模拟,到如今百花齐放的 CLI(command line interface);从一开始的简单代码编写,到如今小白也能上手的 vibe coding...... 可以说在 PC 上,得益于 LLM,我们的工作效率或者学习效率得到了极大提升,而 LLM 已俨然颠覆了甚至开创了一条有别于传统的工作流。

Image
LLM 百家争鸣

可是当我拿起手机,面对无能的 Siri(至于 Apple Intelligence 则是遥遥无期) 亦或是面对各家 LLM 厂商推出的 App,我却根本提不起一点使用它们的兴趣。为什么在手机上,我对 LLM 如此的「性冷淡」呢?

其实我自己给出的答案很简单,不是现在的 LLM 不够强大,而是手机本身限制了这一切。因为在手机上你只有一个常驻的,强制全屏的 App 在前台,你干其他任何事情你都需要打断你当前的进程。在 PC 上,我可以开多个任务能够保持在后台,我可能按一下键盘的某个快捷键,或者鼠标点一下某个图标就能呼出你与 LLM 对话的窗口,你甚至可以将某个 LLM 窗口保留在你的桌面上或者外接显示器桌面上。LLM 就像一个管家(好比贾维斯),时刻准备为你服务。

但是在手机上呢?或者说在 iPhone 上呢?想象以下场景,你当前在微信聊天,亦或是在刷小红书,亦或是你在看剧,突然你需要 LLM 帮你解释某个问题或者翻译某些句子亦或是帮你设置待办事项。你这个时候只能上滑小白条,下拉 Spotlight 搜索某个 App 或者滑动屏幕找到那个 App,然后等待 App 打开,点击对话框,输入你的问题,等待它的回复,然后等待它的回复,最后等待它的回复。这一套操作下来可能花费不了多少时间,但是我觉得烦,非常的麻烦。因此,我需要一个入口,能够随时调用的入口,而且不会打断我当前正在进行的事情。

Image
Apple Intelligence — the personal intelligence system for iPhone, iPad, and Mac. 图片来自 Apple

那么有没有这么一个 App,能随时被你调用,不需要在 App 之间切换,而且还是 LLM?(虚晃一枪,没有广告,广告位招租)没有,这是真的没有。真的没有吗?首先是一个随时可以被调用的入口。让我们想一下,Apple 在 iPhone15 系列加入的 Action Button,或者辅助功能中的敲击背板能不能成为我们的一个入口呢?当然可以,那么现在随时可以调用的入口有了,还差一个 LLM。但是去哪里找一个不会在 App 之间切换的 LLM 呢?这是真的没有了,除非 Apple Intelligence(催更国行)。

但是我们可以用曲线救国的方式来实现,那就是通过快捷指令 App 调用 API。你通过 App 使用 LLM 本质上其实就是厂商已经提前给你准备好了调用方式(endpoint + API + content),你只需要填充其中 content 的内容就可以了。 得益于快捷指令,我们可以使用系统级的交互方式来调用 LLM,比如说弹窗输入、通知,只要快捷指令提供的,都能为你所用。最终,只要小小的阅读一下厂商提供的 API 手册,学习一点点的快捷指令使用指南,加上一点点的调试,我得到了一个理论上拥有无限可能,能够比较接近 Apple Intelligence 的「系统级」LLM。

Image
Nvidia NIM 的 API 手册部分

Image
快捷指令部分命令

长按 Action Button,就能呼出 LLM 交互菜单。我预设了三个来自三家供应商的不同模型,分别是 siliconflow 的 Qwen3-80B-A3B,nvidia 的 GPT-OSS-120B,google 的 Gemini 3 Flash。这三家提供的这三个模型都有一个共同特点,那就是回复很快,其中 Gemini 3 Flash 是又强又快。为什么要回复快呢?因为快捷指令无法修改请求回复的等待时间。假如 LLM 回复的太慢,已经达到了快捷指令的等待时间上限,那么快捷指令不会继续等待,会执行下一条命令。选择模型后,我预设了三个功能,分别是问题回答、中英互译、待办事项添加。

Image

首先是问题回答,分为思考与不思考(虽然我大多数选择思考,而且现在很多模型都有根据问题来自动设置思考的程度的功能),选择一个选项后,会有一个输入框弹出,输入你的问题点击完成,就可以向 LLM 发送请求了。等待一会儿便会弹出问题的答案,这期间你可以干任何事情,不过这个弹窗很容易会被误触,只要点击弹窗外的任何地方,弹窗就会消失,但是我们可以优化这个弹窗的显示逻辑。

Image
Image

第二项功能是中英互译,当然也可以根据 Prompt 的不同来翻译其他语言。最重要的是,你可以在你当前屏幕上选择任何内容,然后长按 Action Button 呼出 LLM,之后将句子粘贴进输入框就可以得到译文,而且始终停留在你当前的页面。

Image

最后一个功能是待办事项的添加。你可以直接使用语音输入你的日程,得益于 LLM 的强大理解力,你的输入甚至能口语化,或者在输入中加入一些无关的内容,LLM 也会将你的日程整理出来,并且通过快捷指令将其添加到你的待办事项。最重要的是,这一切只需要你用用语音输入你日程,然后在屏幕上继续你的工作,所有的一切都会在后台自动完成。

Image

在第一个功能的基础上,除了弹窗容易消失的问题,系统弹窗也不能很好的兼容  Markdown 格式,因此我使用熊掌记来记录问题的答案或者翻译的结果。熊掌记对快捷指令的支持非常完善,而且该 App 也足够轻量化没有其他乱七八糟的功能,有的只是 Markdown 的编辑与显示(不是广告)。

Image

不过当前的快捷指令也只是一个勉强能用的状态,称不上有多么好用,能最基本满足我的需求。对我来说已经足够了,因为我在手机上使用 LLM 的次数比以前多了很多,我现在一有想法就会按下那颗 AI 按键呼出随时待命的助手。

▍一个「全能」入口

前面我们已经探索了如何更加方便的去调用 LLM,让 LLM 在 iPhone 上变得更加好用,从而让我们更加愿意去使用。通过使用 Action Button 快速运行快捷指令,在弹出的窗口中选择预设的功能(Normal Chat、Translation、To-Do List)之后输入你的问题或者日程,剩下的便是 LLM 的事情了。但是我在使用的时候还是觉得过于麻烦,尤其是每次在使用 Normal Chat 功能时,我首先要选择 Normal Chat 选项,然后选择到底是思考(thinking)呢还是不思考(no-thinking)呢?我就想简简单单的做一个呼出即用,不需要做选择的使用方式。

意图识别

为此我对之前快捷指令的运行逻辑与流程做了全面改进。我首先做了一个 Intent Recognition 的快捷指令,用于对我输入的内容进行意图识别。提到 Intent 不知道你们有没有想到 App Intents framework,Apple 在 2024 WWDC 发布 Apple Intelligence 时提出了这一框架。我的灵感来源于此,既然我想做一个「全能」入口,那么 LLM 至少得先知道我的意图是什么。这个快捷指令会根据我的输入来判断我的意图,然后输出 JSON,分别是 Intent 和 User Input。这个快捷指令也是基于 LLM 的,我使用 Gemini 3 Pro 制作了意图识别的 Prompt。同时我也想分享一个让 LLM 的回答更加贴近你的要求的 Prompt:

请你在回答前,先问我问题。要求:一次只问一个问题。根据我的回答,继续追问。直到你能理解我的真实需求和目标,然后才给出方案。

我使用这样一条指令,让 LLM 不断问我问题,让他把可能的情况全都考虑进去最后输出我想要的意图识别的 Prompt。

Image
Intent Recognition 处理流程

处理意图 

在制作完 Intent Recognition 我把原有的一整个的 AI Assistant 快捷指令拆分为三个快捷指令,分别对应三个 Intent:Normal Chat、Translation、To-Do List。在每个快捷指令中预定义了所对应功能的 Prompt。由于快捷指令可以获取其他快捷指令的返回内容,因此只要解析 Intent Recognition返回的 JSON 就能准确的确定 Intent 与User Input。之后匹配 Intent 并运行相应的快捷指令,并将 User Input 作为参数传入给所运行的快捷指令即可。

Image
Intent 处理流程

这次我选择了综合实力比较强的 Gemini 3 Flash 作为处理 Intent 的模型,但由于无法在国内直接使用,因此在每次运行快捷指令的时候都需要开启魔法,在运行结束时关闭魔法(当然也是在快捷指令内设置好的,并不需要手动开关)。 为了使用方便,我推荐的是硅基流动的 Qwen3-Next-80B-A3B-Instruct/thinking 与小米的 Mimo V2 Flash,比较能兼顾速度与性能,成本也比较低。在功能实现上,延续了之前 AI Assistant 的所有功能,包括日常对话,中英文互翻,待办事项自动添加。在输出部分,我依然选择了熊掌记用来显示正常的 Markdown 格式文本,虽然在数学公式渲染方面还有一些问题,但是瑕不掩瑜。

在待办事项自动添加这个功能的 Prompt 中,我添加了当前时间这一变量,这样当我用明天后天等不精确的时间时,LLM 就能根据 Prompt 中所给的时间来自动推算。也修改了单个待办事项的备注部分的设置,防止没有备注时 弹窗让你手动添加备注(遇到好几次,让我十分恼火于是修了这个 bug)。在自动添加待办事项后会弹出一个系统通知,通知你待办事项已经添加完毕。

▍小小的演示

Normal Chat

下面是对上述三个 Intent 的功能演示,首先是 Normal Chat,当我长按 Action Button 后呼出输入框,然后输入一个问题,点击 Done。此时后台运行快捷指令会先将我的输入给 Intent Recognition,Intent Recognition识别出我的输入为 Normal Chat,然后运行用于处理 Normal Chat 的快捷指令,该快捷指令会自动发送 URL 请求与接收,并解析 LLM 的输出。最后会将答案保存在熊掌记中,并跳转到熊掌记。

Image

Image

Translation

其次是 Translation 功能,虽然我在 Prompt 中明确了一些我要翻译的情形,但还是有一些例外。比如我想将「如何理解傅里叶变换」翻译为中文,如果我直接输入,那么 LLM 可能会回答你什么是傅里叶变换。对于这种有很强的询问语气的输入,最好在要翻译的内容前后明确翻译这一目的,那能很大程度避免这种情况。对于英文翻译中文来说也是同理。

Image
Image

To-Do List

最后是 To-Do List 功能,通过在 Prompt 中添加当前时间变量,使得 LLM 能够正确处理模糊时间,比如今天,明天等。并且优化了待办事项的设置逻辑,不会再有莫名其妙的弹窗。在待办事项添加完成后会主动通知你待办事项添加完成。

Image

Image

小功能

还新增一个小功能:系统的分享功能。当我选中一段文字后,可以通过共享表单直接把文字当做输入参数传递给快捷指令。你不想手动输入,不想语音输入没问题。在照片里直接文本识别,长按后选择分享,选择 AI Assistant 就可以快捷翻译。在邮箱里你想翻译一段英文也没问题,依旧长按后选择分享,选择 AI Assistant 就可以快捷翻译。

Image

Image

▍快捷指令分享与设置

最后是这几个快捷指令的分享链接。使用时一定要将所有的快捷指令添加进你的设备。

所有的快捷指令:

Image

AI Assistant:

https://www.icloud.com/shortcuts/31f93948fe7e41f4a054bb50c00d4859

Intent  Recognition:

https://www.icloud.com/shortcuts/baed59090f7a45c8be5fbe286b69bfe9

Normal Chat:

https://www.icloud.com/shortcuts/cde9677b4fb5423499a01c31e22a7310

Translation:

https://www.icloud.com/shortcuts/51e90f000a524f6cb7730f0dd74cd581

To-Do List:

https://www.icloud.com/shortcuts/d9a731c44d534527a24400555ece1c31

同时在除了 AI Assistant 外的所有快捷指令中填写你的个人 API,由于我分享的是硅基流动版本的快捷指令,因此你需要填写你的硅基流动的 API。如果你动手能力强,你也可以将其改造成其他供应商版本的,根据供应商的 API 手册修改请求体。

添加 API:

Image

添加完成后请检查一下有没有安装熊掌记以及系统是否为 iOS 26(未测试iOS 26 之外的版本),之后你就可以运行 AI Assistant 这个快捷指令了,由于首次使用会有权限请求,放心选择允许就可以了。

原文链接:
https://sspai.com/post/106087?utm_source=wechat&utm_medium=social
作者:Pegasl

/ 更多热门文章 /

Image

Image

Image