Open Minis 实测:手机里的 Linux 沙盒 + AI Agent,比 Siri 能干 100 倍


一、痛点切入:AI 助手为什么还不能「干活」?

2026 年,AI 对话能力已经强到惊人,但绝大多数手机 AI 助手仍然卡在一个尴尬的位置:能聊天,不能干活

Siri 2.0 还是回答不了「我这周走了多少步」;Google Assistant 依然打不开你想要的那个设置页;三星 Galaxy AI 只会帮你润色短信。它们的共同问题是:没有一个「真实的操作环境」

AI 需要的不只是一个对话框,而是一台能执行命令、浏览网页、读写文件、调用系统 API 的「电脑」。Open Minis 做的事情,就是把这台电脑塞进你的手机里。

核心数据一览:

指标 数值
平台支持 iOS 16+、Android 10+、macOS 13+ (Apple Silicon)、visionOS 1.0+
沙盒环境 Alpine Linux(iSH/PRoot)
AI 提供商 Anthropic、OpenAI、Google Gemini、OpenRouter、任意 OpenAI 兼容
开源协议 GPL-3.0
GitHub 仓库 OpenMinis/OpenMinis
代码语言 Swift 50.4%、Kotlin 41.8%、Objective-C 6%
发布版本 22 个(Android 最新 1.12)

二、工作原理:手机里的「虚拟电脑」

Open Minis 的架构可以用一句话概括:在手机上运行一个完整的 Linux 环境,让 AI Agent 像人类操作电脑一样操作你的手机

2.1 三层架构

┌─────────────────────────────────────┐
│         AI 对话层(LLM)             │
│   Claude / GPT / Gemini / 自定义     │
├─────────────────────────────────────┤
│         Agent 工具层                 │
│   浏览器 · 文件系统 · 系统 API · 技能 │
├─────────────────────────────────────┤
│         设备沙盒层                   │
│   iOS: iSH (ARM64)                  │
│   Android: PRoot + Alpine Linux     │
└─────────────────────────────────────┘

沙盒层是核心创新。iOS 上用 iSH(一个 ARM64 Linux 用户态模拟器),Android 上用 PRoot(用户空间 chroot)。两者都在手机本地运行完整的 Alpine Linux 环境,支持 apk add 安装软件包、pip install 装 Python 库、ffmpeg 处理音视频——全部在设备上完成,不需要任何服务器。

工具层封装了 30+ 个 Android 原生工具和 20+ 个 iOS 原生工具,覆盖日历、通讯录、健康数据、照片、位置、通知、蓝牙等系统能力。AI 通过自然语言调用这些工具,无需用户手动操作。

对话层支持多家 LLM 提供商,每次对话可自由切换模型。你可以用 Claude 做深度分析,用 GPT 做代码生成,用 Gemini 做多模态理解——全部在同一个会话里无缝切换。

2.2 技能系统

Open Minis 的技能(Skill)设计极其简洁:一个文件夹 + 一个 SKILL.md 文件

skills/
  my-skill/
    SKILL.md        ← 指令文档(触发条件 + 执行步骤)
    scripts/        ← 可选的脚本文件
    assets/         ← 可选的资源文件

关键设计决策:

  • 元数据常驻,内容懒加载:SKILL.md 的头部(名称、描述、触发词)始终在系统提示词中,但完整的指令和脚本只在技能被实际调用时才加载。这避免了大量技能导致的上下文膨胀。
  • 兼容 Claude/Codex/OpenClaw 技能:为其他 Agent 平台写的技能,大部分可以直接在 Open Minis 里运行。适配过 Minis 工具的技能运行得更好,因为能直接调用 Linux Shell、设备 API 和原生卸载。
  • 会话级开关:每个技能可以按会话启用或禁用,避免不必要的干扰。

2.3 记忆系统

Open Minis 实现了两级记忆:

  • GLOBAL.md:持久全局记忆,存储用户偏好、项目约定、常用配置。跨会话保留。
  • 每日日志(YYYY-MM-DD.md):当天的会话笔记、关键发现、行动项。自动注入新会话的系统提示词。

记忆通过 memory_get(关键词搜索)和 memory_write(写入当日日志)两个工具暴露给 Agent,实现了跨会话的上下文延续。


三、功能拆解:6 大核心模块

3.1 内置 Linux Shell

能力 详情
环境 Alpine Linux(最小化 rootfs)
包管理 apk add 安装系统包
Python 预装 Python 3,支持 pip install
网络 curlwgetgitssh 可用
媒体 FFmpeg(音视频处理)、LAME(MP3 编码)
文件系统 /var/minis/workspace/ 为工作目录,跨会话持久

实测体验:我让 Agent 在沙盒里 apk add py3-pandas,然后用 Python 读取一个 CSV 文件做数据分析,整个过程不到 30 秒。安装的软件包在会话间持久化,不需要重复安装。

杀手级场景:用户可以直接让 Agent 写 Python 脚本处理数据、用 yt-dlp 下载视频、用 ffmpeg 转换格式——这些在传统手机 AI 应用里根本做不到。

3.2 深度系统集成

Android 专属能力(传统移动 AI 应用无法触及的领域):

工具 功能 需要权限
android-calendar 读写系统日历 日历权限
android-contacts 搜索/读取通讯录 通讯录权限
android-location GPS 定位 + 正逆地理编码 位置权限
android-photos 查询设备照片库 媒体权限
android-alarm 创建系统闹钟/定时器 闹钟权限
android-clipboard 读写剪贴板 剪贴板权限
android-weather 天气预报 位置权限
android-speak 设备 TTS 语音合成
android-speech 麦克风语音转文字 录音权限
android-notification 发送/管理系统通知 通知权限

Shizuku 特权操作(adb 级别权限,无需电脑):

  • 安装/卸载应用
  • 授予/撤销应用权限
  • 读写系统设置
  • 执行 Shell 命令

无障碍自动化(通过 AccessibilityService):

  • 读取任意 App 的 UI 树
  • 点击按钮、填写表单、滚动页面
  • 全局截图
  • 监听实时 UI 事件

实测场景:「帮我查一下明天下午有没有空,如果有空就创建一个 2 点到 3 点的会议,标题是’产品评审’」——Agent 会先调 android-calendar list --start 2026-08-22 查日程,确认有空后调 android-calendar create --title "产品评审" --start 2026-08-22T14:00:00 --end 2026-08-22T15:00:00 创建事件。全程无需打开日历 App。

3.3 内置浏览器

能力 说明
导航 navigate 打开任意 URL
截图 screenshot 截取当前页面
交互 clicktypescroll 操作页面元素
内容提取 get_textget_readable 获取页面文本
表单填写 自动填写网页表单
多标签 支持 3 个并发标签页
Cookie 管理 读写 Cookie,支持 HttpOnly
JavaScript 执行 在页面上下文中执行 JS

实测场景:我让 Agent 去 GitHub 搜索某个库的最新版本号,它自动打开浏览器、输入搜索词、点击结果、提取版本信息,整个过程完全自动化。还试过让它在电商网站比价——打开三个标签页分别查看三个平台的价格,最后输出对比表格。

重要限制:浏览器无法完成 Google OAuth 登录(Android 平台限制,in-app WebView 被 Google 永久禁止)。遇到登录页面时,Agent 会提示用户在系统 Chrome 中完成操作。

3.4 定时任务系统

Open Minis 内置了基于 AlarmManager 的任务调度器:

参数 选项
触发时间 自定义 HH:MM
重复模式 once / daily / weekdays / custom(指定星期几)
执行方式 new(新会话)/ follow-up(追加到已有会话)/ rerun(重跑历史消息)
模型选择 可指定不同模型执行不同任务
日期范围 可设置生效起止日期

实测案例:我设置了三个定时任务:

  1. 晨间简报(每天 07:30):自动抓取天气、日历、新闻,生成简报
  2. 每日 AI 机会扫描(每天 12:30):搜索最新 AI 行业动态,更新研究报告
  3. 自演化循环(每天 08:30):运行 capability-evolver 自动优化 Agent 行为

每个任务都是一个完整的 AI Prompt,Agent 在独立会话中执行,结果通过系统通知推送。

3.5 多模型路由

Open Minis 的模型组(Model Group)系统支持:

  • 故障转移:按顺序尝试多个模型,某个失败自动切换下一个
  • 负载均衡:将对话均匀分配到各模型
  • Thinking Level:支持 off / low / medium / high / xhigh 五档推理深度
  • 上下文窗口限制:可为每个模型组设置 token 上限
  • Agent Loop 模型:独立的模型池,供 Agent 在委派子任务时使用

实测体验:我把 Claude Sonnet 4.6 设为主力模型,GPT-4o 设为 fallback。当 Anthropic API 限流时,Agent 自动切换到 GPT-4o 继续执行,用户端几乎无感知。

3.6 自演化系统(Capability Evolver)

这是 Open Minis 最独特的功能之一:Agent 可以分析自己的运行历史,识别问题,并自主修改代码或记忆来改进表现

基于 GEP(Gene Evolution Protocol)协议:

  1. Brain 阶段:扫描日志、提取信号、选择基因/胶囊、生成演化提示词
  2. Hand 阶段:按协议执行代码修改,分级审批(low-risk 自动应用,medium 需确认,high 阻断)
  3. 固化:将成功的演化写入胶囊,供后续复用

实测案例:在我的使用中,evolver 识别出「workflow-context 缺失」导致 Brain 生成的创新建议与实际工作流脱节,于是自动生成了 workflow-context.json 并注入用户的真实工作流信息。这种「Agent 自己改自己」的能力,在其他移动 AI 应用里闻所未闻。


四、实测数据:真实世界表现

4.1 典型任务耗时

任务 传统方式 Open Minis 提升
查天气 + 日历 + 生成简报 手动切换 3 个 App,约 5 分钟 一句话,约 30 秒 10x
拍照记录饮食 → 估算热量 打开健康 App → 手动输入,约 3 分钟 拍照 → 自动识别 → 写入 HealthKit,约 20 秒 9x
群聊提取任务 → 加入提醒 逐条阅读 → 手动创建提醒,约 10 分钟 自动拉取 → 提取 → 去重 → 写入 Reminders,约 1 分钟 10x
网页内容 → 整理成笔记 复制 → 打开笔记 App → 粘贴 → 排版,约 5 分钟 分享到 Minis → 自动整理 Markdown,约 30 秒 10x
数据分析(CSV → 图表) 传到电脑 → 打开 Excel/Python,约 15 分钟 在沙盒里 pip install + Python 脚本,约 2 分钟 7x

4.2 成本分析

Open Minis 本身完全免费(GPL-3.0 开源),但需要自备 AI API 密钥。

模型 输入价格 输出价格 典型对话成本
Claude Sonnet 4.6 $3/M tokens $15/M tokens ~$0.02-0.05
GPT-4o $2.5/M tokens $10/M tokens ~$0.02-0.04
Gemini 2.5 Flash $0.15/M tokens $0.6/M tokens ~$0.001-0.005
DeepSeek V3 $0.27/M tokens $1.1/M tokens ~$0.002-0.008

月度估算(中度使用,每天 20-30 轮对话):

  • 轻度使用(简单问答):$1-3/月
  • 中度使用(Agent 任务 + 浏览器):$5-15/月
  • 重度使用(大量代码生成 + 数据分析):$20-50/月

对比:ChatGPT Plus $20/月、Claude Pro $20/月——Open Minis 的成本取决于你用多少,而不是固定月费。用 Gemini Flash 可以把成本压到几乎为零。

4.3 与同类产品对比

特性 Open Minis Siri 2.0 Google Assistant ChatGPT App Rabbit R1
开源 ✅ GPL-3.0
Linux 沙盒
多模型支持
系统级操作 ✅ 完整 ⚠️ 受限 ⚠️ 受限
浏览器自动化 ⚠️ 有限
技能扩展 ✅ SKILL.md
跨会话记忆 ⚠️ 有限 ⚠️ 有限
定时任务
后台执行 ⚠️ 受限 ⚠️ 受限
数据隐私 ✅ 本地 ❌ 云端 ❌ 云端 ❌ 云端 ❌ 云端

核心差异:Open Minis 是唯一一个在手机本地运行完整 Linux 环境的 AI Agent。这意味着它可以做任何一台 Linux 电脑能做的事情——安装软件、运行脚本、处理文件、编译代码——而不仅仅是一个「能调 API 的聊天机器人」。


五、安装指南 + 适用场景 + 结语

5.1 安装

iOS

  1. App Store 搜索 “Open Minis”(需要 iOS 16+)
  2. 首次启动引导添加 AI 提供商(输入 API 密钥)
  3. 选择模型,开始对话

Android

  1. 访问 openminis.app 下载 APK(需要 Android 10+)
  2. 或加入 Telegram 群获取最新版本
  3. 同样需要自备 API 密钥

macOS

  • 需要 Apple Silicon(M1/M2/M3/M4)
  • App Store 下载

从源码构建

git clone --recurse-submodules https://github.com/OpenMinis/OpenMinis.git
cd OpenMinis

# iOS
./deps/build_lame.sh && ./deps/build_ffmpeg.sh
./deps/build_ish.sh && ./deps/prepare_alpine_rootfs.sh
open src/ios/Minis.xcodeproj

# Android(需要 NDK r28+)
./deps/build_proot.sh && ./scripts/prepare_android_sandbox.sh
cd src/android && ./gradlew :app:assembleDebug

5.2 最适合谁

用户类型 适用度 理由
开发者 ⭐⭐⭐⭐⭐ Linux Shell + 代码执行 + Git + 多模型 = 移动开发利器
效率工具爱好者 ⭐⭐⭐⭐⭐ 自动化工作流 + 定时任务 + 跨 App 操作
内容创作者 ⭐⭐⭐⭐ 浏览器自动化 + 数据处理 + 技能扩展
隐私敏感用户 ⭐⭐⭐⭐ 本地运行 + 数据不离开设备
普通用户 ⭐⭐⭐ 需要一定技术背景,但学习曲线不算陡峭
完全不懂技术的用户 ⭐⭐ 需要自己配置 API 密钥,有一定门槛

5.3 不适合谁

  • 不想折腾 API 密钥的用户:Open Minis 没有内置模型,必须自己配置 Anthropic/OpenAI/Google 的 API 密钥
  • 只需要简单问答的用户:如果只是聊天,ChatGPT App 更简单
  • iOS 16 以下用户:最低系统要求较高
  • 需要企业级部署的团队:目前是个人工具定位,没有团队协作功能

5.4 内链推荐

5.5 结语

Open Minis 做了一件别人不敢做的事:把一台完整的电脑塞进手机里,然后让 AI 来操作它

这不是又一个「能聊天的 AI」。它是一个真正能「干活」的 Agent——能装软件、写代码、刷网页、读你的健康数据、管理你的日程、甚至自己优化自己。全部在你的手机上本地完成,数据不离开设备。

Federico Viticci(MacStories)说它是「the most impressive indie app I’ve seen in a while」;知乎用户 Ye Han 评价它「在很大程度上实现甚至局部超越了 Apple Intelligence」;小众软件直接称它「可能是 iOS 端最强 AI Agent」。

我加一个:这可能是目前手机上唯一一个真正意义上的「AI 操作系统」——不只是一个 App,而是一个能让 AI 执行任何任务的平台。

开源、免费、跨平台、隐私优先。如果你对 AI Agent 的想象还停留在「聊天机器人」,Open Minis 会让你重新定义「AI 助手」这四个字。


本文所有数据来源于 Open Minis 官方网站(openminis.app)、GitHub 仓库(OpenMinis/OpenMinis)、小众软件评测、以及作者实际使用体验。截至 2026 年 8 月。

发表评论