Pi Agent 使用手册
介绍 Pi Agent 的极简设计、安装、插件、技能、Session 管理、扩展与安全边界。
- 来源
- 原始内容
- 整理日期
- 2026-08-31
介绍 Pi Agent 的极简设计、安装、插件、技能、Session 管理、扩展与安全边界。
来源:原始内容 整理日期:2026-08-31
来源说明:本手册主体整理自 B 站视频《Pi Agent:比Claude Code和Codex更适合普通人的AI工具》(UP主:第四种黑猩猩CHIMP,2026-05-25 发布,21分18秒),关键步骤附时间戳可回看;标注 【背景补充】 的内容来自检索到的官方/社区资料(2026-08-19 查证),非视频原话。
一句话定位:一个极简主义的本地 Agent——底座只保留 4 个基础工具(读文件、写文件、改文件、跑命令),其他一切能力靠安装 skill 按需扩展,最终“搭出一个属于你自己的 Agent”。
视频开场的判断:世界上 T0 级别的 Agent 有四个——Claude Code、Codex、OpenCode、Pi Agent。前三个名字里都带 code,主要是帮你写代码;Pi Agent 最冷门(国内几乎没人聊),但也最特别:它不是帮你写代码,而是帮你完成日常任务。
| 维度 | Coding Agent(Claude Code / Codex / OpenCode) | Pi Agent |
|---|---|---|
| 定位 | 代码智能体,产出是代码 | 日常任务智能体,产出是结果(文件/网页/音频/视频) |
| 预装能力 | 代码索引、测试运行、Git 操作、编码规范整套 | 只有 4 个工具:读 / 写 / 改 / 跑命令 |
| 扩展方式 | 出厂即全套 | 装 skill 才有能力,一人一个 Pi |
| 系统提示词 | Claude Code 约 2 万 token;Codex/OpenCode 约 1.5 万 | 不到 1500 token |
| 类比(视频原话) | 预制菜——内置完整写代码流程 | 自己搭的个性化工作台 |
极简底座带来的三个直接好处(04:10):
佐证数据(视频引述):OpenRouter 排行榜上 Pi 每日 token 消耗量排第六,紧随 Claude Code 之后;OpenAI Codex 负责人称约 5% 的生产流量跑在这个 agent 上。单次对话消耗只有其他 agent 的几分之一,总量还能排第六,说明海外极客圈已有大批人把它当日常工具。
【背景补充】Pi 的身世与生态(检索自社区资料):
pi-ai(20+ LLM 提供商统一 API)、pi-agent-core(Agent 运行时)、pi-coding-agent(终端主产品)、pi-tui / pi-web-ui(界面)、pi-pods(GPU 部署管理);几乎所有 Agent 都依赖 Node.js。去官网选自己系统的安装包,双击一路下一步即可。已装过的跳过。
国内网络建议先配镜像(视频用的是腾讯镜像):
npm config set registry https://mirrors.tencent.com/npm/
Windows 打开 PowerShell,Mac 直接开终端,同一条命令:
npx @agegr/pi-web@latest
Y;说明:
@agegr/pi-web是 UP主自己开发并开源的 Pi 网页壳(他自用了三个月),底层跑的还是 Pi。Pi 官方本体是终端形态,这个壳把它包成了易用的 Web 应用:左边文件浏览器 + 中间对话框 + 模型/skills 设置。
【背景补充】路径 B:官方终端版(更原生,适合习惯命令行的人):
npm install -g @mariozechner/pi-coding-agent
pi # 交互模式
pi "帮我做某件事" # 单次任务模式
认证两种方式:设置环境变量 ANTHROPIC_API_KEY / OPENAI_API_KEY,或在交互模式输入 /login 走浏览器 OAuth(可直接用 Claude Pro / ChatGPT Plus 订阅)。
没有模型,Agent 再好也没用。Web 版配置三步:
base URL + API Key 保存即可。| 配置项 | 视频取值 |
|---|---|
| 推理模式 | ✅ 勾选 |
| 图片输入 | ✅ 允许 |
| 思考模式 | 选最高的 |
| 上下文窗口 | 20 万 |
| 最大 token 输出 | 6.4 万 |
下载完什么 skill 都没加的 Pi,已经能做不少事:
记住一个公式:Agent + Skill。这是普通人跟上 AI 时代最本质的框架。
Skill 就是一份给 Agent 的说明书 / 操作手册——Agent 读完就知道具体怎么干活。装一个 skill,Agent 就多一项能力:搞研究的装 PDF、搜索的 skill;办公的装表格 skill;想让它开口说话装 Edge TTS;想做视频装 Hyperframes。每个人手里的 Pi 最后长得都不一样,官网口号就是这个意思:“世界上有很多 Agent,但 Pi Agent 是你自己的 Agent。”
Web 版点 Skills → 添加 skill → 搜索名字 → 安装。装的时候有两个选项:
| 作用域 | 含义 | 建议 |
|---|---|---|
| global | 所有项目都能用 | 默认选这个 |
| project | 仅当前项目可用 | 特定项目隔离时用 |
直接问 Agent:
你现在安装了哪些 skills?他们的位置在哪里?
它会列出自己当前拥有的全部技能。
| # | 能力 | Skill | 需要的账号/凭证 | 成本 |
|---|---|---|---|---|
| 1 | 联网搜索 | Tavily / Brave Search | 官网注册 API Key | 免费每月各 1000 次 |
| 2 | 读文档 | PDF / Word / Excel / PPT skill | 无 | 免费 |
| 3 | 语音合成 | Edge TTS | 无需任何账号 | 免费 |
| 4 | 生成图片 | GPT Image Two | ChatGPT Plus / Pro 订阅 | 订阅内 |
| 5 | 做视频 | Hyperframes | 无(本地渲染) | 免费开源 |
两家服务商任选:
配置方法(09:35):官网注册 → 复制 API Key → 回到 Pi 直接对话:
帮我设置 tavily search 用的 key,key 是 xxxxx
Pi 会自己把 Key 写进配置,不需要手动改配置文件。
验证任务(09:57):
搜一下这周最重要的五条 AI 新闻,按重要程度排序,
每条说明发生了什么、为什么重要、适不适合做短视频,
保存到一个 news.md 文件
Pi 会调用搜索 skill,去重、排序、评价搜索结果,最后在当前目录生成 news.md(Web 版右侧还有预览界面)。
验证任务(11:26):把 PDF 拖进工作目录 → 刷新文件浏览器 → @ 这份报告:
读取这个 PDF,总结里面的核心信息
十几页的技术报告(视频用的是 DeepSeek 技术报告)会被读完并整理成结构化总结。重点是全程不用复制内容、不用自己提文字,文件丢给它就行。
不需要任何账号,直接安装就能用。
演示工作流(12:40)——把 5.1 生成的 news.md 变成“语音 + 网页”:
@这份文件 把这份文件改成一分钟的口播稿,转成语音,
做一个 HTML 界面,里面包含文稿和音频,排版简单直观,
然后帮我打开这个网页
约 3 分钟后 Pi 自动完成四步:写口播稿 → 调 Edge TTS 生成 MP3 音频 → 写 HTML 把文稿和音频装进去 → 自动弹出网页。这一步已经有工作流的感觉了:搜索 skill 找信息、Pi 整理、TTS 出语音、HTML 落地成可打开可分享的文件。以前聊天机器人只能把结果输出在对话框里,Pi 能把答案变成你电脑上的文件、网页、音频。
原理是调用 Codex 里的 GPT Image Two 生图——订阅了 ChatGPT Plus 或 Pro 就能把生图能力交给 Pi 用。
验证任务(14:37):
根据这个文件的第一条 AI 新闻,用 GPT Image Two 生成一张
适合短视频封面的图片,风格是简洁的 3D 科技感
已知坑(15:06):Mac 上直接可用;Windows 上遇到脚本报错不用慌——万事皆问 AI,让 Pi 检查 skill 脚本哪里有 bug、修复再运行,它自己完全能修好。
UP主最近最喜欢用的 skill,适合做讲解类视频、产品介绍、科普动画、过程演示。思路很巧妙:不是直接让 AI 生成视频,而是先让 Agent 写一个带动画的 HTML 网页——HTML 是代码,生成非常稳定、可编辑、可预览,然后再逐帧渲染成完整视频。你不需要懂 HTML 代码,只要告诉它你想要什么。
验证任务(16:07):
用 Hyperframes 做一个 20 秒的动画,解释什么是 agent,
只生成 HTML,不需要渲染视频
它会做出标题、转场、图形动画、字幕节奏,再配上语音和图片就能变成完整视频。
【背景补充】Hyperframes 背景资料:HeyGen 公司 2026 年 4 月开源(Apache 2.0,GitHub heygen-com/hyperframes,上线数天 6600+ star,现 24k+)。核心命令 npx hyperframes render --output output.mp4,用无头 Puppeteer 逐帧采集 + FFmpeg 编码,确定性渲染(同一 HTML 每次输出完全一致);支持 GSAP、Lottie、CSS 动画、Three.js、WebGL shader 转场;要求 Node.js 22+ 和 FFmpeg。它不止支持 Pi,Claude Code、Cursor、Codex 等支持 skill 的 Agent 都能装(npx skills add heygen-com/hyperframes)。注意它只管“合成和渲染”——图片、视频素材、音频这些内容资产要靠其他 skill(如 5.4 的生图)或你自己提供。
五个 skill 都解锁后(搜索的、读资料的、语音的、生图的、做视频的),单独看每个都不复杂,串起来就能做很复杂的任务。
做一个调研项目:一台英伟达 GB200 NVL72 的 AI 机柜要 300 万美元左右,钱到底花在了哪里?要求:做成中文的 Hyperframes 演讲,用 TTS 配音,用 GPT Image Two 生成图片素材,关键数字数据必须有来源,不确定的地方写清楚是估算,长度约 2 分钟,需要有字幕显示,不需要渲染视频。
只需要说清“我要什么结果”,Pi 自动拆解成 7 步执行:
| 步骤 | 动作 | 用到的 skill |
|---|---|---|
| 1 | 搜英伟达官方 GB200 NVL72 产品信息、公开报道与成本估算 | 搜索 |
| 2 | 整理资料,把关键数字和来源单独记录 | — |
| 3 | 拆解成本:算力核心、网络互联、液冷等 | — |
| 4 | 写中文演讲稿,把硬件名词翻译成人话 | — |
| 5 | 生成图片素材 | GPT Image Two |
| 6 | 生成中文语音解说 | Edge TTS |
| 7 | 把标题页、成本拆解、图片、动画、语音组合成演讲页面 | Hyperframes |
交付物是一个完整的项目文件夹:资料笔记、成本拆解、中文演讲稿、语音文件、全部图片素材,外加一个可直接打开预览的 Hyperframes 页面。成品里连数据口径都交代得很清楚(如“36 颗 GB200 Superchip 按 HSBC 估计每颗 6–7 万美元、合计约七到八成整机成本”“整柜功耗 120kW、重 1.36 吨,需要液冷供电等工程成本”“最不确定的是实际成交价和非芯片部分拆分”)。
很多人担心 Agent 跑任务很贵,实际体感:
| 问题 | 处理办法 |
|---|---|
| Windows 上 skill 脚本报错(如生图 skill) | 不用慌,直接让 Pi 自己检查 skill 脚本的 bug 并修复重跑(15:13) |
| 扫描版 PDF 读不出文字 | 在模型设置里打开图像识别能力(11:17) |
| 列表里没有我的模型服务商 | 选 custom 自定义接口,填 base URL + API Key(06:59) |
| 不确定当前装了什么能力 | 问 Agent:“你现在安装了哪些 skills?”(16:34) |
【背景补充】官方终端版常用命令(Web 版用不到,终端党备查):
| 命令 | 作用 |
|---|---|
pi -c |
继续上一次会话 |
pi -r |
浏览并恢复历史会话 |
/model <名字> 或 Ctrl+L |
切换模型 |
/tree |
可视化查看对话分支树 |
pi install npm:@foo/pi-tools |
安装 npm 扩展(也支持 git:github.com/user/repo) |
pi list |
查看已安装扩展 |
| 项 | 内容 |
|---|---|
| 视频 | Pi Agent:比Claude Code和Codex更适合普通人的AI工具(BV15wGR6CEhY,21:18) |
| UP主 | 第四种黑猩猩CHIMP |
| Pi 开源仓库 | github.com/badlogic/pi-mono(【背景补充】) |
| 社区文档 | pi.dev(【背景补充】) |
| Hyperframes | github.com/heygen-com/hyperframes(【背景补充】) |
| 字幕/转录副产物 | 仅本地保存(含时间轴转录、元数据、边界说明) |