开源 · MIT 许可 · 兼容 Claude CodeDeepSeek Harness 等 AI 编程助手

让 AI 像资深测试工程师
一样工作

一套面向 AI Agent 的测试工程 Skill 框架
装进编程助手,AI 就能按资深工程师的方式做测试:
读需求、排风险、写用例、跑自动化、出报告。

一位机器人质检工程师站在明亮的工作台前,检查悬浮屏幕上的软件界面
质检员拿着放大镜仔细检查一部巨大的手机,寻找隐藏的缺陷
质量保障

软件发布之前,
总得有人先把住质量关

每一款软件上线前,都要回答成百上千个「如果」: 并发下单会不会超卖?优惠券到期会不会自动失效?接口异常时数据会不会错乱?

干这件事的,是软件测试工程师: 在缺陷到达用户之前发现它、定位它,再确认它被修好。

qa-skills 做的,就是让 AI 助手学会这套本事。

为什么需要它

能写,更要能执行。

通用大模型写出的测试用例,常常看着专业、实际没法执行:
判定模糊、占位符没替换、时限没说清、入口是编的。这是能力问题,更是纪律问题。

一张皱巴巴的纸条,字迹模糊不清,周围飘着问号
✗ 无 Skill 的模型产出

判定模糊,无法执行

预期结果不可判定,等于没有验证:

「检查优惠券功能是否正常
「正常」是什么标准?谁判定?等多久算超时?
判定不了的用例,覆盖再全也计零分。
整齐的不锈钢量勺、显示精确数字的计时器和玻璃量杯摆在干净的桌面上
✓ qa-skills 的真实产出

步骤精确,判定可量化

前置、步骤、预期、时限,四要素齐备:

「选一张 2 分钟后到期 的已发布优惠券,等待到期。
预期:1 小时内状态自动变为「已结束」,
超过 1 小时即判失败。」
任何测试人员拿到就能执行,不用讲解。

产出标准只有一条:
任何一个没接触过这个需求的人,拿到文件就能直接执行。 背后是 8 条可执行性硬标准,评测中一票否决。

一块发光的琥珀色知识芯片正在被安装到机器人头部,光粒上升
它是什么

不是软件,
是一套装进 AI 的工作方法。

它由 10 个领域 Skill 和一个共享知识库(core/)组成, 全部是 Markdown 指令文件。 装进 Claude CodeDeepSeek Harness 这类编程助手,放对目录就能生效。

装上之后,AI 助手就有了资深工程师的工作纪律: 先澄清什么,依据什么排风险,哪些类型必测,哪些明确不测, 每条结论标注几级证据。

01

10 个领域 Skill + 共享知识库

需求分析、策略、用例、评审、执行、缺陷、回归,每个环节一个专属 Skill,按需加载。

02

一条自动接力的流水线

每个阶段的产出都写成文件,不靠对话记忆。中断了,新开一个对话接着跑。

03

关键决定,由你拍板

需求没写清的,先问你;Bug 怎么定性、预算设多少,AI 助手只提案、不代答。你的裁决会记录在案,后续不得推翻。

怎么工作

一句指令,从需求到报告。

对 AI 助手说「帮我测试这个需求」,从需求到报告,七个环节自动接力,每个环节都有明确的产出物。

现代化质检流水线:软件界面卡片在传送带上依次经过各个检查站,最终盖上绿色合格章
1

需求分析

不懂就先问
2

测试策略

锁定高危区域
3

用例设计

人和机器都能读
4

用例评审

再挑一遍错
5

自动执行

浏览器 + 接口
6

缺陷分析

追到出错代码
7

回归 + 报告

证据齐全
能力

从用例到回归,
每道工序都有对应的 Skill。

每个 Skill 单独可用,也能串成完整流水线。需要哪一段,就用哪一段。

一张整齐的检查清单悬浮在平板电脑上方,每条都有绿色对勾
test-case-writing

用例设计

代码优先:先读实现、审出潜在缺陷,再落笔。产出两份,markmap 脑图给人读,schema.yaml 给机器校验。

发光的全息雷达地图,高风险区域插着小红旗,安全区域泛着绿光
test-strategy

测试策略

风险评级必须给出证据;性能、安全、并发等十个类型,逐一决定测还是不测,每个决定都留下记录。说不清依据的策略,等于没有策略。

一个大放大镜悬停在文档上方,镜片下聚焦显示一行带绿色对勾的文字
test-case-review

用例评审

把所有能测的点列全,作为基准逐条复审:覆盖够不够、能不能执行,直接修订文件并留下审查记录。

白色机械臂在键盘上打字,旁边的显示器上显示代码和绿色运行按钮
automated-e2e-testing · api-testing

自动化执行

用例转成可运行的 Playwright / pytest 代码:按 Page Object 规范组织,测试数据自己造、跑完自己清。

侦探式放大镜在蓝色电路中发现一只发着橙光的小虫子
bug-analysis

缺陷分析

先复现,再读代码定位到出错的那一行,然后分析影响面、给出回归建议。产出的 Bug 条目带根因、带证据。

一张柔软编织的安全网稳稳接住几枚下落的彩色应用图标
regression-testing

回归测试

从代码改动推算波及范围,生成回归清单。防止修一个、坏三个。

实测效果

每一个数字,都来自实测。

同一批任务,同一个模型,唯一差异是装没装 qa-skills
数字如实披露,包括不好看的那些。

0%
用例合格率

格式与内容逐条核对

不装时 26%
0%
植入缺陷检出率

代码审查任务实测

换一套裁判评:100%
0/9
自动化脚本真实跑通

真浏览器、真应用实测

不装时 0/9
0.0
类型决策覆盖率

最弱模型上实测

不装时为 0

也如实交代代价:Token 成本约 3.3 倍;API 通过率出现了回落(74% → 52%),因为严格校验更容易暴露失败,宽松校验容易「假通过」。 覆盖提升:写用例 +8.7pp全任务 +13.2pp、找缺陷 +9.7pp。 完整数据见 README,每版 Release 附跨模型增益矩阵快照。

机器人把一张印有绿色批准按钮和红色拒绝按钮的决策卡片递到人的手中

它知道,什么该由你决定。

需求有歧义,先澄清;执行走人工还是自动化,你选; Bug 怎么定性、预算上限设多少,你说了算。 这四类检查点,AI 助手只提案、不代答

每一次裁决都记录在案,后续阶段照办,不得推翻。 拍板的,始终是你。

开始使用

两步,开始。

不需要账号,不需要订阅。两条命令,一句话。

1

把 Skill 装进 AI 编程助手

终端里执行(macOS / Linux),也可以按 README 手动复制文件:

$ git clone https://github.com/fishzjp/qa-skills.git
$ cd qa-skills && ./install.sh
# 选择装到哪个助手,或 ./install.sh --auto 全自动

DeepSeek Harness(dsh)?插件已上架 npm,一条命令装好:

$ dsh plugin --profile web add dsh-qa-skills
2

对 AI 助手说一句话

像给测试同事派活一样:

你,对 AI 助手说
「帮我测试这个需求:{需求描述 + 仓库地址}」

需求分析、测试策略、用例设计、评审、执行、缺陷分析、回归与报告, 流水线就此跑通。只需要其中某一步,直接说需求就行,不必走全流程。