AI Skill evaluation
如何评测一个 AI Skill:从文档、安全到可维护性的完整清单
一套可以实际执行的 AI Skill 评测流程:先确认来源,再检查权限、提示注入、工程质量、维护状态和采用证据。
更新于 2026-08-18 阅读约 7 分钟
适用场景:适合准备安装第三方 Skill、为团队建立准入标准,或希望改进自己 Skill 的开发者。
1
先确认你评测的确实是 Skill
Skill 的核心通常是可被 Agent 按需加载的指令、脚本和资源,而不是一个必须常驻运行的网络服务。仓库标题里出现 skill 并不能作为充分证据,应继续检查 SKILL.md、安装位置、触发说明和配套资源。
如果项目主要暴露 MCP tools、resources 或 prompts,并要求客户端通过协议连接,它更接近 MCP Server;如果同时打包多个 Agent、工作流和钩子,则更接近 Agent Pack。类型判断错误会让后续安全结论失真。
2
七步准入检查
- 来源:确认仓库、作者、许可证、发布包与文档指向同一项目,并记录将要安装的精确版本或提交。
- 文档:验证安装、触发条件、输入输出、失败处理、限制和卸载方式是否完整,而不是只看宣传示例。
- 权限:列出文件、网络、Shell、浏览器和凭证访问范围;默认拒绝与任务无关的权限。
- 静态安全:搜索提示注入、隐藏下载执行、凭证外传、危险命令、路径穿越和不受约束的远程内容加载。
- 隔离验证:在测试账号、临时目录和最小权限环境中运行代表性任务,观察实际访问和副作用。
- 维护状态:检查最近更新、未解决安全问题、依赖锁定、发布节奏和维护者响应,而不只看总 Star。
- 留存证据:报告应给出文件位置、规则、局限和复测日期,确保其他人能复核,而不是只留下一个分数。
3
如何理解 Skill Supermarket 的分数
本站把文档完整度、安全性、工程质量、活跃度和采用度拆开评分。安全风险设置硬上限,流行度不能抵消高危行为;AI Judge 只对已经取得的公开证据做结构化复核。
自动评测适合初筛和持续监测,不替代代码审计、渗透测试或生产环境验证。报告里没有取得的证据,不应被解释成项目已经通过对应测试。
一手资料与可复核入口
Keep exploring