prai-experiments
在为《模式识别与人工智能》(Pattern Recognition and Artificial Intelligence, PR&AI) 设计与呈现模式识别/机器学习实验证据时调用。覆盖研究问题(RQ)拆解、公平基线与相同划分/算力、评测指标选择(准确率/F1/mAP/IoU/AUC 等)、多次运行的均值±标准差与统计显著性检验、消融实验、复杂度与开销报告、数据泄漏与评测污染的防范,以及把每条主张绑定到证据的呈现方式。用于把 AI 细分方向的实证部分做到经得起外审对"基线是否公平、结果是否可信、消融是否充分"的质询。
npx skills add brycewang-stanford/Awesome-Journal-Skills --skill prai-experiments --agent claude-code
Same command for any agent — swap --agent for codex, cursor, copilot.
Weekly change comes from our own snapshots, not the repository page — it measures attention, not adoption.
# 《模式识别与人工智能》实验设计与呈现 本技能把《模式识别与人工智能》(Pattern Recognition and Artificial Intelligence, PR&AI) 论文的实证 部分落到可执行清单。本刊聚焦模式识别与机器学习,外审对实验严谨性要求高:公平基线、统计口径、消融、 开销缺一易被质疑。事实核验日期 2026-07-09,见 `resources/official-source-map.md`。 ## 一、从主张到 RQ 先把贡献拆成可检验的研究问题(RQ),每个 RQ 对应一组实验: - RQ1(有效性):本文方法是否在目标任务上优于最强基线? - RQ2(机制):哪个组件带来提升?(→消融) - RQ3(鲁棒性):在噪声/长尾/小样本/跨域等更难设定下是否仍有效? - RQ4(开销):精度提升的时间/显存/参数代价如何? 每个 RQ 的结论必须由对应证据支撑,不多不少。 ## 二、公平基线(外审首要质询) - 基线在**相同数据划分、相同算力、相同调参预算**下比较;不拿别人论文里不可比的数字直接对照。 - 覆盖相关工作中提到的代表性方法(见 `prai-related-work`),尤其是最接近工作。 - 复现基线时说明来源(官方代码/自实现),并诚实标注差异。 - 避免"只调自己方法、不调基线"的隐性不公。 ## 三、评测指标与统计严谨 | 任务 | 常用指标 | |---|---| | 分类/识别 | 准确率、F1、精确率/召回率、AUC | | 目标检测 | mAP、AP@IoU | | 分割 | mIoU、Dice | | 检索/排序 | mAP、NDCG、Recall@K | | 长尾/不平衡 | 分组精度、平衡准确率 | 统计纪律: - **多次运行**(不同随机种子)报告**均值±标准差**,不报单次最优。 - 关键比较做**显著性检验**(如配对 t 检验、Wilcoxon),报告 p 值。 - 指标选择与任务匹配,避免只挑对自己有利的指标。 ## 四、消融实验 - 逐组件消融,量化每个机制的独立贡献(去掉 X 掉多少)。 - 关键超参数的敏感性分析(给曲线或表)。 - 消融要能支撑"方法新意来自 Y 机制"这一主张,与相关工作 delta 呼应。 ## 五、数据泄漏与评测污染 模式识别/机器学习实验的可信性红线: - 训练/验证/测试**严格划分**,无样本重叠、无标签泄漏。 - 预训练语料/权重与评测集不重叠;用大模型时说明是否见过评测数据。 - 调参在验证集上做,测试集只用于最终报告。 - 数据增强、采样策略对所有方法一致。 ## 六、开销与复杂度 - 报告训练/推理时间、显存、参数量、FLOPs(据任务选)。 - 精度-开销权衡用图或表呈现,避免只报精度不报代价。 - 硬件环境(GPU 型号、数量)写
- 一、从主张到 RQ
- 二、公平基线(外审首要质询)
- 三、评测指标与统计严谨
- 四、消融实验
- 五、数据泄漏与评测污染
- 六、开销与复杂度
- 七、结果呈现
- 八、常见被拒理由与对策
- 九、实验章节自检清单
- 十、与其他技能衔接
- 十一、数据集选择与报告
- 十二、结果分析而非堆数字
- 十三、实验与其他技能的一致性
- 输出格式
What does the prai-experiments skill do?
在为《模式识别与人工智能》(Pattern Recognition and Artificial Intelligence, PR&AI) 设计与呈现模式识别/机器学习实验证据时调用。覆盖研究问题(RQ)拆解、公平基线与相同划分/算力、评测指标选择(准确率/F1/mAP/IoU/AUC 等)、多次运行的均值±标准差与统计显著性检验、消融实验、复杂度与开销报告、数据泄漏与评测污染的防范,以及把每条主张绑定到证据的呈现方式。用于把 AI 细分方向的实证部分做到经得起外审对"基线是否公平、结果是否可信、消融是否充分"的质询。
How do I install it?
Run `npx skills add brycewang-stanford/Awesome-Journal-Skills --skill prai-experiments --agent claude-code` — it drops the skill into your project so the agent can pick it up. Swap the --agent value for codex, cursor or copilot if you use one of those.
Where does this skill come from?
From brycewang-stanford/Awesome-Journal-Skills, a repository with 984 stars. We read it straight from the repository tree rather than a submitted listing, so what you see here is what is actually published.
Is a popular skill a good skill?
Not necessarily. Stars measure attention, not adoption — a repository can trend for a week and be abandoned. That is why we show the weekly change from our own snapshots next to the total, instead of a single flattering number.