jos-experiments
当你要为投向《软件学报》(Journal of Software, JOS) 的稿件设计或打磨实验与评测时使用。覆盖研究问题 (RQ) 契约、真实系统与数据集的选取、可信基线、评价指标与统计显著性/效应量、消融与抗污染的大模型评测、挖掘类研究的出处锁定、以及威胁有效性 (threats to validity) 的分类论证,帮助你把证据与论点对齐,达到《软件学报》(Journal of Software) 软件学科同行评审对实证严谨性的要求。
npx skills add brycewang-stanford/Awesome-Journal-Skills --skill jos-experiments --agent claude-code
Same command for any agent — swap --agent for codex, cursor, copilot.
Weekly change comes from our own snapshots, not the repository page — it measures attention, not adoption.
# 《软件学报》实验设计与呈现 (Journal of Software Experiments) 本技能帮你把实验做成"证据与论点相称"的样子——这是《软件学报》(Journal of Software, JOS) 软件学科评审的核心门槛。本刊审稿人来自软件工程、系统软件、数据库、安全等方向,会审计你的 数据集、基线、指标与威胁论证。方法论口径与本刊学科文化一致(见 [`resources/official-source-map.md`](../../resources/official-source-map.md))。 ## 一、研究问题 (RQ) 契约 - 把评测组织为若干 **RQ**,每个 RQ 明确:问什么、用什么数据、用什么指标、期望什么结论。 - RQ 应回答"软件工程问题",而非"我的模型分数高不高"。 - 每个 RQ 与引言的贡献一一对应;读者应能从 RQ 直接读出论文论点。 ```text RQ1 方法在真实项目上的有效性如何(相对基线)? RQ2 各组成部分的贡献如何(消融)? RQ3 在不同规模/领域项目上是否稳健(外部效度)? RQ4 代价/开销如何(可用性)? ``` ## 二、真实对象:系统与数据集 - 用**真实系统/真实项目/真实数据集**,而非玩具输入;说明来源、规模、代表性。 - 数据集要交代采集时间、筛选标准、预处理;训练/验证/测试划分明确、无泄漏。 - 若用公开基准,说明版本;若自建,说明构建与标注协议、标注者一致性 (如 Kappa)。 ## 三、可信基线 - 基线要**公平且强**:用原作者实现或经过调参的复现;说明超参搜索与选择依据。 - 避免"稻草人基线"(故意弱化对手)——审稿人会识别并质疑。 - 与最接近的已有工作直接对比,而非只比古老或不相关方法。 ## 四、指标、统计显著性与效应量 - 指标匹配任务:分类用 Precision/Recall/F1/AUC,定位用 Top-N/MAP/MRR,性能用时延/吞吐/内存等。 - 多次运行报告均值与方差;随机性来源(种子、划分)要固定或多次平均。 - **统计检验**:组间差异用合适的假设检验(如 Wilcoxon/Mann-Whitney),多重比较要校正。 - **效应量**:给出 Cliff's delta、Cohen's d 等,说明差异的实际大小,而非仅 p 值。 - 尽量给置信区间,避免只报单点数字。 ## 五、消融与大模型抗污染评测 - **消融实验**:逐一移除组件,隔离每部分的边际贡献,支撑"哪一部分真正起作用"。 - 若用大模型/深度学习: - 记录模型标识与版本、日期、温度等参数;缓存原始输出以便复现。 - **数据污染 (contamination)**:留意评测数据是否可能出现在模型训练语料中;用时间切分 (训练截止日期之后的数据
- 一、研究问题 (RQ) 契约
- 二、真实对象:系统与数据集
- 三、可信基线
- 四、指标、统计显著性与效应量
- 五、消融与大模型抗污染评测
- 六、挖掘类研究的出处锁定
- 七、威胁有效性 (threats to validity)
- 八、实验自检清单
- 九、输出格式
- 十、按方向定制的评测要点
- 十一、结果呈现的诚实原则
- 十二、输出格式(方向定制版)
What does the jos-experiments skill do?
当你要为投向《软件学报》(Journal of Software, JOS) 的稿件设计或打磨实验与评测时使用。覆盖研究问题 (RQ) 契约、真实系统与数据集的选取、可信基线、评价指标与统计显著性/效应量、消融与抗污染的大模型评测、挖掘类研究的出处锁定、以及威胁有效性 (threats to validity) 的分类论证,帮助你把证据与论点对齐,达到《软件学报》(Journal of Software) 软件学科同行评审对实证严谨性的要求。
How do I install it?
Run `npx skills add brycewang-stanford/Awesome-Journal-Skills --skill jos-experiments --agent claude-code` — it drops the skill into your project so the agent can pick it up. Swap the --agent value for codex, cursor or copilot if you use one of those.
Where does this skill come from?
From brycewang-stanford/Awesome-Journal-Skills, a repository with 984 stars. We read it straight from the repository tree rather than a submitted listing, so what you see here is what is actually published.
Is a popular skill a good skill?
Not necessarily. Stars measure attention, not adoption — a repository can trend for a week and be abandoned. That is why we show the weekly change from our own snapshots next to the total, instead of a single flattering number.