COMP5318 · Machine Learning and Data Mining · S2 2026

Assignment 2:PathMNIST 图像分类 四人分工

这是一份建议分工,不是死规定。B、C、D 各负责一个模型(SVM + PCA / MLP / CNN):代码、调参、报告里对应的章节由同一个人写——谁调参谁解释。A 负责数据管线、合并 notebook 和跨模型的章节。每个人在自己的模块里怎么设计、试什么、用什么超参,都自己发挥;唯一的硬规则是:四个人不要同时改同一个 .ipynb——B / C / D 各用自己的 dev notebook,只有 A 改 master.ipynb。 截止 10-30(周五)23:59,「第几周」只是参考节奏。

我是:
A
数据管线 · notebook 合并 · 跨模型章节
无网格 · 笔记本这条链的单点
common.py 越早交越好

自己发挥:探索想展示什么、预处理选哪些、报告的叙事线怎么串,都由你定。给别人的只有 common.py 里那几个名字,其余随意。

你是笔记本这条链的单点:merge_nb.py 写好用法,让 C 能顶替你。

B
前 6 周算法:SVM + PCA
网格 27 组(建议)
中等 CPU 耗时

自己发挥:超参取值范围、PCA 保留多少维、要不要换成别的算法(RF / kNN …),都按你小测和实验的结果自己定;改了在报告里说明理由就行。

网格的预测先记下来再看结果,报告里才有「是否符合预测」可讨论。

C
MLP + 报告主编
网格 27 组(建议)
算力最轻 · A 的后备

自己发挥:MLP 的层数 / 宽度 / 正则 / 优化器怎么搭、style sheet 订多细,都由你定。

MLP 算力最轻,所以你兼任报告主编,也是 A 的后备。style sheet 越早发越有人遵守。

D
CNN
网格 27 组(建议)
全组最重,建议最先开跑

自己发挥:卷积块怎么搭、要不要数据增强、网格取哪些值,都自己定。只有两条是 spec 的硬规定:模型要自己搭(不能用 keras.applications)、至少调 3 个超参。

CNN 是全组算力最重、也最容易跑不完的一块,留足挂夜的时间。