# GDEFN 软件著作权申请材料参考

## 1. 使用说明

本文档用于整理软件著作权登记的技术性材料，不是法律意见，也不代替登记机构当期规则。正式提交前，请申请人核对中国版权保护中心或实际办理平台的最新要求，并由权利人确认名称、日期、开发方式、权利取得方式和著作权归属。

文档中使用【待填写】标记的内容必须由申请人如实补充，不应由软件或代理人猜测。

## 2. 建议登记信息

| 字段 | 建议内容 | 核对提示 |
| --- | --- | --- |
| 软件全称 | GDEFN 生物关联智能预测与分析系统 | 所有材料保持完全一致 |
| 软件简称 | GDEFN | 如表单允许填写简称时使用 |
| 版本号 | V1.0 | 界面、文档、申请表一致 |
| 软件类别 | 科学研究/数据分析类应用软件 | 以申报平台的实际分类选项为准 |
| 开发完成日期 | 【待权利人确认】 | 不得仅根据文件时间猜测 |
| 首次发表日期 | 【未发表/待确认】 | “发表”的法律含义由申请人确认 |
| 开发方式 | 【独立开发/合作开发/委托开发，待确认】 | 与合同、任务书和实际贡献一致 |
| 著作权人 | 【姓名或单位全称】 | 与身份/主体证明一致 |
| 权利取得方式 | 【原始取得/继受取得，待确认】 | 如有转让、委托或职务开发，应有对应依据 |
| 硬件环境 | x86-64 个人计算机；完整训练建议配置 NVIDIA CUDA GPU | 根据实际测试环境调整 |
| 软件环境 | Windows/Linux、Python 3.8+、现代浏览器 | 不应声称未实测的精确版本 |
| 开发语言 | Python、HTML、CSS、JavaScript | 与提交源码一致 |

`config.py` 中的软件发布日期字段为 2026-08-23，该技术元数据不当然等于著作权法意义上的“首次发表日期”。申请表应以权利人确认的事实为准。

## 3. 软件功能概述参考文本

### 3.1 简版功能说明

> GDEFN 生物关联智能预测与分析系统是面向 miRNA–mRNA 与药物–靶标二分类任务的本地科研软件。系统提供数据资产概览和质量审计、原始结构图局部网络可视化、快速 Diagonal LDA 节点/特征文件预测、GDEFN 活动检查点节点推理、快速基线现场评估、原始五折训练调度、实验日志解析和预测结果溯源导出。模型检查点按不可变 `run_id` 目录归档，仅在同一运行的五折全部成功后原子切换活动清单。系统在每条结果中保留预测引擎来源，明确区分结构浏览、现场统计基线、历史论文指标与活动检查点的完整模型结果。

### 3.2 开发目的参考文本

> 本软件旨在将 GDEFN 研究代码转化为可操作、可追溯和便于复现的本地科研工作台，降低数据查看、预测、评估、训练与实验记录管理的操作成本，并通过来源标记和数据质量警告减少快速演示结果被误当作论文模型结果的风险。

### 3.3 主要技术特点

1. 采用浏览器交互与 Flask 本地 API 的前后端分离式组织。
2. 提供低依赖 Diagonal LDA 与完整 GDEFN 检查点两种严格分离的预测引擎。
3. 原始模型融合三视图 GCN、视图注意力、双编码器门控融合、超图与图扩散特征增强以及跨视图对齐。
4. 内置数据矩阵形状、标签分布、折次数量、重复、训练/测试交叉和越界索引的自动审计。
5. 训练进程后台管理、不可变运行目录中的每折最优检查点/元数据归档、五折全成功后的活动清单原子发布和实验日志解析。
6. 以 JSONL 保留预测历史，以 CSV 导出逐样本概率、结论、标签和来源信息。
7. 所有项目路径根据程序文件所在位置计算，整体目录可跨盘符复制。
8. 以确定性 BFS 抽取原始结构局部诱导子图，通过原生 SVG 力导向布局实现标签/划分/度着色、节点检查、平移缩放与矢量图导出。

## 4. 功能模块与代码对应

| 功能模块 | 实现文件 | 可验证功能 |
| --- | --- | --- |
| 软件元数据与便携路径 | `research_software/config.py` | 数据、检查点、日志、Web 和运行目录解析 |
| Web 服务与 API | `research_software/app.py` | 状态、预测、图子图、评估、模板、历史、训练接口 |
| 数据质检与快速基线 | `research_software/predictor.py` | 加载、缓存、审计、Diagonal LDA、指标与文件解析 |
| 图网络只读抽样 | `research_software/graph_service.py` | 原始边/标签/划分严格解析、线程安全 LRU 缓存、确定性 BFS 与诱导边统计 |
| 完整检查点推理 | `research_software/predictor.py` | 依赖和安全加载检查、活动清单/元数据/内部字段校验、SHA-256 溯源、整图推理与视图注意力 |
| 训练任务管理 | `research_software/training.py` | 参数校验、后台进程、进度、停止与日志 |
| 历史论文指标 | `research_software/research_log.py` | 五折与六指标日志解析 |
| 科研可视化界面 | `research_software/web/` | 导航、表单、表格、交互式 SVG 图网络、ROC、混淆矩阵、训练终端 |
| 原始训练入口 | `main.py` | 五折实验、早停、指标、`runs/<run_id>` 检查点/元数据原子保存和 `active_manifest.json` 发布 |
| GDEFN 模型 | `models.py` | GCN、Attention、DEF、UFE、对比头和分类器；核心类 `GDEFN_MH_Fusion` |
| 数据与图处理 | `utils.py` | 特征/标签/划分加载、图构建、加删边和图扩散 |

## 5. 申请材料建议清单

下表是工程整理清单，不表示当期登记规则的穷尽性清单。

| 材料 | 建议内容 | 本项目可用资源 |
| --- | --- | --- |
| 申请表 | 软件名称、版本、完成/发表情况、开发方式、权利人 | 本文档第 2 节仅作技术参考 |
| 源程序鉴别材料 | 按办理平台当期规则排版的代表性源码 | `research_software` 与必要的原始核心代码 |
| 文档鉴别材料 | 用户手册或设计说明书 | `01_软件设计说明书.md`、`02_用户操作手册.md` |
| 软件截图 | 启动、总览、预测、评估、质检、训练、关于 | 运行本地 Web 界面后截取 |
| 主体证明 | 个人或单位身份资料 | 由申请人提供 |
| 权属证明 | 合作、委托、职务开发、转让等相关文件 | 根据实际权属提供 |
| 第三方代码/数据说明 | 引用来源、许可、改编与原创部分边界 | 请结合仓库来源、论文和合同单独整理 |

## 6. 源程序材料整理建议

### 6.1 建议纳入的软件化代码

- `research_software/app.py`
- `research_software/config.py`
- `research_software/predictor.py`
- `research_software/graph_service.py`
- `research_software/training.py`
- `research_software/research_log.py`
- `research_software/web/index.html`
- `research_software/web/styles.css`
- `research_software/web/app.js`

如申请材料需要展示完整论文模型的实现，可根据权属和当期格式要求纳入 `main.py`、`models.py` 和 `utils.py` 的相关部分。

### 6.2 通常不作为源码正文的内容

- 大型数据集文件。
- 二进制检查点 `.pt`。
- 运行期预测历史。
- 个人或未公开实验数据。
- `__pycache__` 、临时文件和环境缓存。
- 不属于申请人且未获授权的第三方代码。

### 6.3 排版与一致性

1. 在页眉或封面中统一使用软件全称和 V1.0。
2. 保留文件名、关键注释和函数边界，不要为满足页数随意复制或填充代码。
3. 对源码中的用户名、本机路径、密钥和个人数据进行检查。本软件的正常路径逻辑已使用相对项目位置，正式导出前仍应再扫描一次。
4. 源码材料和文档材料中的功能描述必须对得上实际界面和可执行代码。
5. 具体页数、每页行数、页号和特殊交存方式以当期官方指南为准。

## 7. 文档材料建议结构

如将本项目文档转换为 PDF 或 Word 作为鉴别材料，建议至少包含：

1. 封面：软件全称、版本、文档名和权利人。
2. 软件概述：背景、目标、适用对象与科研声明。
3. 运行环境：快速模式与完整模式的依赖差异。
4. 安装启动：使用项目相对路径的便携式启动流程。
5. 功能说明：总览、预测、图网络可视化、评估、训练、质检、记录与架构。
6. 操作示例：每个主要功能使用一个不含敏感数据的示例。
7. 输入输出：0 基索引、特征列数、文件编码、概率与来源字段。
8. 限制与错误处理：无实体映射、DTI 划分泄漏、检查点依赖和科研声明。

## 8. 建议截图清单

| 编号 | 截图 | 应展示的证据 |
| --- | --- | --- |
| S01 | 科研总览 | 软件名称、版本风格、数据概况和历史指标来源 |
| S02 | 智能预测—快速基线 | Diagonal LDA 标签、数据集、折次、0 基说明与结果来源 |
| S03 | 智能预测—GDEFN | 活动 `run_id`、检查点状态或含 SHA-256 的 `gdefn-checkpoint` 输出，不应使用基线结果冒充 |
| S04 | 特征文件预测 | 文件类型、维度提示、模板下载和基线范围说明 |
| S05 | 图网络可视化 | 数据集、折次、0 基中心节点、局部 SVG 网络、着色图例、节点检查器和“原始结构边/无实体映射”提示 |
| S06 | 模型评估 | 七项现场指标、ROC、混淆矩阵和“不等于论文五折结果” |
| S07 | 训练中心 | 参数、进度、终端日志、活动 `run_id` 和五折检查点状态 |
| S08 | 数据质检 | mi-m 通过状态与 DTI 重复/交叉警告 |
| S09 | 实验记录 | 原始日志和软件历史的独立页签 |
| S10 | 模型架构 | 3V-GCN、DEF、UFE、分类输出和默认参数 |
| S11 | 帮助与关于 | 软件全称、V1.0、本地运行与科研声明 |

截图应使用测试数据，不应出现用户账号、文件绝对路径、未公开数据或密钥。

## 9. 原创性与第三方资产核对

软件著作权登记材料不应将他人代码、论文方法、数据集或预训练权重无条件地宣称为申请人原创。提交前建议完成如下核对：

1. 核对 GDEFN 基础方法、扩展模块、Web 软件化代码和各作者的实际贡献。
2. 核对仓库来源、版本历史、论文作者、代码许可文件和所在单位规定。README 中的许可描述不应在缺少正式许可文件时被单独当作充分权利证明。
3. 核对 miRNA–mRNA 和 DTI 数据集的来源、许可、二次分发限制和引用要求。
4. 如使用了开源库，保留相应名称、版本、许可和归属说明。
5. 如代码为合作、职务或委托开发，由参与方对权属和署名书面确认。

## 10. 技术声称的证据边界

| 可以如实描述 | 不应这样描述 |
| --- | --- |
| 软件提供快速 Diagonal LDA 预测 | 快速预测就是 GDEFN 论文模型 |
| 图网络页按中心节点浏览所选折次的原始结构局部图 | 可视化边就是本次模型新预测的关联，或力导向距离代表生物机制 |
| 有效活动清单指向同一五折完整运行，且 `.pt`/侧车元数据通过校验时可运行完整 GDEFN 节点推理 | 只有历史指标日志或中断运行的部分折次也可以运行论文模型 |
| 系统显示特征矩阵行索引 | 系统已经识别出具体药物、靶标或 miRNA 名称 |
| 软件发现并披露 DTI 原始划分交叉 | DTI 全部折次均为无泄漏独立测试 |
| 历史日志展示原实验五折六指标 | 当前预测一定由生成该日志的权重得出 |
| 系统为科研辅助工具 | 系统结果可替代湿实验或临床判断 |

## 11. 申请前一致性检查表

申请人可在正式导出前逐项勾选：

- [ ] 申请表、封面、源代码和手册的软件全称完全一致。
- [ ] 版本均为 V1.0，或已有书面版本变更说明。
- [ ] 权利人、开发方式、完成日期和发表情况由真实证据支持。
- [ ] 代码中不含密钥、账号、个人绝对路径或不应披露的数据。
- [ ] 已经核对开源依赖、原始代码、论文和数据集权属。
- [ ] 所有界面截图与当前提交版本一致。
- [ ] 截图中的 GDEFN 结果确实来自活动清单指向的 `gdefn-checkpoint`，已保留 `run_id`、SHA-256 与折次；否则已明确标注快速基线。
- [ ] 训练中断或失败截图没有被描述为“新模型已发布”；活动清单仅在同一运行五折全成功后切换。
- [ ] 文档明确说明 0 基索引、无实体映射与 DTI 划分泄漏风险。
- [ ] 图网络截图明确标注其边来自原始结构图，并保留数据集、折次、中心节点和着色口径；未将 SVG 布局当作模型解释结果。
- [ ] 整体目录在非开发机路径下做过便携性复测。
- [ ] 源程序和文档的排版符合办理平台当期规则。

## 12. 可选的权利人确认页

```text
软件全称：GDEFN 生物关联智能预测与分析系统
版本：V1.0
著作权人：【待填写】
开发方式：【待填写】
开发完成日期：【待填写】
发表状态与日期：【待填写】
第三方代码/数据说明：【待填写】
权属证明附件：【待填写】

本人/本单位已核对上述信息与提交材料，确认其与实际开发、权属和发表情况一致。

确认人：【待填写】
日期：【待填写】
```
