# 数据采集清单与执行操作指南
## SGHC 私域电商客户忠诚度 DBA 行动研究（7 月 30 日改版修订稿）

> 编制日期：2026-09-25　|　对应修订稿：`修订稿_SGHC私域电商客户忠诚度研究_20260924.docx`（31 条诚实占位标注）
> 配套：《数据采集与分析规格书》（逐项裁定）、《修订说明》§十、`MOCK_synthetic_test_data_DO_NOT_USE_IN_THESIS/`
> **铁律**：零编造；MOCK 非真实数据、严禁入论文；原件只读；跨版本冲突（D15/D5）须作者先裁定；**勿用 WPS 另存 docx**。

---

# 第一部分 · 数据采集与记录文件清单

文件分三类：**①采集/记录模板**（空白，工具包已提供）→ 作者据实填写；**②数据落地文件**（真实数据存放处，同名替换 MOCK）；**③分析脚本**（跑出统计量/图）。

## 1.1 采集/记录模板（✅ 工具包已提供空白模板，直接用）

| 用途 | 文件（`研究工具包/` 下） | 状态 |
|---|---|---|
| Cycle I 问卷（PT/BT/IQ） | `research_instruments/01_周期一_客户信任与互动质量问卷.md/.docx` | ✅模板有　❌作答数据缺 |
| Cycle II 问卷（AC/CC/LI+NPS） | `research_instruments/05_周期二_客户承诺与忠诚问卷.md/.docx` | ✅模板有　❌作答缺　⚠️条目数待 D15 裁定 |
| 客户访谈提纲 | `research_instruments/02_周期一_客户访谈提纲.md/.docx` | ✅有　❌转录缺 |
| 员工访谈提纲 | `research_instruments/03_周期一_员工访谈提纲.md/.docx` | ✅有　❌转录缺 |
| 社群观察记录表（G1–G5） | `research_instruments/04_社群观察记录表.md/.docx` | ✅有　❌编码记录缺 |
| 21 天挑战记录表 | `research_instruments/06_21天健康挑战活动记录表.md/.docx` | ✅有（612/589）　❌被试级明细缺 |
| 知情同意书 | `research_instruments/07_知情同意书.md` | ✅已签署并附于 UTM REC 申请表 |
| 问卷录入模板 | `data_templates/01_questionnaire_data_template.xlsx` | ✅空白模板 |
| 交易数据模板 | `data_templates/02_crm_transaction_template.xlsx` | ✅空白模板 |
| 活动打卡模板 | `data_templates/03_activity_checkin_template.xlsx` | ✅空白模板 |
| **数据字典（schema+口径权威源）** | `data_collection_procedures/数据字典_Data_Dictionary.md` | ✅已有，采集须严格对齐 |
| 采集流程总指南 | `data_collection_procedures/数据收集流程总指南.md/.docx` | ✅已有 |

## 1.2 数据落地文件（真实数据填这里 → 同名替换 `MOCK_.../input/`）

### 定量（10 个 xlsx；schema 见 `generate_mock_data.py`，须与数据字典一致）

| # | 落地文件（input/ 同名） | 关键字段 | 真实规模 | 现状 | 支撑标注 |
|---|---|---|---|---|---|
| 1 | `questionnaire_pre.xlsx` | respondent_id, response_time, gender/age_group/purchase_count/member_duration, **PT1–PT6, BT1–BT4, IQ1–IQ5**, Q_reason, Q_suggestion, Q_repurchase | 286（有效） | ❌缺被试级作答 | D11 D12 P1-4 |
| 2 | `questionnaire_post.xlsx` | 同 pre（后测） | 286 | ❌缺 | D11 D12 STAT-t |
| 3 | `questionnaire_cycle2.xlsx` | respondent_id, customer_id, **AC1–AC4, CC1–CC3, LI1–LI3, NPS, NPS_Category**, activity_participation, member_level, last_purchase | 178 | ❌缺　⚠️条目数待 D15 | D15 D21 STAT-omega |
| 4 | `crm_customer_data.xlsx` | customer_id, **customer_type（核心/潜力/沉默）**, **member_level（非会员/银卡/金卡）**, age, province, signup_date/source, points | ~18,000 | ❌缺后台导出 | D1 D6 D10 D13 |
| 5 | `crm_transaction_data.xlsx` | order_id, customer_id, order_date, order_amount, product_category, is_first_purchase | 跨干预前后 ≥6 个月 | ❌缺 | D7 D1 D10 STAT-t CAUSAL |
| 6 | `crm_interaction_data.xlsx` | interaction_id, customer_id, interaction_date, **interaction_type（阅读/点赞/评论/转发/发言）**, channel | 全量 | ❌缺 | D8 D9 STAT-t |
| 7 | `activity_participation_data.xlsx` | participant_id, customer_id, **customer_type**, completed, total_days_completed, completion_rate, exit_reason | 612 报名/589 完成 | ❌缺被试级+分层快照 | D6 D10 D21 CAUSAL |
| 8 | `interview_metadata_customer.xlsx` | interview_id, interviewee_type, purchase_count, transcript_file, coder_1/2, coding_agreement, member_checked | 客户 8（待 D5） | ❌缺 | D5 P2-4 |
| 9 | `interview_metadata_employee.xlsx` | interview_id, employee_id, department, position, tenure_months | 员工 5（待 D5） | ❌缺 | D5 |
| 10 | `community_observations.xlsx` | observation_id, **group_id（G1–G5）**, speaker_type, content_type, interaction_quality, response_count, observer | 5 群 × 多时段 | ❌缺编码 | D4 D17 |
| ＋ | `ugc_content_data.xlsx`（**脚本 05 额外需要**，MOCK 未含） | participant_id, 文本内容, 字数, 主题标签 | 21 天挑战 UGC | ❌缺 | 定性内容分析 |

### 定性（NVivo 指南 `03_..._guide.md` 定义的文件清单）

| 落地文件 | 内容 | 数量 | 现状 | 支撑标注 |
|---|---|---|---|---|
| `P01…P08_客户访谈.docx`（转录稿） | 客户访谈全文转录 | 8（待 D5） | ❌缺 | D5 P2-4 |
| `E01…E05_员工访谈.docx`（转录稿） | 员工访谈全文转录 | 5（待 D5） | ❌缺 | D5 |
| `G1…G5_社群观察.xlsx` | 分群观察编码记录 | 5 | ❌缺 | D4 |
| `UGC_分享内容汇总.docx` | 21 天挑战分享内容 | 1 | ❌缺 | 定性主题 |
| co-design 工作坊/共同解释记录 | 参与者共同诊断/设计/解释证据 | — | ❌缺 | **P2-4（collaborative 标题）** |
| 问卷开放题文本 | Q_reason / Q_suggestion（在文件 1、2 内） | 随问卷 | ❌缺 | 定性补充 |

> MOCK 目录 `mock_qualitative_transcripts/` 的 5 个 txt 为**占位模板**，仅供跑通 NVivo 流程，**非真实语录**。

## 1.3 分析脚本（`研究工具包/data_analysis_scripts/`）

| 脚本 | 读取（cwd 相对名） | 产出 | 适用 |
|---|---|---|---|
| `01_questionnaire_data_analysis.py` | questionnaire_pre/post.xlsx | 描述统计、**信度 α**、相关矩阵、**配对 t**、前后测图 | 定量·问卷 |
| `02_behavioral_data_analysis.py` | crm_customer/transaction/interaction + activity_participation.xlsx | **复购率、χ²、MAU、时间序列、参与者对比、CLV** | 定量·行为 |
| `05_ugc_content_analysis.py` | ugc_content_data.xlsx | UGC 字数/主题/情感、报告 | 定性·文本量化 |
| `03_NVivo_qualitative_analysis_guide.md/.docx` | 转录稿+观察+UGC | NVivo 主题编码指引（HEALTH/PRODUCT/COMMUNITY/VALUE/BRAND/COMMIT） | 定性 |
| `04_SPSS_syntax.sps` | questionnaire_data.xlsx | SPSS 描述/信度语法（**注：SPSS 不做 CFA**） | 定量·辅助 |
| `dry_run/run_analysis_on_mock.py` | MOCK input/ + 脚本 01/02 | 一键干跑（**仅验证管线，报告标注 MOCK**） | 流程验证 |

---

# 第二部分 · 需作者搜集/填入的数据清单（定量＋定性；已有 vs 缺失）

## 2.1 ✅ 已确认的权威值（已有，可直接回填/引用，**无需再采**）

| 数据项 | 权威值 | 来源 |
|---|---|---|
| Cycle I 问卷样本 | 理论 377／目标 300／发放 320／**有效 286（89.4%）** | 一致性核对记录（已 EDIT-2 回改） |
| 预测试 | **N=50**，人格信任 **α=0.89** | 工具包 01 问卷（已 EDIT-1 回改） |
| 首购/复购基数 | 首购 **≈18,000**、复购 **≈2,000（年基线 11%）** | 一致性核对记录 |
| 21 天挑战 | 报名 **612**、完成 **589（96.2%）** | 21 天记录 |
| 社群数 | **5 个（G1–G5）**，每组约 50 人 | 数据字典 |
| 周期时间线 | Cycle I 信任维护 Jan–Feb 2026；Cycle II 忠诚激活 Mar–May 2026；反思 Jun–Jul 2026 | 一致性核对记录 |
| 伦理申请 | UTM REC 非临床研究申请表 **v3/2023 已签署**、知情同意已附 | 伦理申请表（已 EDIT-5 据实补写） |
| 复购率/MAU/NPS 口径 | 见数据字典（复购=购买≥2次/总客户；MAU=月互动客户/总客户） | 数据字典 |
| Cycle II 承诺维度 | 情感承诺 AC + 持续承诺 CC（改编自 Allen & Meyer 1990） | 工具包 05 问卷（已 EDIT-3/4 回改） |

## 2.2 ❌ 定量数据 — 待采集（源材料确无，须导出后台/被试级原始数据）

| 数据项 | 落地文件 | 需要的具体数据 | 现状 | 标注 |
|---|---|---|---|---|
| Cycle I 被试级作答 | questionnaire_pre/post.xlsx | 286 人 × PT/BT/IQ 各条目原始分 + 人口学 + 开放题 | ❌缺 | D11 D12 |
| Cycle II 被试级作答 | questionnaire_cycle2.xlsx | 178 人 × AC/CC/LI + NPS 原始分 | ❌缺（条目数待 D15） | D15 STAT-omega |
| 真实分层计数（两表独立） | crm_customer / activity_participation | 表 3.6（286）与表 5.7（612）**各自**核心/潜力/沉默人数（现 98/121/67 疑复制粘贴） | ❌缺 | **D10 最高危** |
| 真实会员数 + 基数 | crm_customer（member_level） | 银卡/金卡真实人数 + 明确分母（澄清"1,656"） | ❌缺 | **D6 最高危** |
| 分层阈值统一定义 | —（作者裁定） | 核心/潜力/沉默按复购次数阈值（数据字典 ≥3/1–2 vs 核对记录 >5/2–4 冲突） | 🟡待裁定 | D1 |
| post-stratification 权重 | 依赖 D10 真实分层 | 总体层比例 / 样本层比例（达成比例为分母） | ❌缺 | D14 |
| CFA 拟合输出 | 被试级作答 → AMOS/Mplus/lavaan | χ²、**真实 df**、χ²/df、CFI、TLI、RMSEA、SRMR | ❌缺 | D11 |
| 品牌信任 AVE/载荷 | 被试级作答 → lavaan/AMOS | 标准化载荷、AVE=Σλ²/(Σλ²+Σθ)、CR、Fornell-Larcker | ❌缺 | D12 |
| McDonald's ω + EFA | Cycle II 被试数据 → R psych/lavaan | ω 值；4 因子结构降级为探索性 | ❌缺 | STAT-omega |
| 复购率逐月真值 | crm_transaction | 干预前基线 + 6 时间点复购率（标窗口/分母） | ❌缺 | D7（Fig 5.1） |
| MAU 逐月真值 + 起点 | crm_interaction | 真实起点（澄清 12.9% vs 9%）+ 逐月 | ❌缺 | D9（Fig 5.1） |
| 内容互动率逐月 + 口径 | crm_interaction | 澄清"阅读率 12%→37%"vs"互动率 19.3%→38.7%"是否同指标 | ❌缺 | D8（Fig 5.1） |
| 比例检验重算 | crm_* → 脚本 02 | 表 5.1 比例指标改两比例 z/χ²/McNemar + df/N/95%CI | ❌缺 | STAT-t |
| 因果识别数据 | crm_*（干预前特征） | PSM 协变量 或 stepped-wedge/waitlist 对照簇分配 | ❌缺 | CAUSAL |
| 区分效度施测 | 新增问卷条目 | parasocial（Horton&Wohl）或 source credibility（Hovland）成熟量表同批施测 | ❌缺 | P1-4 |
| 粉丝基数/转化 | 后台历史 | 20,000 粉丝真实来源、≈90% 转化是否属实 | ❌缺 | D20 |

## 2.3 ❌ 定性数据 — 待采集

| 数据项 | 落地文件 | 现状 | 标注 |
|---|---|---|---|
| 客户访谈全文转录 | P01–P08_客户访谈.docx（NVivo） | ❌缺 | D5 P2-4 |
| 员工访谈全文转录 | E01–E05_员工访谈.docx | ❌缺 | D5 |
| 社群观察编码 | G1–G5_社群观察.xlsx | ❌缺 | D4 D17 |
| UGC 分享内容 | UGC_分享内容汇总.docx / ugc_content_data.xlsx | ❌缺 | 定性主题 |
| **co-design 共同设计证据** | 工作坊记录/迭代日志/共同解释纪要 | ❌缺 | **P2-4（决定标题是否可称 collaborative）** |
| 访谈编码一致性 | 双编码者 κ/agreement（元数据表已含字段） | ❌缺 | 可信度 |

## 2.4 🟡 需作者裁定项（非采集，但**决定 schema，须最先做**）

| 裁定项 | 冲突 | 影响 |
|---|---|---|
| **D15 问卷条目数** | 工具包 10 vs 论文表 3.11「11」vs 附录 E「18」 | 决定 questionnaire_cycle2 字段数、构念数（3 or 4）、EFA 叙述 |
| **D5 访谈人数** | 5 月版 13（客户8+员工5）vs 7 月 §4.5 n=24（1+15+8） | 决定转录份数、元数据行数、§3.6.2/§4.5/P39/P50 回声 |
| D1 分层阈值 | 数据字典 ≥3/1–2 vs 核对记录 >5/2–4 | 决定 customer_type 重判规则 |
| D8 内容指标口径 | 阅读率 vs 互动率是否同指标 | 决定 Fig 5.1 第三条线含义 |
| ETH 批号 | 申请表批号栏空白 | 正式批号须官方批文，**不可编造** |

---

# 第三部分 · 拿到数据后的执行操作（脚本 + 论文修订）

## 3.0 第 0 步 · 前置裁定（必须先做，否则 schema 会返工）
1. 裁定 **D15**（Cycle II 条目数：10/11/18 取一）→ 定 questionnaire_cycle2 字段。
2. 裁定 **D5**（访谈 13 或 24）→ 定转录份数与元数据行。
3. 裁定 **D1 阈值**、**D8 口径**。裁定结果写入附录 F SSOT 总表，作为全文唯一权威。

## 3.1 第 1 步 · 数据落位
- 定量：把 10 个真实 xlsx（**同名、同列名**，对齐数据字典）放入一个干净工作目录，例如 `…/2026-09-24/REAL_analysis/`。
- 定性：把转录 docx / 观察 xlsx / UGC 放入 `…/REAL_qualitative/`。
- ⚠️ 不要用 MOCK 目录跑真实数据（其报告会标注 MOCK）；MOCK 仅用于管线验证。

## 3.2 第 2 步 · 脚本执行

### (A) 定量主管线（脚本 01/02 从**当前工作目录**按相对名读 xlsx）
```powershell
cd "d:\python_projects\weclaw\data\today_work\2026-09-24\REAL_analysis"
python "..\研究工具包\data_analysis_scripts\01_questionnaire_data_analysis.py"
python "..\研究工具包\data_analysis_scripts\02_behavioral_data_analysis.py"
python "..\研究工具包\data_analysis_scripts\05_ugc_content_analysis.py"   # 需 ugc_content_data.xlsx
```
产出（在本目录）：descriptive_statistics.csv、reliability_analysis.csv（α）、correlation_matrix.csv、paired_t_test_results.csv、pre_post_comparison.png、repurchase_rate_comparison.png、time_series_stats.csv、participant_comparison.csv 等。

### (B) 高级统计（脚本不含，须外部工具，用被试级原始数据）
- **CFA / AVE / CR / 区分效度**（D11 D12 P1-4）：**AMOS / Mplus / R `lavaan`**（SPSS 不支持 CFA）。报告 χ²、真实 df、CFI、TLI、RMSEA、SRMR、HTMT。
- **McDonald's ω**（STAT-omega）：R `psych::omega()`；EFA 用 `psych::fa()`。
- **post-stratification 权重**（D14）：R `survey` 或 Stata `svyset`。
- **PSM 倾向得分匹配**（CAUSAL）：R `MatchIt`。
- **比例检验**（STAT-t）：脚本 02 已用 `scipy.stats.chi2_contingency`；如需 McNemar 用 `statsmodels`。

### (C) 定性（P2-4 D5）
- 按 `03_NVivo_qualitative_analysis_guide.md` 在 **NVivo** 导入转录+观察+UGC，主题编码（HEALTH/PRODUCT/COMMUNITY/VALUE/BRAND/COMMIT），双编码者算 κ；提炼 co-design 证据主题。

### (D) 文献（P2-1 REF-C/D）
- CNKI/万方检索可核实中文实证（私域/社群电商信任，2020+）；用 `crossref-literature`/`openalex-literature` skill 核实 DOI；**删除**不可核实条目与错配 Rodriguez DOI；禁编造。

### (E) Fig 5.1 出图
- 用真实逐月数据填 `Fig5_1_monthly_trend_data_template.csv` → 绘 3 折线（复购率/月活/互动率，标真实 N）→ 导出高清 PNG → 替换修订稿 Fig 5.1 占位表（见《修订说明》§十 Fig5.1 模板）。

## 3.3 第 3 步 · 论文内修订指南（统计量 → 替换位置）

> 逐处把占位/示例值替换为**真实脚本输出**，四舍五入口径与全文一致；替换一处、核对一处、删对应 `▶【修订标注】` 一处。

| 真实输出 | 替换论文位置 | 标注 |
|---|---|---|
| 表 3.6 / 表 5.7 真实分层计数（两表独立） | 表 3.6、表 5.7 + 正文/摘要所有分层回声 | **D10 最优先** |
| 真实会员数 + 明确基数 | 表 5.1（会员 0%→9.2%）、§5.4.1（612 中 X 人） | **D6** |
| CFA：χ²/真实 df/CFI/TLI/RMSEA/SRMR | 表 3.7（现 χ²(df=87)=195.42…） | D11 |
| 载荷/AVE/CR/Fornell-Larcker（同源一致） | 表 3.8、表 3.9、表 3.10 | D12 |
| McDonald's ω + EFA 降级为探索性 | §3.6.4 + 表 3.11 | STAT-omega |
| post-stratification 权重（达成比例为分母） | §3.6 加权说明 + 表 3.6 | D14 |
| 比例指标 χ²/z/McNemar + df/N/95%CI | 表 5.1（复购/会员/MAU/互动率） | STAT-t |
| 表 4.1 配对 t（确认同批 286 重复测量，否则改独立样本 t） | 表 4.1（品牌信任 2.81→3.67, d=0.92） | STAT-t |
| 复购率/MAU/互动率逐月真值 + 时间轴 | 表 5.1、图 5.1、§4.4、附录 F3 | D7 D8 D9 |
| PSM 净效应 或 stepped-wedge 设计 或 如实声明不可识别 | §5.4 / §6.6（表 5.2 自选偏差自省可保留） | CAUSAL |
| 区分效度（HTMT）或收敛为 boundary extension | §2 构念定义 + 表 3.x + §6 贡献层级 | P1-4 |
| 可核实中文文献 + 删错配 | §2 文献综述 + REFERENCES | P2-1 REF-C/D |
| co-design 证据 或 改标题为 Insider Action Research | 标题/摘要/§1/§3（多处联动） | P2-4 |
| 访谈真实人数统一（13 or 24） | P39 / P50 / §3.6.2 / §4.5 | D5 |
| 粉丝基数/转化澄清 | §1.2（20,000 followers / 90% 转化） | D20 |
| 社群 3 群 vs 5 群关系 + 成员真数 | §1.3.2、附录 D | D4 D13 |
| 观察窗口口径统一 + 时间轴表 | §3.5、附录 D/F3 | D17 |
| 正式伦理批号/批准日期 | §3.8（现据实陈述已补，批号待官方批文） | ETH |

## 3.4 第 4 步 · 口径一致性回扫 + 删占位
1. 以**附录 F 四张 SSOT 总表**为唯一权威源，回扫"正文—表—图—摘要"全部回声，确保同一指标只有一个值。
2. 每处真实值填入并核对一致后，**删除**修订稿中对应的 `▶【修订标注 …】` 段落（当前 31 条）。
3. Fig 1.2 去重、图表编号乱序（FIG-num）用 Word「插入题注+交叉引用」按出现顺序重排。

## 3.5 第 5 步 · Word 收尾（🔵 样式/结构，勿用 WPS）
- 各「CHAPTER N」设 Heading 1；插入自动目录 + 图/表清单；`Ctrl+A → F9` 更新域。
- 补 Abstrak（马来文摘要）、声明页、致谢。
- 术语：保留 personified trust / interpersonal trust / 模型节点标签；founder-based trust 等逐处 Ctrl+F 定夺。
- §6.3a 理论对比移入第 2 章；第 6 章新增"What surprised us"小节；命题编号双轨（D18）统一到 §2.7。
- **⚠️ 切勿用 WPS 打开另存**（破坏 styles.xml/sectPr，致标题层级/分节丢失）。

## 3.6 第 6 步 · 验证与只读核查
- 核验原件 `原始论文_…_7月30日改版.docx` SHA256 前缀仍为 `89e5ed62…`（未被改动）。
- 重跑 `temp\_fig_final_verify.py` 类核验：段/表/图/标注数、图题配对、Fig 5.1 是否已由占位替换为真实图。
- 全文搜索确认：无残留 MOCK 数值、无 `【待填写】/【待采集】`、无未删的 `▶【修订标注】`。

---

## 附 · 一句话流程
**先裁定（D15/D5/D1/D8）→ 采真实数据填 1.2 落地文件 → 跑脚本 01/02/05 + AMOS/lavaan/R(psych/MatchIt/survey) + NVivo → 按 3.3 表逐项替换论文并删占位 → 附录 F 口径回扫 → Word 收尾（勿用 WPS）→ 只读核验。**

*（本指南完；所有"❌缺"项在真实数据采集前一律保留诚实占位，严禁编造。）*
