# 数据采集与分析规格书
## SGHC 私域电商客户忠诚度 DBA 行动研究（7 月 30 日改版修订稿）

> 编制日期：2026-09-25　|　对应修订稿：`修订稿_SGHC私域电商客户忠诚度研究_20260924.docx`
> 配套：`MOCK_synthetic_test_data_DO_NOT_USE_IN_THESIS/`（合成测试数据）、`修订说明_…_20260924.md`（§八 Stage 2/2b 记录）

---

## 零、文档目的、合规声明与阅读指引

### 0.1 本文档解决什么问题

修订稿中现有 **31 条诚实占位标注**（`▶【修订标注 …】`，黄色高亮）。它们是给作者的
“待办清单”，**不是**可提交的正文。本规格书逐条告诉作者：

1. **已确认的权威值是什么**（来自研究工具包 / 伦理材料 / 一致性核对记录）；
2. **最合逻辑的裁定**是什么（在权威源支持范围内）；
3. **为什么仍不能自动写死进论文**（残留风险 / 版本冲突 / 需真实后台数据）；
4. **需要采集哪些真实数据、用哪个脚本、什么统计方法、替换论文哪一处**。

### 0.2 合规铁律（不可逾越）

- **零编造**：真值不可得一律保留诚实占位；**严禁**虚构数字 / 统计量 / 文献 / 伦理批号。
- **MOCK 数据绝不入论文**：本任务同时生成的 `MOCK_synthetic_test_data_DO_NOT_USE_IN_THESIS/`
  为**纯随机、刻意不校准**的合成数据，仅供跑通脚本，**严禁**作为论文数据、图表或结论来源。
- **版本时序陷阱**：研究工具包 / 数据字典为 **2026-05 版**，与 **7 月论文**在问卷条目数、
  访谈人数、社群口径等处**存在实质差异**；凡跨版本冲突项，一律标注须作者裁定，**不擅自统一**。
- **原件只读**：`原始论文_…_7月30日改版.docx`（SHA256 前缀 `89e5ed62…`）全程只读，不得改动。

### 0.3 31 条标注的处置总览

| 档 | 数量 | 含义 | 本规格书章节 |
|---|---|---|---|
| ✅ 已核实 | 2 | 真实值已确认，但**需作者动作**（Word 插图 / 真实数据重跑），非纯文本可完成 | 第四章 |
| 🟡 须确认 | 13 | 部分有权威源，但**含未决残留**（版本冲突 / 缺后台真值 / 需作者决策） | 第二章 |
| ❌ 确缺 | 11 | 源材料**确无**，须采集真实数据后分析替换 | 第三章 |
| 🔵 样式/结构 | 5 | Word 收尾（样式/目录/术语/命题并轨/SSOT 空表） | 第五章 |
| **（已回改并删除）** | 5 | Stage 2b 已用真实值改正正文并删除标注 | 第一章 |

> 说明：原 36 条标注中，5 条（D16/D3/D2/D19/REF-B）在 Stage 2b 已用权威真实值回改正文、
> 标注删除，故余 31 条。

---

## 一、Stage 2b 已应用的 5 处正文真实值修正（记录）

以下 5 处均为**版本安全**修正——即“7 月论文内部前后不一致，且其中一处经权威源确认为真”，
或“补写已签署伦理申请表的据实陈述 / 已存在文献表的真实引用”。已直接改正正文并删除对应标注。

| # | 位置 | 修正前 | 修正后 | 权威来源 | 修正类型 |
|---|---|---|---|---|---|
| EDIT-1 | §3.6（P374） | `pilot test with 30 customers` | `pilot test with 50 customers` | 工具包 `01_周期一…问卷.md`「预测试结果（N=50）」+ 人格信任 α=0.89；论文 P414 已写 50 | 内部一致性（P374“30”为离群值） |
| EDIT-2 | §3.6.1.5（P401） | `A target of 400 questionnaires … response rate of approximately 80% …` | `A target of 300 valid responses was set and 320 questionnaires were distributed …` | 一致性核对记录「理论 377／目标 300／发放 320／有效 286（89.4%）」+ 工具包 README + 论文 P394/P403 | 内部一致性 + 权威源（P401“400/80%”为离群值） |
| EDIT-3 | §2.4.2（P146） | `… identity-based or normative commitment (Morgan & Hunt, 1994).` | 追加 `; the present study operationalises and measures the first two (affective and continuance commitment), which are the dimensions assessed in the Cycle II instrument.` | 论文 P443 EFA「承诺二维（affective+continuance）」+ 表 3.11 + 工具包 `05_周期二…问卷.md`（仅 AC/CC 两维） | 内部一致性澄清（定义 3 维 vs 实测 2 维） |
| EDIT-4 | §3.5.2（P456） | `… loyalty intention, and NPS items adapted from established scales.` | 追加 ` (affective and continuance commitment from Allen & Meyer, 1990).` | 工具包 `05_周期二…问卷.md` line160/164「改编自 Allen & Meyer (1990)」+ 论文 P850 文献表已含该条 | 补引**已存在**于文献表的真实文献 |
| EDIT-5 | §3.8（P468） | `Questionnaire participation required electronic consent.` | 追加 ` An ethics application was completed under the UTM Research Ethics Committee non-clinical research ethics process (form version 3/2023), with the informed consent form attached.` | 已签署伦理申请表原件：`VERSION 3/2023`、`UTM RESEARCH ETHICS COMMITTEE (UTMREC) NON-CLINICAL RESEARCH ETHICS`、Section F 知情同意 ☑、3.4.1 Instrument attached ☑ | 据实补写（**正式批号仍缺，见 ETH 项，保留诚实占位**） |

> ⚠️ EDIT-5 仅陈述“已提交申请、知情同意已附”这一**可核实事实**；**未**声称已获批准编号
> （申请表“For UTM REC Use / Stamp / Received Date”栏空白）。正式批号须作者补官方批文后填入。

---

## 二、🟡 须确认项裁定表（13 项）

> 裁定原则：**在权威源明确支持、且不触发跨版本冲突时**给出“最合逻辑裁定”；
> 凡残留未决（版本冲突 / 缺后台真值 / 需作者决策）者，**一律不自动回改正文**，保留诚实占位。
> 结论：**13 项均含未决残留，故本 Stage 未对 🟡 项做进一步正文改写**（EDIT-5 已处理 ETH 的可据实部分）。

### D20（idx42）粉丝基数 / 转化口径
- **已确认**：首购客户 ≈18,000、复购 ≈2,000（11%）为权威值〔一致性核对记录〕。
- **最合逻辑裁定**：以 18,000 为权威首购基数。
- **残留风险**：§1.2「约 20,000 followers」及「≈90% 粉丝→首购转化」在源材料中**无出处**。
- **可否自动回改**：❌ 否（20,000 来源不明、90% 转化未证实）。
- **作者动作**：核对 20,000 粉丝真实来源；若 18,000/20,000≈90% 属实则补说明，否则修正数字。

### D5（idx51）访谈人数口径 ⚠️跨版本冲突
- **已确认**：员工总数 15、实际访谈 13（客户 8 + 员工 5）〔一致性核对记录〕；工具包「样本量 5 人（运营 2+售后 2+技术 1）」。
- **最合逻辑裁定**：**不可自动裁定**。5 月版 = 13 访谈（8+5）；但 7 月论文 §4.5「n=24」且 P50「founder + all 15 employees」（1+15+8=24）**内部自洽**，而 §3.6.2 又写「客户 8+员工 5」=13 → **7 月论文自身 13 vs 24 矛盾**。
- **残留风险**：究竟访谈 13 还是 24 人？员工受访 5 还是 15？任一具体数字都可能是错版本，强改会破坏另一处自洽。
- **可否自动回改**：❌ 否。
- **作者动作**：确认 7 月**实际施测**的访谈总数与员工受访数；统一 P39 / P50 / §3.6.2 / §4.5（n=24）全部回声。

### REF-C/D（idx182）Rodriguez 文献错配
- **已确认**：Rodriguez (2011) 所标 DOI `10.5897/ajbm10.695` 实解析到无关伊朗论文（Fazlzadeh 等），错配属实〔APA 验证报告 #73〕。
- **最合逻辑裁定**：该条 DOI / 出处不可靠。
- **残留风险**：补救需作者二选一，涉及**选择/核实真实文献**，零编造铁律禁止我代为编造替代文献。
- **可否自动回改**：❌ 否。
- **作者动作**：①保留 Rodriguez 则改正年份/出处并调整其所支持论断；②或删去、改引**真实可核实**的 SME e-CRM 文献（勿与同句 Harrigan et al. 2011 重复）。

### FIG-num（idx284）图表编号乱序
- **已确认**：`charts\图表插入位置指南.md` 给出 6 图权威“图号—章节—行号”映射。
- **最合逻辑裁定**：图号可依指南规范；但工具包图号（创建序）≠ 论文现用图号，须以**论文出现顺序**为准重新对齐。
- **残留风险**：表 2.1 / 表 4.2 / 表 5.6 表序乱序无源材料可依。
- **可否自动回改**：❌ 否（需 Word“插入题注 + 交叉引用”，属作者 Word 操作）。
- **作者动作**：在 Word 用“插入题注 + 交叉引用”按出现顺序重排图、表号。

### D17（idx376）观察窗口口径
- **已确认**：Cycle I（信任维护）Jan–Feb 2026、Cycle II（忠诚激活）Mar–May 2026、反思 Jun–Jul 2026〔一致性核对记录〕。
- **最合逻辑裁定**：周期日期以上述为准。
- **残留风险**：「30+60+30=120 天」vs「Cycle I 12 周 + Cycle II 12 周 ≈168 天」vs 附录 D「3 群 ×(12+12) 周」三套口径未统一；且“12 周”与 Jan–Feb（约 8 周）不符。
- **可否自动回改**：❌ 否（观察窗口设计需作者据实统一）。
- **作者动作**：据周期时长统一“阶段 × 周次 × 测量点”定义，补时间轴表（附录 F3 模板）。

### D4（idx377）社群数量口径
- **已确认**：社群 5 个（G1–G5：核心/混合/沉默/新客/VIP），每组活动约 50 人〔数据字典〕；§1.3.2「Five WeChat communities」**正确**。
- **最合逻辑裁定**：社群数 = 5（正文已正确，**无需改**）。
- **残留风险**：正文/附录 D「three primary groups（约 1,200 人）」与 5 群、与工具包「总成员 2,500（每组 500）」关系未解释；成员数 1,200 vs 2,500 冲突。
- **可否自动回改**：❌ 否（3 群与 5 群关系、成员真数需作者说明）。
- **作者动作**：说明“3 群”与“5 群”关系（核心观察子集？不同阶段？），统一全文社群数量与成员数。

### D13（idx380）客户池与社群边界
- **已确认**：首购 ≈18,000、复购 ≈2,000〔一致性核对记录〕；社群 5 个〔数据字典〕。
- **最合逻辑裁定**：—（缺层级定义，无法裁定）。
- **残留风险**：「18,000 首购 ↔ 约 1,200 社群成员 ↔ 5 群/3 群 ↔ 612 挑战注册」包含关系与边界无源；致「会员 1,656」（见 D6）基数无法定位。
- **可否自动回改**：❌ 否。
- **作者动作**：补层级包含图/表（附录 F2 CONSORT 样本流程表已设模板）。

### D15（idx437）Cycle II 量表条目数 ⚠️最高危·三方冲突
- **已确认**：工具包实际问卷 `05_周期二…问卷.md` = **10 条目**（AC1–4 + CC1–3 + LI1–3，3 构念 + 独立 NPS）。
- **最合逻辑裁定**：**不可自动裁定**。工具包 10 条目 vs 论文 §3.6.4/表 3.11「承诺 5 + 忠诚 6 = 11 条目（EFA 4 因子）」vs 附录 E「18 条目/4 构念」——**三方均不一致**。
- **残留风险**：实际施测版本未定；工具包为 2026-05 版，须与 7 月施测版核对。强改任一都可能引入错误。
- **可否自动回改**：❌ 否（最高危版本认定）。
- **作者动作**：裁定以哪一版为准；若以工具包 10 条目为准，则 §3.6.4 / 表 3.11 / 附录 E 的条目数、构念数（3 而非 4）与 EFA 叙述须**同步回改**。

### D8（idx518）内容指标口径
- **已确认**：MAU 率口径 = 月内有互动客户数 / 总客户数 ×100%〔数据字典〕。
- **最合逻辑裁定**：—（两指标关系未定）。
- **残留风险**：§4.4「阅读率 12%→37%」vs 表 5.1「互动率 19.3%→38.7%」是同指标异名还是两个不同指标？源未对齐，数值真值亦缺。
- **可否自动回改**：❌ 否。
- **作者动作**：在表 5.1 / §4.4 分别标注两指标定义与分子/分母，明确二者**不可直接比较**，避免被误读为倒退。

### D21（idx608）Cycle II 样本量 N
- **已确认**：21 天挑战实际报名 612、完成 589（96.2%）〔21 天记录〕；表 5.7 的 612 = 挑战报名数。
- **最合逻辑裁定**：612 / 589 为权威。
- **残留风险**：表 3.11 的 178（Cycle II 问卷）与 286（Cycle I 问卷）各自对应的分析范围、以及表 5.1 各指标真实 N，源未明确。
- **可否自动回改**：❌ 否。
- **作者动作**：据 报名 612 / 完成 589 / Cycle II 问卷 178 / Cycle I 问卷 286，为表 5.1 **每个指标**标注真实 N 与分析范围。

### D9（idx629）MAU 起点
- **已确认**：MAU 率口径〔数据字典〕。
- **最合逻辑裁定**：—（真起点值无源）。
- **残留风险**：表 5.1「12.9%→21.7%」vs 图 5.1「≈9%→21.7%」起点差异（12.9% vs 9%），源未给真起点。
- **可否自动回改**：❌ 否。
- **作者动作**：据后台历史数据核对 MAU 真实起点，统一表 5.1 与图 5.1，标注分子/分母/时间窗。

### D7（idx630）复购率时间轴
- **已确认**：复购率口径 = 购买 ≥2 次客户数 / 总客户数 ×100%（须标窗口）〔数据字典〕；年基线复购 ≈2,000/18,000（11%）〔一致性核对记录〕。
- **最合逻辑裁定**：摘要 11%（年基线）、图 5.1 Cycle I Month1 ≈15%、表 5.1 26.4%→41.8% 是**不同时间点的连续进程、非互相矛盾**；真正缺的是统一时间轴。
- **残留风险**：各时间点真值须作者据后台数据填。
- **可否自动回改**：❌ 否（需真实时间轴数值）。
- **作者动作**：新增“复购率时间轴图/表”（附录 F3 已设“干预前基线”行），为每个数字标注测量窗口与分母。

### ETH（idx837）伦理审批凭证
- **已确认**：UTM REC 申请表（Non-Clinical，VERSION 3/2023）已由 Fauziah Sh Ahmad 签署（19 Dec 2025）、院长验证签署（9/1/2026）、6.1.7 知情同意书 ☑ 已附〔伦理申请表原件〕。
- **最合逻辑裁定**：✅ **正文 §3.8 已据实补写**（Stage 2b EDIT-5）：“已提交 UTM REC 非临床研究伦理审查（申请表 v3/2023），知情同意书已附”。
- **残留风险**：申请表末尾“For UTM REC Use / Stamp / Received Date”栏**全部空白** → **无正式审批编号/盖章/批准日期**。
- **可否自动回改**：⚠️ 部分已完成（据实陈述）；**批号不可编造**。
- **作者动作**：补官方批文后填入正式批号/批准日期，或说明豁免依据；在此之前**保留诚实占位**。


---

## 三、❌ 确缺项数据采集与分析规格（11 项）

> 这些项**源材料确无**，无法凭现有材料补真值。每项给出：缺什么 → 需采集字段（对齐数据字典 schema）
> → 用哪个脚本 → 统计方法 → **替换论文哪一处**。采集完成后，把真实数据放入
> `MOCK_synthetic_test_data_DO_NOT_USE_IN_THESIS/input/`（同名替换 MOCK）→ 重跑脚本 → 据“替换位置”回改。

### ❌-1　D10（idx645）分层数字雷同【最高危·优先】
- **缺什么**：表 5.7（挑战 612）与表 3.6（Cycle I 286）三层同为 98/121/67，几乎确定复制粘贴；两表各自真实的“核心/潜力/沉默”人数缺。
- **需采集字段**：`activity_participants.customer_type`（612 报名者分层快照）；`customer_data.customer_type` + 问卷 respondent 分层（286 分层）。
- **脚本**：`02_behavioral_data_analysis.py`（分层频数）/ SQL `GROUP BY customer_type`。
- **统计方法**：描述性频数 + 比例；两表**分别独立**统计，不得互相套用。
- **替换位置**：表 3.6、表 5.7（及正文/摘要中所有引用这两处分层数之处）。
- ⚠️ 外审一旦比对即质疑数据真实性，**务必最优先**解决。

### ❌-2　D6（idx642）会员 1,656 基数矛盾【最高危】
- **缺什么**：“会员 1,656”及其基数定义；且 1,656 > 社群 1,200 矛盾。
- **需采集字段**：`member_data`（member_level ∈ 银卡/金卡 的真实会员数）；明确基数（18,000？612？社群成员？）。
- **脚本**：`02_behavioral_data_analysis.py` / SQL `member_data`。
- **统计方法**：描述性频数；会员率 = 会员数 / **明确基数** ×100%（须写明分母）。
- **替换位置**：表 5.1（会员 0%→9.2%，“1,656 people”）+ §5.4.1（“612 中 56 人 = 9.2%”）——两处基数须澄清并统一。
- ⚠️ 21 天记录“活动效果追踪表”（参与者 589 vs 非参与者 17,411，复购率 62.3% vs 36.8%）疑为**示例数据**，未经作者确认**不得引用**。

### ❌-3　D14（idx407）事后加权分母用错【依赖 D10】
- **缺什么**：正确的 post-stratification 应以**达成比例**为分母；但达成比例（现算 34.3%/42.3%/23.4%）依赖表 3.6 的 98/121/67（疑复制粘贴，见 D10）。
- **需采集字段**：同 D10 的真实分层计数（总体层比例 + 样本层比例）。
- **脚本**：`02_behavioral_data_analysis.py` / R `survey` 包 / Stata `svyset`。
- **统计方法**：post-stratification weight = 总体层比例 / 样本层比例；以**达成比例**为分母重算。
- **替换位置**：§3.6 加权说明 + 表 3.6。**须先解决 D10**。

### ❌-4　D1（idx391）客户分层人数口径冲突 + 阈值自相矛盾
- **缺什么**：核心/潜力/沉默三层真实人数；阈值定义两源**自相矛盾**（数据字典：核心=复购≥3 次/潜力=1–2 次；一致性核对记录：核心=>5 次/潜力=2–4 次）。
- **需采集字段**：`customer_data.customer_type`；`transaction_data` 按 customer_id 聚合的购买次数（据**统一后**的阈值重判分层）。
- **脚本**：`02_behavioral_data_analysis.py` / SQL。
- **统计方法**：先**统一阈值定义**（作者裁定），再描述性频数 + 比例。
- **替换位置**：正文—表 3.6—表 4.2—摘要 全部分层回声。

### ❌-5　D11（idx417）CFA 自由度需核验
- **缺什么**：CFA 原始输出；df=87 无法核验（评审验算协方差结构 df=74、含均值 df≈77）。
- **需采集字段**：Cycle I 14（或经 D15 裁定的版本）条目的**原始被试作答数据**（PT/BT/IQ 各条目）。
- **脚本**：**AMOS / Mplus / lavaan**（SPSS 不直接支持 CFA，见 `04_SPSS_syntax.sps` 明确注明）。
- **统计方法**：CFA，报告 χ²、**真实 df**、χ²/df、CFI、TLI、RMSEA、SRMR。
- **替换位置**：表 3.7（现：χ²(df=87)=195.42, χ²/df=2.25, CFI=0.94, TLI=0.92, RMSEA=0.066）。

### ❌-6　D12（idx425）品牌信任 AVE 与载荷不符
- **缺什么**：表 3.8 载荷与 AVE 的原始计算输出（data_templates 的 xlsx 均为示例存根）。
- **需采集字段**：同 D11 原始被试数据。
- **脚本**：lavaan / AMOS（CFA 标准化载荷）+ 信度脚本。
- **统计方法**：AVE = Σλ² / (Σλ² + Σθ)；CR = (Σλ)² / [(Σλ)² + Σθ]；核对是四舍五入还是载荷/AVE 有一处笔误（评审按 0.75/0.80/0.82/0.68/0.74 验算 AVE=0.577，√=0.76，与报告 0.55 差约 0.03）。
- **替换位置**：表 3.8（载荷）、表 3.9（CR/AVE）、表 3.10（Fornell-Larcker）——三表须**同源一致**。

### ❌-7　STAT-omega（idx438）Cycle II 信度与 EFA 降级
- **缺什么**：Cycle II 真实被试数据（xlsx 仅示例存根），无法补算 McDonald's ω 或交叉验证。
- **需采集字段**：Cycle II 10（或经 D15 裁定版本）条目原始数据（AC/CC/LI + NPS）。
- **脚本**：R `psych`（ω）+ `lavaan`/EFA。
- **统计方法**：①补报 **McDonald's ω**；②说明为何不做 CFA 或对子样本交叉验证；③把 4 因子结构**降级为“探索性证据”**。
- **替换位置**：§3.6.4 + 表 3.11。
- ⚠️ SPSS syntax 中“Cohen's d 示例（Mean_Pre=2.81/Post=3.67）”明确标注为“**假设**”，不可当真实值。

### ❌-8　CAUSAL（idx614）因果识别可再强一档
- **缺什么**：干预前特征数据（做 PSM）；stepped-wedge/waitlist 对照社区簇设计数据。
- **需采集字段**：干预前客户特征（分层、历史购买频次、活跃度、入群时长）+ 对照社区簇的分配与时间。
- **脚本**：`02_behavioral_data_analysis.py` + R `MatchIt`（PSM）。
- **统计方法**：三选一——①PSM 倾向得分匹配估净效应；②将 §6.6“平行对照社区簇”前移写成可执行的 stepped-wedge/waitlist 设计；③如实声明净效应不可精确识别。
- **替换位置**：§5.4 / §6.6。现有表 5.2 自选偏差自省（参与者干预前复购 34.5% vs 非参与者 21.2%）已是**诚实处理**，可保留。

### ❌-9　P1-4（idx205）构念辩护与区分效度
- **缺什么**：parasocial interaction（Horton & Wohl 1956）或 source credibility（Hovland et al. 1953）的成熟量表施测数据。
- **需采集字段**：补施测上述成熟量表（新增问卷条目，5 点 Likert），与 personified trust 同批施测。
- **脚本**：`01_questionnaire_data_analysis.py`（信度）+ AMOS/Mplus/lavaan（区分效度 CFA）。
- **统计方法**：区分效度（Fornell-Larcker + **HTMT**）；或二选一——将表述全程收敛为“boundary extension / contextually grounded construct”，并统一贡献层级（核心 = Personified Trust Migration Model）。
- **替换位置**：§2 构念定义 + 表 3.x 区分效度 + §6 贡献层级。

### ❌-10　P2-1（idx171）本土与时效文献
- **缺什么**：7 条中文文献（Chen&Lu 2023、Li&Cui 2019、Liu&Wang 2020、Lu&Chen 2022、Yang&Wu 2020、Zhang&Li 2021、Zhou&Huang 2017）被明确标注“无法在公开检索中稳定核实”。
- **需采集字段**：真实可核实的 CSSCI/核心期刊中文实证（私域/社群电商信任、社交 CRM，2020+）。
- **脚本/工具**：CNKI/万方检索；可用 `crossref-literature` / `openalex-literature` skill 核实 DOI（**禁编造**）。
- **统计方法**：不适用（文献核实）。附英译并标 `[in Chinese]`。
- **替换位置**：§2 文献综述相关处 + REFERENCES；**删除**不可核实条目。候选期刊见中文文献指南：商业经济研究/中国流通经济/管理世界/南开管理评论/营销科学学报等。

### ❌-11　P2-4（idx90）collaborative 证据或改标题
- **缺什么**：参与者共同诊断/共同设计干预/共同解释结果的 co-design 记录。
- **需采集字段**：co-design 工作坊记录、参与者反馈迭代日志、共同解释会议纪要（定性文本）。
- **脚本**：`03_NVivo_qualitative_analysis_guide`（NVivo 主题编码）。
- **统计方法**：定性内容分析，提炼“协作/共同设计”证据主题。
- **替换位置**：二选一——①补 co-design 证据支撑标题“collaborative”；②或将标题改为“**Insider Action Research**”以与实作一致（涉及标题/摘要/§1/§3 多处联动）。

---

## 四、✅ 已核实但需作者动作项（2 项，非纯文本可完成）

### FIG-dup（idx63）重复图题与空表占位 → 插入真实图
- **已确认**：真实图件已定位——研究工具包 `Figure2_SWOT…png`～`Figure6_Intervention_Results…png`（166–366KB 高清）、`2_图表\figure_2_1_…svg`（矢量）、`charts\figure1–6*.html`（源）。
- **为何不能纯文本改**：需在 Word **插入图片**、删除 1×1 空表占位、规范图题。
- **作者动作**：①每图仅留一个规范图题、删重复；②按 `charts\图表插入位置指南.md` 的图号—章节映射插入真实图（宽 14–15cm 居中，图注 Times New Roman 11pt）；③⚠️ 鱼骨图（Figure1）目前仅有 HTML 无 PNG，须先导出高清 PNG/矢量再插入。

### STAT-t（idx522）比例检验方法学 → 真实数据重跑
- **已确认**：`02_behavioral_data_analysis.py` 对复购率等**比例**指标用 `scipy.stats.chi2_contingency`（卡方），**非配对 t**——印证评审：表 5.1 对总体比例用配对 t 不严谨。
- **为何不能纯文本改**：改后的 χ²/z 值、df、95%CI **须用真实数据重跑**才能得到，不可编造。
- **作者动作**：①表 5.1 比例指标（复购率/会员率/MAU/互动率）改**两比例 z / 卡方 / McNemar**（与源脚本一致），补 df/N 与 95%CI；②说明多重比较校正或声明为探索性；③表 4.1（品牌信任 2.81→3.67，N=286，配对 t，d=0.92）属**量表均值**，配对 t 可接受，但须确认前后测为**同一批 286 人**（重复测量），否则改独立样本 t。
- ⚠️ 脚本/21 天追踪表中比例对比的 t 值（如 62.3% vs 36.8%，t=12.34）系“**示例数据**”，未经作者确认不得直接引用。

---

## 五、🔵 样式 / 术语 / 结构项（5 项，Word 收尾）

| 标注 | idx | 要点 | 作者动作 |
|---|---|---|---|
| 样式/TOC | 23 | Stage 1 已把 X.Y/X.Y.Z 章节标题设为 Heading 2/3（约 100 处） | Word 中：①各「CHAPTER N」设 Heading 1；②插入自动目录 + 图/表清单；③Ctrl+A→F9 更新域；④补 Abstrak（马来文摘要）、声明页、致谢。**⚠️ 切勿用 WPS 打开另存**（会破坏 styles.xml/sectPr） |
| TERM | 144 | 规范术语 = personified trust（全文约 97 处）；已自动改 1 处 person-based trust | **务必保留勿改**：interpersonal trust（学术对比构念）、模型节点标签；**建议统一待确认**：founder-based trust（4 处）、founder trust；**建议保留**：§6.9 第一人称反思。作者 Ctrl+F 逐处定夺 |
| P2-2 | 286 | 结构建议 | 将 §6.3a 理论对比移入第 2 章；第 6 章新增“What surprised us and how it reshaped the model”小节（可从 6 个 abductive insights 提炼） |
| D18 | 303 | 命题编号双轨制 | §2.7（P4=品牌信任桥梁、P6=忠诚多维）与表 2.2/2.3/2.4“Linked Propositions”列（P4=Incentive→Loyalty、P6=Commitment mediates）不一致。统一到单轨（建议以 §2.7 为准），并使表 2.2/2.3/2.4、表 1.6 一致；表 1.6 建议补“P→RQ”列 |
| TABLES | 838 | 附录 F 四张口径总表为 Stage 1 追加的**空表模板**（SSOT） | 据原始数据/后台逐项填入【待填写】单元格，并与“正文—表—图—摘要”全部回声核对一致。**⚠️ 严禁编造任何数字**；四表一经填实即为全文数字权威源 |

---

## 六、真实数据采集总清单（按数据源）

| 数据源 | 采集内容 | 落地文件（同名替换 MOCK） | 支撑的标注项 |
|---|---|---|---|
| 问卷星导出 | Cycle I 前/后测原始作答（PT/BT/IQ 各条目 + 人口学） | `questionnaire_pre.xlsx` / `questionnaire_post.xlsx` | D11, D12, STAT-omega, P1-4 |
| 问卷星导出 | Cycle II 原始作答（AC/CC/LI + NPS） | `questionnaire_cycle2.xlsx` | D15, STAT-omega, D21 |
| e-CRM 后台 | 客户基本信息（含 customer_type/member_level） | `crm_customer_data.xlsx` | D1, D6, D10, D13, D14 |
| e-CRM 后台 | 交易记录（跨干预前后 ≥6 个月） | `crm_transaction_data.xlsx` | D7, D1, D10, STAT-t, CAUSAL |
| e-CRM 后台 | 互动记录（阅读/点赞/评论/转发/发言） | `crm_interaction_data.xlsx` | D8, D9, STAT-t |
| 活动系统 | 21 天挑战参与（612 报名/589 完成 + 分层快照） | `activity_participation_data.xlsx` | D6, D10, D21, CAUSAL |
| 访谈转录 | 客户 + 员工访谈（**先裁定 13 或 24 人**） | `interview_metadata_*.xlsx` + 转录 txt | D5, P2-4 |
| 社群观察 | G1–G5 观察编码记录 | `community_observations.xlsx` | D4, D17 |
| 会员系统 | 真实会员数 + 明确基数定义 | （并入 crm_customer/member） | D6, D13 |
| UTM REC | 正式审批编号/盖章/批准日期（官方批文） | — | ETH |
| 文献检索 | 可核实中文实证 + Rodriguez 补救 | — | P2-1, REF-C/D |
| 后台历史 | 粉丝基数、MAU 起点、复购时间轴 | — | D20, D9, D7 |

---

## 七、替换与清除占位的标准操作流程（SOP）

1. **裁定版本**：先解决 D15（问卷条目数）、D5（访谈人数）两项**跨版本冲突**——它们决定 schema。
2. **采集真实数据**：按第六章清单采集，放入 `input/`（同名替换 MOCK）。
3. **重跑分析**：运行 `dry_run/run_analysis_on_mock.py`（此时输入已是真实数据），或直接跑 `研究工具包/data_analysis_scripts/01、02`；CFA/ω 用 AMOS/Mplus/lavaan。
4. **逐项替换**：据本规格书第二/三/四章的“替换位置”，把论文中对应的
   α / ω / AVE / CR / χ² / df / t / d / 复购率 / MAU / NPS / 分层人数 / 会员数 等
   **逐一替换为真实输出**（四舍五入口径与全文一致）。
5. **口径一致性回扫**：以附录 F 四张 SSOT 总表为准，回扫“正文—表—图—摘要”全部回声，确保同一指标只有一个权威值。
6. **删除诚实占位**：某项真实值填入并核对一致后，删除修订稿中对应的 `▶【修订标注 …】` 段落。
7. **伦理批号**：拿到 UTM REC 官方批文后，把正式批号/批准日期填入 §3.8，删除 ETH 占位。
8. **Word 收尾**：按第五章完成样式/目录/术语/命题并轨；插入真实图（FIG-dup）；**切勿用 WPS 另存**。
9. **原件只读核验**：全程确认 `原始论文_…_7月30日改版.docx`（SHA256 前缀 `89e5ed62…`）未被改动。

---

## 附录 A：本规格书引用的权威源材料

| 源文件 | 位置 | 用途 |
|---|---|---|
| 数据字典 | `研究工具包/data_collection_procedures/数据字典_Data_Dictionary.md` | schema、复购率/MAU/NPS/Cohen's d 口径、分层编码 |
| Cycle I 问卷 | `研究工具包/research_instruments/01_周期一_客户信任与互动质量问卷.md` | 预测试 N=50、α=0.89 |
| Cycle II 问卷 | `研究工具包/research_instruments/05_周期二_客户承诺与忠诚问卷.md` | AC/CC 改编自 Allen & Meyer (1990)、10 条目 |
| 21 天挑战记录 | `研究工具包/research_instruments/06_21天健康挑战活动记录表.md` | 报名 612/完成 589 |
| 社群观察表 | `研究工具包/research_instruments/04_社群观察记录表.md` | 5 群 G1–G5 |
| 一致性核对记录 | `20260526_thesis_updated/4_伦理检查/20260526_论文与伦理申请表一致性核对及修改记录.md` | 377/300/320/286、访谈 13（8+5）、18,000/2,000、周期时间线 |
| 伦理申请表 | `20260526_thesis_updated/4_伦理检查/Checked-UTM_REC_APPLICATION_FORM…md/.docx/.pdf` | VERSION 3/2023、UTMREC、知情同意已附、批号空白 |
| 分析脚本 | `研究工具包/data_analysis_scripts/01、02` | 信度/配对 t/复购率/χ²/MAU/CLV 方法学 |
| APA 验证报告 | `20260526_thesis_updated/1_参考文献/…APA_验证报告…` | Rodriguez (2011) DOI 错配 #73 |

> **零编造声明**：本规格书所有“已确认”值均可溯源至上表权威源材料；所有“残留/确缺”项
> 均**未**填入任何推测数字。真实值须由作者采集原始数据、重跑分析后填入。

*（本规格书完）*
