Experiment Configuration Guide

TRACE v0.2

如何把研究设计转化为平台配置?


了解如何将研究设计配置为可执行的算法态度实验流程。

Flow 实验流程配置

决定被试会经历哪些环节,以及正式实验中会出现哪些推荐处理条件。

Identity 被试身份

由被试号和实验编码共同确定,用于匹配主试、流程和记录。

Material 共用新闻库与内容区块

统一维护新闻材料,并通过互不重叠的区块控制不同处理中的实际曝光。

Version 项目控制

自定义交互界面、指导语与测量项目,并按版本进行浏览和导出。

配置前需要确认的研究设计

SS社交推荐与社交标签
SN社交推荐与无标签
NS随机推荐与社交标签
PP流行度推荐与流行度标签
PN流行度推荐与无标签
NP随机推荐与流行度标签
NN随机推荐与无标签条件

在进入平台配置前,主试需要先确认本次实验将纳入哪些推荐处理条件。平台当前支持三类推荐逻辑,并在此基础上形成 SS、SN、PP、PN、NN、NS、NP 七类处理条件。不同处理条件对应不同的材料准备、数据依赖和任务流程,建议先完成研究设计确认,再进入平台配置。

1. 社交推荐。
社交推荐包括 SS 和 SN 两类处理。二者的主要差异在于界面是否显示“好友读过”标签提示。
每类处理都会在正式实验任务中生成一个包含若干条新闻的推荐列表。 选择任一社交推荐处理后,平台会自动在实验流程中加入冷启动任务。被试在该任务中被要求选择感兴趣的内容,并在正式实验中根据其交互历史向其好友组进行筛选和分发。 社交推荐对被试关系有一定要求。建议主试在被试筛选阶段,优先选择已经存在先验社交关系的群体,这样可以提高社交来源标签的可信度,也有助于被试理解推荐列表中的社交线索。

2. 流行度推荐。
这类算法包括 PP 和 PN 两类处理,二者差异在于是否显示流行度标签。
平台的流行度指数参考 Xiao 与 Chen(2025)的信息熵客观赋权步骤,使用点赞、评论、转发与收藏以估计新闻流行指数; 项目应用时,将对主试勾选的每项互动指标进行六次方根变换;随后将变换值归一化至 [0.02, 1],计算各新闻在该指标中的比例与 Shannon 信息熵,再以差异度 1 − Ej 计算指标权重 wj。每条新闻的流行度得分为 Pi = 100Σwjyij。 若某项指标全部为 0、数值完全相同或数据不完整,该指标不参与赋权;只要至少一项指标具有有效差异即可继续计算,全部指标均不可用时项目不能应用。

Xiao, S., & Chen, X. (2025). Measuring social media customer engagement with brands based on information entropy: an application case of luxury brand. Journal of Brand Management, 32, 184–202. https://doi.org/10.1057/s41262-024-00376-7

3. 随机推荐。
这类算法包括NN、NP和NS三类处理。每类处理都会在正式实验任务中生成一个包含若干条新闻的推荐列表。
其中,NN 是随机推荐与无标签条件,通常可作为基线条件。NP 的列表来源为随机推荐,但界面呈现流行度标签。NS 的列表来源同样为随机推荐,但界面呈现社交标签。NS 只操纵界面标签,不读取冷启动偏好数据,也不会单独触发冷启动任务。

建议的配置顺序

1. 配置新闻库

自定义新闻库是算法推荐的唯一材料来源。主试只需维护一套自定义新闻库;同一新闻库可以用于多个配置中项目。上传时,主试可以为新闻配置媒体来源、作者认证、互动数量和时间线等交互界面字段,或自定义所需追踪的新闻内容变量。

2. 配置项目

主试需要先创建一个新项目,并按流程完成项目参数配置。配置完毕后,项目将根据所选处理条件进入冷启动任务阶段,或直接进入正式实验阶段。若项目包含 SS 或 SN 处理,系统会先进入冷启动任务阶段。
主试可以根据实验安排中断或继续运行项目。但实验正式开始后,不建议随意中断。中断操作可能影响被试端登录、任务进入和数据录入,进而影响实验数据的完整性。

3. 配置实验流程

进入实验配置页面后,主试可以按需上传前测信息,并自行设置前测完成码。前测完成码用于确认被试是否已经完成前测任务。
随后,主试需要选择正式实验中要使用的算法处理条件。该设置决定被试进入平台后会经历哪些任务环节,也决定正式实验中会呈现哪些推荐列表。
完成处理条件选择后,主试可根据实验设计和研究目标,设置各类推荐列表的交互界面样式。

4. 录入被试

进入被试管理页面后,主试可以单条录入被试号,也可以批量导入被试号。实际实验中,被试需要填写当前实验编码和被试号,才能进入实验并完成数据录入。
建议主试在正式发放实验链接前,核对被试号、实验编码和分组信息是否一致,避免因录入错误影响被试进入实验。

5. 设置冷启动组和好友组

冷启动阶段用于收集社交推荐所需的偏好选择数据。冷启动组决定被试将浏览哪一组冷启动材料,好友组决定正式社交推荐将读取哪一组被试的冷启动选择记录。

在冷启动任务中,被试需要根据个人偏好,从当前社交处理分配的内容区块中选择至少达到项目所设最少数量的新闻(默认 10 条)。这些选择记录将作为该处理的社交推荐基础数据。SS 和 SN 各自引入一个冷启动子任务;所有子任务会自动整合进冷启动阶段,并使用互不重复的新闻内容区块。

若实验没有额外分层要求,主试可以使用自动分组功能。平台会随机、均衡地分配冷启动组。若实验已经存在班级、批次、场次或其他分层安排,主试可以在被试表中手动调整冷启动组。保存后,平台会根据当前组数重新建立好友组关系。正式社交推荐列表会在冷启动阶段结束时,根据该阶段内的实际偏好数据统一生成。

6. 设置实验组和列表顺序

实验组用于控制正式实验中多个算法列表的呈现顺序,决定被试按照什么顺序看到已选算法列表。

若实验包含多个算法列表,并且需要控制顺序效应,可以启用自动拉丁方设计。平台会根据已选算法数量生成不同实验组的列表顺序,并将被试分配到相应实验组。被试登录后,将按照所属实验组对应的顺序完成列表浏览与评价。

若实验只展示一个算法列表,或研究设计不需要平衡列表顺序,则可以关闭自动拉丁方设计。此时,所有被试将按照同一默认顺序进入正式实验。具体处理顺序会在已有配置浏览页面中显示。

应用分组后,实验组和处理顺序会写入当前实验编码下的被试表。后续导出数据时,数据表会保留实验组、实际处理顺序和各列表作答结果,便于主试在后续统计模型中检查或控制顺序效应。

7. 配置指导语和测量项目

实验指导语在正式推荐任务开始前显示,用于说明被试即将完成的推荐浏览与评价任务。进入测量管理页面后,主试可以选择预设指导语,也可以自定义文本并保存。

测量指导语和测量项目会在每个算法列表展示时一同呈现,用于说明当前列表的测量要求,并记录被试对该列表的评价、判断或行为意向。主试可以使用平台预设量表,也可以根据研究需要自定义题项、选项、题型和必填状态。

8. 查看和导出数据

数据浏览页面用于检查当前实验的数据结构、完成情况和初步趋势。该页面适合进行质量核验和描述性查看。正式统计检验仍建议在专业统计软件或分析脚本中完成。

平台提供完成率、年龄分布、各算法条件均值、题项热力矩阵和被试内差值等快速浏览功能。主试可以使用这些结果判断数据是否完整、处理条件是否正常运行,以及不同算法列表是否呈现初步差异。

可导出的明细数据包括被试号、年龄、性别、冷启动组、好友组、实验组、内容分组、处理顺序、内容区块及实际推荐列表的变量构成、完成时间和具体作答内容等字段。主试可以导出 XLSX 或CSV 文件,用于前测数据合并、统计模型建立和正式报告撰写。

前测二维码和完成码如何工作?

外部量表平台生成前测问卷
平台中配置前测完成码
被试回到平台继续实验

如有前测需求,我们建议直接使用外部量表平台。本平台可以接入前测入口、记录完成验证,并将被试带入后续推荐实验。

第一步,在外部量表平台生成前测问卷。前测可以包括知情同意、人口统计题、筛选题、注意力检验、先验态度、心理特质或其他研究所需变量。生成二维码后,主试回到实验配置页面,将二维码上传为前测入口。

第二步,在平台中配置前测完成码。完成码由主试设置,最多十位,可以使用数字或英文字符,并区分大小写。配置时,主试还需要注意在外部问卷的完成页/完成通知向被试展示同一个前测完成码。

第三步,被试回到平台继续实验。被试完成外部前测后,在本平台输入完成码。核验通过后,平台才允许其进入冷启动或正式推荐任务。完成码的作用是确认被试已经到达外部前测完成页,减少未完成前测却直接进入正式实验的情况。

这一设计将长问卷和复杂题型交给外部量表平台处理,同时使推荐算法实验平台保持对推荐处理、列表呈现和正式测量记录的控制。

被试身份与实验编码

被试身份由被试号和实验编码共同确定,且不涉及姓名等隐私信息。被试号用于识别个体,实验编码用于识别其所属主试和实验流程。只有当被试号已经被写入当前实验编码对应的被试表时,被试才能进入实验。

主试端需要录入被试号,以建立当前实验编码下的实验身份。平台随后为被试分配冷启动组、好友组和实验组。

被试端需要填写被试号和实验编码,平台据此完成身份匹配,并记录年龄、性别等人口统计信息。因此,确保向被试告知的信息包括:实验流程、被试号和实验编码。

实验设计

算法态度项目默认采用完全被试内实验设计。每名被试将按照主试设定的顺序,依次经历全部算法与标签处理,并在每轮任务后完成相应评价。

该设计便于比较同一被试在不同推荐条件下的态度差异,并减少个体差异对研究结果的干扰。

若需采用被试间设计,主试可以分别配置多个项目,并为每个项目添加不同被试。

被试数量的选择

被试数量选择与期望观测的算法处理数量息息相关。算法态度实验当前支持 SS、SN、PP、PN、NS、NP、NN 七类基础处理,每类在同一项目中最多选择一次。主试应先确定主要研究问题,并配置能够回答这些问题的少量核心处理。

对被试数量的选择则需要事先考虑效应量大小、被试内相关程度、算法处理与新闻内容属性的交互、预期失访和无效数据比例等各因素,并结合模拟功效分析程序确定。

内容区块设计

什么是内容区块设计?

内容区块设计是指将项目的共用新闻库划分为若干组互不重叠的新闻材料,并在不同被试组和算法处理之间轮换使用。
每个内容区块具有明确的新闻组成,也可以记录主题、情绪、争议性、来源类型等内容变量。平台在生成实验方案时,会同时安排冷启动任务、正式处理和内容区块,确保同一被试在整个实验过程中不会重复接触同一条新闻。



为什么需要内容区块?

传播效果实验的结果不仅可能受到实验处理影响,也可能受到具体消息材料影响。如果某一种算法始终使用一组新闻,而另一种算法始终使用另一组新闻,观察到的态度差异便可能来自新闻主题、情绪或争议程度,而不完全来自算法处理。
内容区块设计主要服务于以下研究目标:
· 避免同一被试在冷启动和正式实验中接触重叠新闻。
· 记录并轮换内容变量,使研究者能够观察内容差异及其与算法处理的关系。



如何选择划分方式?

自动划分
当研究者主要关注算法类型、标签或交互界面,希望避免新闻重复时,可以选择自动划分。平台将根据算法处理、冷启动组和好友来源关系,自动计算所需区块数量,将新闻分入互不重叠的区块,并生成处理与区块的轮换方案。
自动划分不主动赋予区块特定的内容含义,适用于内容变量不是主要研究对象的项目。

手动划分
当研究者需要操纵或观察内容变量时,应选择手动划分。 研究者应事先完成内容分析,为新闻设置相应的变量水平,并将具有相同或相近内容水平的新闻划入同一区块。例如:
· 区块1:高争议内容
· 区块2:中争议内容
· 区块3:低争议内容
每个区块应对应一个明确的主要内容变量水平。同一个内容水平可以建立多个平行区块,以减少研究结果对某一组具体新闻的依赖。
正式实验将在不同被试组和算法处理之间轮换这些区块,避免某个内容水平始终与某一种算法绑定。实验结果将保留被试实际接触的区块及其内容变量。
内容区块设计能够减少材料与算法固定绑定造成的混淆,但不能自动保证所有内容变量都得到严格控制。研究者采用手动划分时,仍需明确内容变量的定义、编码标准和区块间差异,并在数据分析中纳入实际区块或内容变量。