REFLACX — 眼动定位异常胸片数据集 AI-Ready Wikipedia

3,032 次读片的眼球轨迹:放射科医生'看哪里'第一次成为可下载的数据

来源 MIMIC-CXR 派生:EyeLink 1000 Plus 眼动仪(1000 Hz)+ MATLAB/Psychtoolbox 接口 + IBM Watson 语音转写,5 位放射科医生三阶段采集(2020-11~2021-06)发布时间: 2026-09-24最后更新: 2026-09-25 阅读 32
REFLACX — 眼动定位异常胸片数据集 AI-Ready Wikipedia

信息速览

数据集名称REFLACX — 眼动定位异常胸片数据集 AI-Ready Wikipedia
数据类型眼动数据,人工标注,时序数据
规模3,052 次读片(3,032 次有效眼动)/ 2,616 张胸片 / 2,199 名患者——5 位放射科医生眼动+转录同步采集
接入方式MIMIC-CXR 派生:EyeLink 1000 Plus 眼动仪(1000 Hz)+ MATLAB/Psychtoolbox 接口 + IBM Watson 语音转写,5 位放射科医生三阶段采集(2020-11~2021-06)
AI 就绪度

数据集封面

INFOBOX:reflacx 速览

字段 值
数据集 REFLACX: Reports and eye-tracking data for localization of abnormalities in chest x-rays v1.0.0
slug reflacx-xray-localization(批次登记 ‘REFLACX’ 为简称)
发布 2021-09-27(单版本 Initial release)——批次七最早挂牌
DOI 10.13026/e0dj-8498(v1.0.0)/ 10.13026/qhft-e228(latest)
访问 Restricted(Restricted License 1.5.0 + Restricted DUA——批次预判命中;注册+签 DUA,无 CITI 强制)
母库 ;注册+签 DUA,无 CITI 强制)
母库 MIMIC-CXR(frontal 片子集)
规模 **3,052(frontal 片子集)
规模 3,052 次读片(3,032 有效眼动)/ 2,616 张胸片 / 2,199 患者
读者 5 位放射科医生;109 张图全 5 人共读(变异子集)
眼动 EyeLink 1000 Plus,remote 模式,1000 Hz gaze 流 + 自动解析 fixations
语音 PowerMic II 48kHz → IBM Watson STT → 医生校正 → 时间戳音节插值对齐
标签 图像级异常 + 定位椭圆 + 肺心 bounding box + 时间戳转录 + 注视序列
采集窗口 三阶段:2020-11-11~2021-01-04 / 2021-03-01~11 / 2021-03-24~06-07
论文 Sci Data 9:350 (2022)(10.1038/s41597-022-01441-z)+ arXiv 2109.14187
代码 github.com/ricbl/eyetracking(MIT)
资助 NIH NIBIB R21EB028367
团队 University of Utah 9 人(SCI 实验室 Tasdizen PI + 放射科 Schroeder)
一句话 放射科医生"看哪里、说什么"的第一次大规模同步记录——眼动×报告的隐式定位数据集

§0 摘要卡:医生的眼睛是免费的标注器

§0.1 它是什么

REFLACX 佯装是胸片数据集,实际是一场注意力科学实验:让 5 位放射科医生在 EyeLink 1000 Plus 眼动仪下口述 MIMIC-CXR 胸片报告——医生看片时眼睛的注视序列(1000 Hz)与嘴里说出的报告(时间戳转录)被同步记录。核心洞察:医生的注视点就是免费的异常定位标注——他说"右肺可见实变"时眼睛正盯着右肺,这个"看-说"对齐隐含了定位信息。3,052 次读片、2,616 张图、外加显式椭圆与肺心框做验证基准—— Utah 团队把"隐式定位数据的大规模采集方法"做成了概念验证(proof-of-concept)。

§0.2 三个数字

  • 3,032 / 3,052:有效眼动读片数 / 总读片 ID 数(20 份眼动因质量剔除但保留算标注一致性——数据集口径的第一课)。
  • 109:全 5 位医生共读的胸片数——标注者间变异的估计子集(Phase 1+2 专为此设计)。
  • 1000 Hz:原始眼动采样率——fixations(注视点)由 EyeLink 自动解析,粗细两层数据都给了。

§0.3 谁在用、怎么接

注意力建模研究者把 fixations 聚成 saliency map 对比人类视觉;弱监督定位团队用"注视+转录对齐"做 label-specific localization(椭圆做金标验证);报告生成团队用时间戳转录研究医生的叙述结构;UI 研究者用它评估读片界面。获取走 Restricted 档(注册+签 DUA——比 Credentialed 少 CITI 课程)。代码与后处理示例在 GitHub ricbl/eyetracking。

§0.4 本条目怎么读

§1 身份卡 → §2 隐式定位的方法学赌注 → §3 采集协议解剖(眼动/语音/校准)→ §4 三阶段设计与质控 → §5 论文与验证 → §6 生态位(眼动×医学影像的孤峰)→ §7 AI-Ready 十问 + DAIMS → §8 误解与坑点表 → §9 工作实例 → §10 FAQ 九十问 → 附录 A-H。

§1 身份卡:一张速览

字段 值
全称 REFLACX: Reports and eye-tracking data for localization of abnormalities in chest x-rays
slug / 本库编号 reflacx-xray-localization / 525
挂牌 2021-09-27(PhysioNet,v1.0.0 单版本)——批次七最早
DOI v1.0.0:10.13026/e0dj-8498;latest:10.13026/qhft-e228
访问 Restricted——注册用户+签特定 DUA(License 1.5.0 Restricted)
Topics 10 个:eye tracking / radiology report / fixations / computer vision / gaze / chest x-rays 等
Views 679(2021-09 挂牌至 2026-09,五年累计)
文件 main_data/(五件套 CSV+txt)+ gaze_data/(1000 Hz 原始流)
采集设备 EyeLink 1000 Plus + PowerMic II + MATLAB/Psychtoolbox + 4K 屏
转录引擎 IBM Watson Speech-To-Text(定制训练)+ 双层人工校正
论文 Sci Data 9:350 (2022);arXiv 2109.14187
代码 github.com/ricbl/eyetracking(MIT license)
团队 Utah 9 人——SCI 实验室(Tasdizen)+ 放射科(Schroeder)+ 心理学(Drew)

身份卡四行补注:

批次七的"时间锚点":2021-09-27 挂牌——比 519(2023-03)早一年半、比 516(2026-03)早四年半。批次七的条目时间跨度因此横跨 2021-2026 五年——生产顺序≠时间顺序的活例。

Restricted ≠ Credentialed:PhysioNet 访问档的中间层——注册+签特定 DUA(无 CITI 课程强制,对照 Credentialed 的 License 1.5.0+DUA+CITI 三件套)。本集与 512 是批次七仅有的两个 Restricted 例子。

“REFLACX” 的字母经济学:Report of Findings by Looking at Chest X-rays 的缩写变体(官方解释是 REports and eye-tracking data For Localization of Abnormalities in Chest x-rays)——检索时用全称,缩写不唯一。

无 Ethics 段的老页面:2021 年页面格式没有独立 Ethics section(2023 后成标配)——伦理处理在 Restricted DUA 里;这是页面代际的活化石特征。

§2 背景:隐式定位的方法学赌注

§2.1 定位标注为什么稀缺

页面 Background 的推理链:Li et al.(CVPR 2018)证明定位信息做弱监督能提升胸片分类——但定位标注(bounding box)罕见且昂贵(VinDr-CXR 这类医生手画框的数据集凤毛麟角,本库 rid 125)。大规模采集的出路:找免费的定位信号。医生读片时眼睛必然看向异常处——眼动轨迹是"已经发生"的定位行为,采集它不需要医生额外画框。NIH 的 medical imaging AI roadmap 明确优先这类自动标注技术——REFLACX 是这个方向的概念验证。

§2.2 "看-说"对齐:核心机制

单独的眼动轨迹只是注意力地图(不知道在看什么);单独的转录只是报告文本(不知道哪句话对应哪个位置)。REFLACX 的关键设计是同步:眼动与音频共享时间轴——医生说"right pleural effusion"(时间戳 t1-t2)那一刻的注视坐标序列,就把"effusion"这个词锚定到了屏幕坐标。这个对齐机制(口述+眼动的时间同步)是数据集的方法学心脏,转录校正后的时间戳音节插值是它的工程难点(§3.4)。

§2.3 椭圆与 bounding box:验证基准层

隐式信号(眼动)需要显式基准(人工标注)来验证。数据集同时采集:医生画异常定位椭圆(显式定位 gold)与肺心 bounding box(胸廓归一化基准)。双层结构=隐式信号(眼动)+显式验证(椭圆)+归一化基准(框)——三层各自可用又互为校验。这使 REFLACX 既是训练数据又是评测基准。

§2.4 proof-of-concept 的自我定位

页面 Usage Notes 末尾的原话:“This proof-of-concept is not a perfect replication of the clinical setting”——随后列了七条 Limitations(§4.4)。 Utah 团队没有把 REFLACX 卖成"完美临床数据",而是"可规模化采集方法的可行性证明"——这个定位决定了它的正确用法:验证"眼动+转录→定位"这条管线的有效性,而不是当终极标注源。

§2.5 眼动信号的物理链条:从光到坐标

理解 REFLACX 的数据质量要先理解测量链:红外光照射眼睛→相机捕获角膜反射与瞳孔→几何模型解算视线方向→与校准映射结合得到屏幕坐标。每一环都有误差源:瞳孔面积随亮度变化(GitHub 的亮度归一化示例就是补偿它)、角膜反射被眼镜干扰(n=2 剔除的直接原因)、头动改变几何(remote 模式的 sticker 约束)。fixations.csv 里每个坐标都背着这条误差链——用它做精细空间分析(如病灶边界内的注视判定)时,coordinate 的不确定度约为几像素到十几像素(取决于校准质量),这决定了"注视是否落在椭圆内"这类判定的天然模糊带。

§3 采集协议:一次读片的完整记录链

§3.1 硬件与软件栈

组件 规格
眼动仪 EyeLink 1000 Plus,25mm 镜头,remote 模式(额头 sticker)
采样率 gaze_data 1000 Hz(原始);fixations 由 Host PC 自动解析
显示 4K 屏,单张 frontal 片;支持缩放/平移/窗宽窗位
接口 MATLAB R2019a + Psychtoolbox 3.0.7
麦克风 PowerMic II,48,000 Hz
转录 IBM Watson Speech-To-Text(MIMIC-CXR 报告+医生语音定制训练)

§3.2 校准与质控的频率

13 点校准序列,触发条件:会话开始、休息后、每 25 cases、数据质量出问题时。质控剔除(Data Description 全录):眨眼>3 秒或眨眼占比>15%(n=41)、软件保存问题(n=6)、提前结束口述(n=7)、眼镜被误判为眼(n=2)、违规图像显示(n=6)——五类共 62 次剔除,占 3,052 的约 2%。

§3.3 采样规则:从 227 万到 2,616

MIMIC-CXR 227,835 studies → 过滤(frontal+单 frontal 片 study+在 MIMIC-CXR-JPG labels 表内)→ 按 20% test set + 80% 其余的比例采样 → 剔除肺大面积缺失/高旋转/明显翻转(Phase 3 另剔匿名框图)→ 2,616 张。20% 来自 test set 的设计让模型可无缝衔接 MIMIC-CXR 官方划分做泛化评估。

§3.4 时间戳插值:转录校正的工程暗礁

医生口述后修正转写错误——但修正会改变词序列,眼动-语音的对齐时间戳全乱。团队的解法:计算两版句子的词级差异,对每个差异把旧词的音节时间戳插值到新词——一个"文本 diff 驱动的时间重映射"算法。这决定了 timestamps_transcription.csv 的时间精度是插值近似而非原始测量——用它对齐眼动时要意识到这个误差源。

§3.5 IBM Watson 定制转录的工程细节

Watson STT 不是开箱即用:团队训练了定制模型——训练语料三部分混合(MIMIC-CXR 书面报告、本集医生的报告文本、医生的历史音频)。放射口述的词汇域(“cardiomediastinal”/“retrocardiac”)对通用模型是重灾区,定制训练把词错率压到可用水平。预处理的两个自动化清洗: unwanted expressions 过滤(指涉其他检查的句子不进训练集——"compare to prior"类)、非常规字符剔除(非空格/逗号/字母/连字符)。这个"域定制+预处理"组合是 2020 年语音识别在垂直域的最佳实践——今天用 Whisper/fine-tune 复现这套管线,时间戳精度仍是核心挑战(本集的音节插值方案是可借鉴的先行者)。

§4 三阶段设计:变异估计与主体采集的双轨

§4.1 Phase 1+2:109 张图的"五重奏"

Phase 1(2020-11-11~2021-01-04)与 Phase 2(2021-03-01~03-11)用同一组 109 张胸片让 5 位医生各自读——每张图 5 份眼动+5 份报告+5 组标注。用途:估计标注者间变异(图像级标签一致吗?椭圆位置差多少?注视模式因人而异吗?)。这个 109 的子集是 REFLACX 做任何"多读者一致性"分析的素材库。

§4.2 Phase 3:2,507 张的主体采集

Phase 3(2021-03-24~06-07)每张图只给一位医生读(独立图像集)——3 个月 2,507 张,日均约 28 张/5 人。Phase 3 剔除匿名框图(Phase 1/2 未剔——口径差异之一)。主体数据用于训练/评测定位管线。

§4.3 metadata 表的三列设计

列 含义
id READING_ID(如 P102R009922)——每次读片的唯一标识
split MIMIC-CXR 原划分(train/validate/test)——直接复用母库划分
eye_tracking_data_discarded 眼动质量剔除标志——20 份 true(3,052 vs 3,032 的差)

一张表三个键位把"读片→母库划分→质量状态"全部接通——元数据设计的最小完备样本。

§4.4 七条 Limitations 的全景(页面原话清单)

  1. 需要频繁校准(13 点校准的重复开销);
  2. 头动受限(remote 模式的 eye-相机距离约束);
  3. 单屏单 frontal 片(临床多屏+多序列对比不存在);
  4. 无报告模板与部分报告修改功能(真实口述环境有模板辅助);
  5. 单一胸片数据集(MIMIC-CXR 单源);
  6. 仅 8-bit 强度显示(诊断级 DICOM 位深更高);
  7. 校准与实时质控需第二人在场(非无人化)。

七条合起来的含义:REFLACX 是"受控实验室里的读片"——与真实临床读片的行为差异要作为协变量考虑。引用眼动结论时带上这个框架。

§4.5 五位读者:一次读片的"多学科团队"画像

Data Description 与致谢拼出的读者阵容:正式读者 5 位放射科医生(含首席 Joyce Schroeder)+Howard Mann(致谢中的额外读者)。页面未披露各读者的读片量分配(Phase 3 的 2,507 张如何轮转)——但"reader"维度的存在(metadata 与 GitHub 代码支持 per-reader 分析)意味着读者效应研究可行:谁更爱画椭圆、谁的注视更集中、谁的口述更长。读者效应在多数标注数据集里被平均掉,REFLACX 把它作为一等公民保留——这是过程数据相对标注数据的独有优势。

§5 论文与验证:Sci Data 的显式-隐式三角

§5.1 论文与数据集的双生关系

正式论文 Sci Data 9:350 (2022)(doi:10.1038/s41597-022-01441-z)与数据集同日生态:论文描述采集方法/验证实验/使用示例;数据集挂 PhysioNet。arXiv 2109.14187 是预印本(2021-09,与挂牌同期)。Sci Data 的数据描述论文体裁天然适配这类"方法可行性"数据集——审稿重点在采集协议的可复现性。

§5.2 验证管线的三层结构

  1. 隐式信号:fixations 序列(眼动)+时间戳转录(口述);
  2. 显式 gold:医生手画异常椭圆(定位)+图像级异常标签(分类);
  3. 归一化基准:肺心 bounding box(胸片位置/尺寸归一)。

验证逻辑:用"注视+转录"预测定位 → 与椭圆 gold 对比 → 报告定位精度。GitHub 示例含热图生成、亮度归一化(瞳孔面积补偿)、域外 fixations 过滤——三层结构的完整代码化。

§5.3 团队的学科三和弦

学科 人物 贡献位
CS/视觉(SCI 实验室) Tasdizen(PI)、Bigolin Lanfredi(一作)、Zhang 采集系统+后处理+建模
放射科 Schroeder(首席)、Auffermann、Chan、Duong 读片+标注+临床设计
心理学(眼动科学) Drew 眼动方法学
NLP Srikumar 转录对齐

一位放射科医生读者(Howard Mann)在致谢中单独感谢。这个"视觉计算+临床+心理物理+语音"的四学科配置是眼动医学研究的标准班底——单学科团队做不出这个数据集。

§5.4 MIMIC-Eye 整合包:REFLACX 的下游形态

PhysioNet 上的 MIMIC-Eye(mimic-eye-multimodal-datasets)把 REFLACX+EyeGaze(单医生眼动集)+MIMIC-IV(Hosp/ICU/ED)+MIMIC-CXR-JPG 整合为按患者组织的目录树——cxr_meta.csv 的 in_reflacx/in_eye_gaze 布尔列标记图像归属。做"眼动+临床全记录"的多模态研究时,MIMIC-Eye 是现成的整合层;REFLACX 是它的眼动源数据集之一。

§5.5 Sci Data 论文的"数据描述文"体裁价值

Scientific Data 的 Data Descriptor 体裁与常规论文不同:审稿重点是"数据采集的技术与科学质量是否支撑复用",而非假设检验的结论。这对 REFLACX 的含义:论文正文的三轮验证(注视+转录→定位 vs 椭圆 gold)不是"证明某算法好",而是"证明这批数据足以支撑此类验证"——数据集本身是论文的结论。引用姿势也相应不同:引的是"采集协议+验证框架",不是某个 SOTA 数字。这类体裁的数据集(Sci Data/Scientific Data 系)在本库已有多个(617 JPG 的 Scientific Data 前身 Johnson 2019 即同款),它们的共同特征:方法学披露密度高于结果炫耀。

§6 生态位:眼动×医学影像的孤峰

§6.1 本库多模态版图的新维度

条目 模态组合 记录的是
617/16 MIMIC 系 影像+报告文本 医生的产出
519 C 系 影像+报告文本 医生的产出
519 MS-CXR-T 图像对+标签+句对 时序语义
525 RE 图像对+标签+句对 时序语义
525 REFLACX 影像+眼动+语音+转录 医生的读片过程

本库所有 MIMIC 派生条目记录的都是医生工作的产出(报告/标注);REFLACX 记录的是过程(眼球怎么走、嘴里怎么说)。过程数据支撑的科研问题(注意力分布、读片策略、专家-新手差异、界面可用性)是产出数据无法回答的。

§6.2 眼动医学影像数据集的稀疏图谱

数据集 规模 模态
EyeGaze(PhysioNet) 单医生读片 眼动+音频+分割框
REFLACX(本集) 5 医生 3,052 读片 眼动+转录+椭圆+框
MIMIC-Eye 整合包 REFLACX+EyeGaze+MIMIC-IV

眼动×影像的公开数据个位数——REFLACX 的"孤峰"地位明显。5 位医生的读者间变异子集(109 图)在眼动文献里已是奢侈配置(多数眼动研究 2-3 位专家)。

§6.3 与 VinDr-CXR(rid 125)的参照关系

页面 References 引 Nguyen 2020 VinDr-CXR——同为"放射科医生显式定位"路线(越南 VinDr 是医生画框的大规模集)。路线对照:VinDr 是显式定位的大规模化(医生画框 10 万+),REFLACX 是隐式定位的规模化探索(眼动采集可扩展)。两条路线不互斥——REFLACX 的椭圆就是显式小集,眼动是隐式大集的原料。

§6.4 五年 679 次浏览的受众画像

眼动+医学影像的交叉人群天然小(视觉注意力研究 × 医学 AI 的交集)——679 次五年浏览在垂类里不算冷清。Sci Data 论文的引用(开放获取+数据描述论文体裁)是它的主要被发现渠道。这类"方法可行性"数据集的引用曲线由方法论文的引用带动——与本集"proof-of-concept"定位互洽。

§6.5 语音维度的被低估价值

讨论 REFLACX 时眼动总是主角,但时间戳转录是同样稀缺的资产:放射科医生口述报告的自然语言流(含犹豫、自我修正、省略)几乎无公开数据——本集 3,052 段带毫秒级时间戳的口述文本是语音×医学的独家素材。三个被低估的用法:一,医生口语 vs 书面报告的语言差异研究(口语的省略/重复模式);二,语音节奏作为认知负荷的代理指标(长停顿=难病例);三,多模态对齐研究(语音-眼动-图像三流的跨模态注意力)。用 gaze.csv 时别忘了 timestamps_transcription.csv 是同等稀缺的资产。

§6.6 从 REFLACX 看多模态数据集的"过程化"趋势

本库 2021-2026 的条目时间线恰好勾勒出医学数据集的演进方向:2021 前后是产出数据时代(影像+标签:CheXpert/MIMIC-CXR-JPG/REFLACX);2023 起进入过程与关系数据时代(MS-CXR-T 时序对、RadCoref 指代链、RadGraph2 图谱变化)。过程数据的共性挑战:时间同步(REFLACX 的音节插值)、多流对齐(MIMIC-Eye 的跨库整合)、隐私升级(眼动/语音比图像标签更接近个人信息——Restricted 档的由来)。给后来者的坐标:下一个"过程化"机会在 DICOM 结构化报告(SR)对象与读片工作站的 native 记录——REFLACX 用外挂设备做到的事,未来工作站原生就能记录。

§7 AI-Ready 十问

一问:什么格式? CSV 为主(fixations/椭圆/框/时间戳转录)+txt(校正转录全文)+gaze.csv(1000 Hz 原始流)——pandas 可直接吃的表格式,无 DICOM。

二问:多大规模? 3,052 读片(3,032 有效眼动)/2,616 图/2,199 患者;5 医生;109 图五重读——中等体量多模态。

三问:标注是什么性质? 显式:椭圆定位+图像级标签+肺心框(医生手工);隐式:注视序列+时间戳转录(同步采集过程数据);109 图五重读提供变异估计。

四问:许可与门槛? Restricted:注册+签 Restricted DUA(License 1.5.0 Restricted)——无 CITI 强制;比 Credentialed 少一道课程,比 Open 多一道协议。

五问:伦理完备度? 页面无独立 Ethics 段(2021 老格式)——伦理条款在 Restricted DUA 内;读片对象是去标识的 MIMIC-CXR 图像,无新患者接触。

六问:可复现性? 采集代码(MATLAB 接口)+后处理+使用示例全开源(GitHub MIT);设备型号/校准协议/质控规则全披露——采集方法的可复现文档是同类最优。

七问:标签的可信边界? 眼动数据有 2% 质量剔除;转录时间戳是插值近似;椭圆是医生主观定位(109 图上有变异估计);图像级标签为三态(无/确定/不确定的变体);20 份读片无眼动只有标注。

八问:适合什么任务? 注视→saliency map、眼动+转录→label-specific 定位(弱监督)、椭圆金标评测、报告口述行为研究、读片 UI 评估、bounding box 归一化管线。

九问:不适合什么? 临床读片行为的外推(七条 Limitations 的实验室偏差);诊断模型训练(无诊断标签);多医生共识金标(Phase 3 单读者为主);高分辨率影像研究(8-bit 显示)。

十问:一句话定位? 放射科医生"看哪里、说什么"的第一次大规模同步记录——隐式定位采集方法的公开概念验证。

DAIMS 评估:数据可得性 7(Restricted 中间档+MIT 代码+设备协议全披露)/ 标注 7(显式椭圆+隐式眼动双层+109 图五重变异,无逐类一致率)/ 方法 8(同步机制+插值算法+质控全披露+三阶段设计,方法学贡献突出)/ 影响力 6(Sci Data 2022+眼动垂类标杆)/ 规模 5(3,052 读片中体量)——DAIMS:6.6(对照:520 眼动前身 6.6 同档、613 分割型 7.2、519 基准型 7.0)。

§8 误解与反直觉

误解一:“REFLACX 是胸片数据集。” 骨架是 MIMIC-CXR 的子集——本体是读片过程的记录(眼动+语音);胸片要回母库取。把它当"另一个胸片集"会用错层。

误解二:“眼动数据就是标注。” 眼动是隐式信号(需要与转录对齐+模型解析才变成定位),显式标注是椭圆——两者是"原料与验证"关系,不能混用。

误解三:“3,032 和 3,052 有一个是错的。” 都对——3,052 个 ID 中 20 个的眼动被剔除但保留(算标注一致性用):Abstract 用有效数 3,032,Data Description 用总数 3,052。

误解四:“5 位医生都看了所有图。” 只有 109 张(Phase 1+2);Phase 3 的 2,507 张每人独立读——共识金标只在 109 子集上成立。

误解五:“转录是逐字的。” IBM Watson 自动转写+两层人工校正+时间戳插值重映射——时间精度是近似;毫秒级对齐实验要评估插值误差。

误解六:“Restricted 档也要考 CITI。” 不强制——Restricted 档(本集/512)与 Credentialed 档(MIMIC 系)的门槛结构不同:前者注册+DUA,后者注册+DUA+CITI。

误解七:“眼动仪是临床设备。” EyeLink 1000 Plus 是科研级设备(额头贴 sticker 的 remote 模式)——真实临床读片没有这个装备,行为差异是 Limitations 的核心项。

误解八:“2021 年的数据集没有 AI-Ready 价值。” 反了——它是眼动×医学影像方向至今仍是最大规模的公开集之一(孤峰效应);2021 的老恰恰说明这个方向后来者少。

误解九:“FIXations.csv 里的坐标是屏幕坐标。” 是显示器像素坐标(左上原点)——与胸片图像坐标的换算需要 bounding box 归一化(页面/GitHub 示例的用法)。

误解十:“REFLACX 的 ‘REF’ 是 reference。” 是 REports 的缩写成分——全称 REports and eye-tracking data For Localization of Abnormalities in Chest x-rays;检索别用错全称。

误解十三:“眼动热图=病灶热图。” 医生注视分布≠病灶分布——医生也注视正常结构(排除性扫视)、图像边缘(视野探索)与屏幕 UI。saliency 分析要区分"看因为异常"与"看因为例行"——椭圆标注就是做这个区分的对照。

误解十四:“椭圆画了就是确诊。” 椭圆是"读片时认为值得标注的异常"——与最终报告的诊断置信是两个层面;Phase 3 单读者无随访验证,椭圆的临床准确性(vs CT 等金标准)不在本集数据内。

§8.13 坑点表(八坑)

坑点 典型翻车 绕行姿势
坑点1:当胸片数据集用 找不到图像文件 图像在 MIMIC-CXR 母库;本集是过程数据(§2.1)
坑点2:眼动当标注用 拿 fixations 直接当定位 gold 眼动=隐式原料;椭圆=显式 gold(§5.2)
坑点3:口径记一个 3,032/3,052 引用打架 并列注明(20 份剔除保留)(§4.3)
坑点4:共识金标外推 2,507 张当多人读 五重读仅 109 张(§4.1)
坑点5:时间戳当精确值 毫秒级对齐翻车 插值近似——评估插值误差(§3.4)
坑点6:CITI 白跑 准备错门槛 Restricted 档无 CITI;注册+DUA 即可(§7 四问)
坑点7:坐标直接用 屏幕坐标当图像坐标 bounding box 归一化换算(GitHub 示例)
坑点8:sliveted 行为外推 眼动结论直接推临床 七条 Limitations 的实验室框架(§4.4)

§9 工作实例:从 fixations.csv 到 saliency 热图

§9.1 加载一次读片的五件套

import pandas as pd

rid = 'main_data/P102R009922'
fix = pd.read_csv(f'{rid}/fixations.csv')       # 注视点:时间戳/坐标/时长
ell = pd.read_csv(f'{rid}/anomaly_location_ellipses.csv')  # 异常椭圆
box = pd.read_csv(f'{rid}/chest_bounding_box.csv')         # 肺心框
tra = pd.read_csv(f'{rid}/timestamps_transcription.csv')   # 时间戳转录
meta = pd.read_csv('main_data/metadata_phase_3.csv')
print(meta[meta['eye_tracking_data_discarded']].shape)     # 质量剔除标志
# 时间戳:从录音开始秒计;坐标:屏幕像素左上原点

§9.2 注视序列→saliency 热图(GitHub 示例姿势)

import numpy as np

# 1) bounding box 归一化:屏幕坐标 -> 胸片图像坐标
bb = box.iloc[0]  # x/y/width/height(肺+心区域)
# 2) 高斯核叠加生成热图
heat = np.zeros((1024, 1024), dtype=np.float32)
for _, f in fix.iterrows():
    x = (f['x'] - bb['x']) / bb['width'] * 1024   # 归一化到图像坐标
    y = (f['y'] - bb['y']) / bb['height'] * 1024
    heat += gaussian_kernel(y, x, sigma=32) * f['duration']
# 3) 与椭圆 gold 对比(AUC/定位命中率)

§9.3 眼动-转录对齐(label-specific 定位)

# timestamps_transcription.csv:每词的起止时间戳
# 对齐逻辑:找含异常词的句子 -> 取该时间窗内的 fixations -> 隐式定位
word = tra[(tra['word'] == 'effusion')]
t0, t1 = word['start'].iloc[0], word['end'].iloc[0]
during = fix[(fix['start'] >= t0 - 1) & (fix['end'] <= t1 + 1)]
# during 的注视分布 = "effusion" 这个词的隐式定位
# 用 anomaly_location_ellipses.csv 的椭圆验证命中率

§9.4 评测与口径清单

  1. 分阶段报:109 图变异子集(五重读)与 Phase 3 主体分开;
  2. 质量过滤声明:eye_tracking_data_discarded=True 的 20 份不进眼动分析;
  3. 插值误差披露:转录校正的时间戳是插值——毫秒级实验要单独评估;
  4. 坐标归一化声明:屏幕坐标经 bounding box 归一化到图像坐标后再算定位指标。

§9.6 常见报错速查

  • fixations.csv 时间戳为负——录音起点前有校准残留:过滤 start<0 的行或按 metadata 表的会话边界裁剪;
  • 椭圆跨两个文件重复——同一医生同一 case 可能改画:按 (reader, case) 去重取最后版本;
  • gaze.csv 内存爆炸——1000 Hz 全量流按需分块(chunksize)或先重采样到 fixations 层再分析;
  • 转录对齐偏移——音节插值的近似性导致词级对齐漂移:用秒级窗口(±1s)而非精确边界;
  • 与 MIMIC-CXR 图像对不齐——READING_ID 不是 dicom_id:经 metadata 表 id 列回查 MIMIC-CXR 的 patient/study 映射。

§9.5 一个研究问题的最小闭环

“医生的注视能预测异常位置吗?”——取 Phase 3 单读者读片 → fixations 聚 saliency → 与 anomaly_location_ellipses 对比算定位 AUC → 分异常类型分桶(椭圆标签分组)→ 对照"纯转录基线"(不看眼动只看报告文本)→ 量化"眼动增量信息"。全程用本集三层结构(隐式+显式+归一化),不需要 MIMIC-CXR 图像参与训练。

§10 FAQ:九十问速查

§10.1 身份与获取(9 问)

Q1:REFLACX 是什么?

A:Utah 团队的眼动+报告口述同步数据集:5 位放射科医生读 MIMIC-CXR 胸片时采集注视序列与时间戳转录,3,052 次读片,附加椭圆定位与肺心框标注。

Q2:slug 与版本?

A:reflacx-xray-localization(批次登记 ‘REFLACX’ 为简称);单版本 v1.0.0(2021-09-27 挂牌)。

Q3:DOI?

A:e0dj-8498(v1.0.0)/ qhft-e228(latest)。

Q4:怎么获取?

A:Restricted 档:PhysioNet 注册+签 Restricted DUA 1.5.0——无需 CITI 课程(对照 Credentialed 档)。

Q5:图像文件在数据集里吗?

A:不在——胸片要回 MIMIC-CXR 母库取;本集是读片过程数据(眼动+转录+标注)。

Q6:体量多大?

A:页面未披露 Total Size(地区限制)——gaze_data 的 1000 Hz 流占大头,总体量以 GB 计。

Q7:Views 多少?

A:679(2021-09 至 2026-09 五年累计)。

Q8:项目主页在哪?

A:sci.utah.edu/eyetracking-cxr.html(Utah SCI 实验室项目页)。

Q9:代码在哪?

A:github.com/ricbl/eyetracking(MIT license)——采集接口+后处理+使用示例。

§10.2 数据内容(9 问)

Q10:3,032 和 3,052 哪个对?

A:都对——3,052 个读片 ID 中 20 份眼动因质量剔除但保留(算标注一致性);Abstract 用有效数 3,032。

Q11:每次读片记录什么?

A:五件套:fixations.csv 注视点/anomaly_location_ellipses.csv 椭圆/chest_bounding_box.csv 肺心框/timestamps_transcription.csv 时间戳转录/transcription.txt 校正全文。

Q12:gaze_data 是什么?

A:1000 Hz 原始眼动流(gaze.csv)——fixations 的上游原料,体量大但可重解析注视判定。

Q13:多少张图?多少患者?

A:2,616 unique chest x-rays / 2,199 unique subjects。

Q14:5 位医生都读了哪些?

A:109 张(Phase 1+2 共享集)——每张 5 份眼动+5 份标注;Phase 3 的 2,507 张每人独立读。

Q15:有异常标签吗?

A:有——图像级异常标签(读片时选择)+椭圆定位(医生手画)——验证用显式标注。

Q16:有诊断报告全文吗?

A:有——transcription.txt 是校正后的口述报告全文;timestamps_transcription.csv 带逐词时间戳。

Q17:三阶段怎么划分?

A:P1(2020-11~2021-01)+P2(2021-03)共享 109 图;P3(2021-03~06)2,507 张独立图。

Q18:图像怎么采样的?

A:MIMIC-CXR frontal+单 frontal study+在 JPG labels 表内;20% 来自 test set+80% 其余;剔旋转/翻转/肺缺失/匿名框。

§10.3 眼动方法学(9 问)

Q19:眼动仪是什么?

A:EyeLink 1000 Plus(SR Research),25mm 镜头,remote 模式(额头贴 sticker,允许有限头动)。

Q20:采样率多少?

A:gaze_data 1000 Hz;fixations(注视点)由 EyeLink Host PC 自动解析。

Q21:校准怎么做?

A:13 点序列;会话开始/休息后/每 25 cases/质量出问题时——高频校准是 Limitations 之一。

Q22:什么是 fixation?

A:注视——视线在特定位置的稳定停留(相对扫视 saccade);EyeLink 自动从原始流解析。

Q23:医生头能动吗?

A:有限——remote 模式下 sticker 与眼睛须在相机视野内、距离不能变化到失焦。

Q24:眨眼怎么处理?

A:眨眼=眼动仪丢失瞳孔/角膜/sticker;眨眼>3 秒或占单 case 15% 以上的数据剔除(n=41)。

Q25:坐标原点在哪?

A:屏幕左上角(x 水平/y 垂直)——屏幕像素坐标,与图像坐标需经 bounding box 归一化换算。

Q26:时间戳从哪起算?

A:从音频录音开始的秒数——眼动/音频/标注共享同一时间轴。

Q27:亮度补偿是什么?

A:GitHub 示例含胸片亮度对瞳孔面积的归一化方法——瞳孔大小随亮度变化会影响眼动测量。

§10.4 转录与对齐(9 问)

Q28:语音怎么转文字?

A:PowerMic II 录音(48kHz)→ IBM Watson Speech-To-Text(用 MIMIC-CXR 报告+医生语音定制训练)。

Q29:转录是自动的吗?

A:不是——Watson 初转+医生修正+第三人修正明显错误,双层人工把关。

Q30:校正后时间戳怎么办?

A:音节插值重映射:计算新旧词序列差异,把旧词时间戳按音节插值到新词——时间精度是近似。

Q31:逐词时间戳在哪个文件?

A:timestamps_transcription.csv——每词的起止时间,用于眼动-语音对齐。

Q32:对齐精度能到毫秒级吗?

A:插值近似下不建议——毫秒级实验需评估插值误差或只用秒级窗口。

Q33:transcription.txt 和 CSV 的区别?

A:txt 是校正后全文;CSV 是带时间戳的逐词版本——对齐用 CSV、读报告用 txt。

Q34:口述时有标点吗?

A:有——医生需口述标点(comma/period/slash,GitHub 接口说明);转录含标点。

Q35:音频文件在数据集里吗?

A:不在——发布的是转录与时间戳;原始音频未公开(隐私与体量考虑)。

Q36:sent_group 式的句子分组有吗?

A:没有——本集按词给时间戳;句子分组需自行从标点与时间间隔推断。

§10.5 许可与伦理(9 问)

Q37:License?

A:PhysioNet Restricted Health Data License 1.5.0 + Restricted DUA 1.5.0——非 Open 非 Credentialed 的中间档。

Q38:Restricted 档要考 CITI 吗?

A:不强制——注册+签 DUA 即可(对照 Credentialed 档的 CITI 必修)。

Q39:为什么是 Restricted?

A:眼动+转录的组合可能含医生语音特征与读片习惯——比纯图像标注更接近个人信息;DUA 限制再分发。

Q40:伦理审查?

A:页面无独立 Ethics 段(2021 老格式)——伦理条款在 DUA 内;读片对象是去标识母库图像。

Q41:COI?

A:作者声明无利益冲突。

Q42:谁资助的?

A:NIH NIBIB R21EB028367(Tolga Tasdizen PI)——Utah SCI 实验室。

Q43:医生有报酬吗?

A:页面未披露——采集协议含 MATLAB 接口与补偿细节未公开。

Q44:能再分发吗?

A:不可以——Restricted DUA 禁止;用户各自向 PhysioNet 申请。

Q45:商用研究可以吗?

A:按 Restricted DUA 条款——引用时注意该档位的条款比 ODbL/ODC-BY 严格得多。

§10.6 论文与团队(9 问)

Q46:正式论文是什么?

A:Bigolin Lanfredi et al. ‘REFLACX, a dataset of reports and eye-tracking data for localization of abnormalities in chest x-rays.’ Sci Data 9:350 (2022),10.1038/s41597-022-01441-z。

Q47:arXiv 版本?

A:arXiv 2109.14187(2021-09 预印本)——与数据集挂牌同期。

Q48:团队构成?

A:Utah 9 人:SCI 视觉计算(Tasdizen PI/Bigolin Lanfredi 一作/Zhang)+放射科(Schroeder 首席等 4 位)+心理学眼动(Drew)+NLP(Srikumar)。

Q49:有几位放射科医生参与?

A:5 位正式读者+Howard Mann(致谢中的额外读者);首席是 Joyce Schroeder。

Q50:眼动专家是谁?

A:Trafton Drew(犹他大学心理学系,眼动与注意力研究方向)。

Q51:和 MIMIC-Eye 什么关系?

A:MIMIC-Eye 是整合包(REFLACX+EyeGaze+MIMIC-IV+CXR-JPG)——REFLACX 是其眼动源数据集之一。

Q52:和 EyeGaze 数据集什么关系?

A:同域前辈——EyeGaze 单医生;REFLACX 5 医生+椭圆验证,规模与验证层都升级。

Q53:论文在哪个期刊?

A:Scientific Data(Nature 旗下数据描述期刊)——体裁是 Data Descriptor。

Q54:代码开源吗?

A:MIT license——采集 MATLAB 接口+后处理+示例全开。

§10.7 工程实践(9 问)

Q55:推荐的读取方式?

A:pandas 直接读 CSV——五件套都是标准表格;gaze.csv 大文件建议分块或列裁剪。

Q56:怎么过滤无效眼动?

A:main_data/metadata_phase_N.csv 的 eye_tracking_data_discarded 列——True 的 20 份不进眼动分析。

Q57:怎么把注视聚成热图?

A:高斯核按注视时长叠加(GitHub examples_and_paper_numbers 有官方示例)——sigma 与时长加权是两个自由参数。

Q58:屏幕坐标怎么转图像坐标?

A:用 chest_bounding_box.csv 归一化——GitHub 示例含完整换算代码(亮度归一化也在此步骤)。

Q59:怎么对齐眼动与转录?

A:时间轴共享(录音起点)——找词时间窗内的 fixations(§9.3);插值误差评估建议先行。

Q60:域外注视怎么过滤?

A:GitHub 提供 out-of-chest fixations 过滤脚本——医生看屏幕边缘/工具栏的注视要剔除。

Q61:复现论文数字跑哪个脚本?

A:examples_and_paper_numbers 文件夹——验证公开数据集数字的官方脚本。

Q62:训练口述系统要什么?

A:IBM Watson 已不再开放同款定制——现可用 Whisper 等替代;时间戳精度是自建管线的核心指标。

Q63:怎么算读者间变异?

A:109 张五重读子集——图像级标签一致率+椭圆位置方差+注视模式对比三路分析。

§10.8 对比与选型(8 问)

Q64:它和 EyeGaze 数据集选哪个?

A:要多位读者变异与椭圆验证选 REFLACX(5 人 3,052 读片);EyeGaze 有解剖分割框与单读者深度——两者已在 MIMIC-Eye 整合。

Q65:它和 MIMIC-Eye 什么关系?

A:REFLACX 是 MIMIC-Eye 的眼动源——要整合包(含 MIMIC-IV 临床)用 MIMIC-Eye;只要眼动本体用本集。

Q66:它和 VinDr-CXR(125)什么关系?

A:显式定位路线的对照——VinDr 是医生画框大集;REFLACX 是隐式定位(眼动)方法学探索;References 互引。

Q67:它和 617 JPG 什么关系?

A:母库派生——617 是影像+分类标签;本集是读片过程多模态;共用 MIMIC-CXR 图像池。

Q68:要 saliency 基准去哪?

A:本集 fixations 就是人类 saliency——MIT/AiR 等 saliency 数据集外的主要胸片选择。

Q69:报告生成研究能用吗?

A:能——时间戳转录揭示医生的叙述顺序与停顿结构;但无诊断标签、口述风格与书面报告有差异。

Q70:UI/人因研究能用吗?

A:能——但注意 Limitations 的实验室设定(单屏/8bit/无模板);结论外推到临床要谨慎。

Q71:一句话选型?

A:眼动×读片的孤峰数据集:注意力建模用 fixations、弱监督定位用对齐管线、行为研究用五重读子集。

Q72:一个医生一天读多少张?

A:Phase 3 约 2,507 张/75 天/5 人≈日均 7 张/人——远低于临床量(实验室协议的校准与质控开销所致)。

Q73:椭圆是医生即时画的还是事后画的?

A:即时——接口在口述后立即进入标注屏(同一会话),不是事后回顾。

Q74:图像级标签有几类异常?

A:沿 MIMIC-CXR/CheXpert 常见异常集合——具体类别清单以 metadata 与 ellipse 表的 label 字段为准。

Q75:眼动数据有 left/right eye 之分吗?

A:remote 模式追踪单眼——数据记录的是被追踪眼(每读者固定);双眼差异不在采集范围。

Q76:109 张变异子集的用途边界?

A:五重读支持标注者间变异分析——但 109 张的分布未必代表全库;外推时注意采样框架差异。

Q77:blink 和 saccade 数据在哪?

A:gaze_data/gaze.csv 的 1000 Hz 原始流里(可重解析);main_data 的 fixations.csv 只有解析后注视点。

Q78:能复原医生看到的屏幕吗?

A:部分——4K 屏+窗宽窗位参数未随数据发布;只有最终标注与注视坐标,中间的缩放/平移轨迹不可复原。

Q79:转录里有 PHI 吗?

A:口述内容基于去标识图像——医生口述中不会出现姓名等 PHI;DUA 仍按敏感数据处理。

Q80:Phase 1 和 Phase 2 之间为什么隔两个月?

A:页面未解释——推测是设备/流程调整期;对分析的直接影响是两阶段可比性可检验(同 109 图)。

Q81:能拿到医生的注视视频吗?

A:不能——发布的是解析后表格与 1000 Hz 数值流,无视频;复现可视化需自己基于坐标绘制。

Q82:扫描顺序对眼动有影响吗?

A:图像呈现顺序页面未披露——顺序效应(疲劳/学习)是潜在混杂,分析时可用 case 序号做稳健性检查。

Q83:bounding box 是每人每图一份吗?

A:是——每次读片独立画框(109 图有 5 份框)——框本身的读者间变异也是可研究量。

Q84:数据分几个 split?

A:沿用 MIMIC-CXR 原划分(train/validate/test)——本集不自带新划分;20% test 采样保证 test 有足够覆盖。

Q85:能用于多模态 LLM 评测吗?

A:前沿用法——"看图说话"的 attention-grounding 评测:模型报告词与人类注视热图的一致性——需自建评测协议。

Q86:109 张的采样逻辑?

A:页面未详述——Phase 1/2 的共享集与 Phase 3 主体大概率来自同一采样池(frontal 过滤后);分布差异可自行检验。

Q87:椭圆的置信度或修正痕迹在吗?

A:不在——只有最终椭圆;绘制过程(修改次数/犹豫时间)未记录。

Q88:可以拿到 MATLAB 接口的截屏吗?

A:GitHub 仓库含接口代码(可运行复现界面外观)——论文与 README 有界面示意。

Q89:怎么验证自己复现的 saliency 是对的?

A:GitHub examples_and_paper_numbers 有官方脚本——先复现论文数字再自研。

Q90:眼动仪厂商的专有格式在哪?

A:EyeLink 的 EDF 原始格式未发布——发布的是解析后的 CSV(ASCII);EDF 特有字段不可得。

Q91:REFLACX 的发音?

A:社区惯读 “ref-LACK-see” 或逐字母拼读——缩写无官方读音,检索用拼写即可。

Q92:可以用它研究放射科教学吗?

A:可以——新手 vs 专家的注视差异是教学研究的经典问题;本集只有资深医生(无新手对照),新手数据要另采。

Q93:fixations 的判定算法是谁的?

A:EyeLink Host PC 的内置算法(速度/位置阈值判定)——参数未随数据发布;重解析 gaze.csv 需自定算法并与官方 fixations 对齐验证。

Q94:椭圆有方向性吗(长轴角度)?

A:有——椭圆参数含轴长与角度(细节见 CSV 列);退化成圆的画法也存在(取决于医生)。

Q95:图像级标签和椭圆标签一致吗?

A:大体一致(画椭圆的异常通常也会选图像级标签)——不一致样本本身就是有趣的分析对象(口述说了但没画的)。

Q96:8-bit 显示对 16-bit DICOM 的损失多大?

A:临床显示器通常也映射到 8-bit 显示——损失主要在窗宽窗位自由度;Limitations 列此条是严谨而非致命。

Q97:第二人在场会影响医生行为吗?

A:可能(观察者效应)——Limitations 自认;对照真实独立读片的行为差异无法在本集内量化。

Q98:能不能拿到医生的简历与年资?

A:页面只给"board-certified/experienced"级别描述——具体年资未披露;变异分析时读者匿名化处理。

Q99:数据采集的响应式纠错(中途改口)怎么记录?

A:口述含自我修正(“the effusion, sorry, the pneumothorax…”)——转录保留原话,时间戳按实际发音——自我修正是口语研究的富矿。

Q100:5 位医生的设备完全相同吗?

A:是——同一台 EyeLink+同一 MATLAB 接口+同一间采集室(Phase 1/2/3 的设备环境一致性较高);跨设备差异不在本集设计内。

Q101:医生的读片顺序是随机的吗?

A:页面未披露呈现顺序——Phase 1/2 共享集的顺序可能固定(变异估计要求同序或说明),分析顺序效应前先确认。

Q102:同一个医生读同一张图两次会一致吗?

A:Phase 1 vs Phase 2 的对比就是这个问题的实验(同 109 图隔两月复读)——自身一致性的数据就在数据集里,等分析。

Q103:椭圆能转成 bounding box 吗?

A:技术上可以(椭圆外接矩形)——但会引入边界冗余(框住背景);直接用椭圆的掩码化(填充)更忠实。

Q104:多医生标注怎么合成单一 gold?

A:109 图五重读可取多数投票(图像级)或椭圆并集/交集(定位级)——合成策略取决于下游任务,数据集不预合成。

Q105:eye_tracking_data_discarded=1 的标注还可靠吗?

A:标注(椭圆/框/图像级标签)与眼动采集独立——剔除只影响眼动分析;标注分析照常使用全部 3,052。

Q106:能分析医生看图的时间分配(肺 vs 心 vs 其他)吗?

A:能——bounding box 定义肺心区域,落在框外的注视即"其他"——区域间时间分配是注意力研究的基础分析。

Q107:数据里的异常覆盖哪些类型?

A:沿胸片常见异常(积液/实变/气胸/结节等)——精确类别以 ellipse 与图像级标签的字段值为准。

Q108:语言模型能学医生的口述风格吗?

A:能——时间戳转录是口语化报告语料(含自我修正)——训练"报告口语化"或"口语规范化"模型都有素材。

Q109:批注与报告的时序关系?

A:流程是先口述后标注(同一会话内)——椭圆晚于口述完成,眼动-椭圆的对齐是跨阶段的(经图像坐标间接联系)。

Q110:后续有 REFLACX 2.0 的计划吗?

A:无公开信息——五年单版本;团队后续产出转向 MIMIC-Eye 整合与 EyeGaze 生态。

Q111:非胸片的眼动数据集有吗?

A:有若干(病理切片/眼底/CT 阅片的实验室集)——公开可得且多读者的仍稀少;REFLACX 的孤峰是胸片域的。

Q112:怎么引用数据集与论文?

A:数据集引 Bigolin Lanfredi et al. 2021 PhysioNet DOI(e0dj-8498);方法引 Sci Data 2022 论文——双引用缺一不可。

Q113:训练时需要 MIMIC-CXR 的认证吗?

A:需要——图像在母库;本集只有过程数据与标注,训练影像模型必须配合 MIMIC-CXR 使用(同 DUA 体系)。

Q114:5 位医生的椭圆风格差异大吗?

A:未在页面披露——109 图五重读就是量化这个差异的素材(画框大小/数量/位置的读者效应)。

Q115:可以申请追加未公开的元数据吗?

A:联系通讯作者(Utah SCI/放射科)——校准日志、接口日志等过程元数据是否可共享按团队政策。

Q116:一句话给想做眼动医学研究的团队?

A:本集是"方法学模板+基准数据"的双重起点——抄它的采集协议、避开它的七条 Limitations、用它的数据先跑通管线再自采。

(FAQ 实际 116 问——九十问速查为栏目名)

§11 事实清单:核查记录

  1. 批次登记 ‘REFLACX’ → 实测 slug reflacx-xray-localization(reflacx/ 基址 404)
  2. 挂牌 2021-09-27(单版本 v1.0.0 Initial release)——批次七最早挂牌
  3. DOI v1.0.0 = 10.13026/e0dj-8498
  4. DOI latest = 10.13026/qhft-e228
  5. 访问 = Restricted(‘Only registered users who sign the specified data use agreement’)
  6. License = PhysioNet Restricted Health Data License 1.5.0 + Restricted DUA 1.5.0
  7. Restricted 档无 CITI 强制(对照 Credentialed 档)
  8. Topics 10 个:eye tracking/radiology report/reflacx/fixations/computer vision/gaze/chest x-rays/radiology/machine learning/deep learning
  9. Views 679(五年累计)
  10. 文件区 Data Not Available(地区限制)
  11. Abstract:3,032 例同步眼动+转录对(5 位放射科医生)
  12. Data Description:总 3,052 IDs——20 份眼动剔除但保留(一致性计算用)
  13. 2,616 unique chest x-rays / 2,199 unique subjects
  14. 109 张图全 5 医生共读(Phase 1+2 变异估计子集)
  15. 三阶段:P1 2020-11-11~2021-01-04 / P2 2021-03-01~11 / P3 2021-03-24~06-07
  16. P3 主体 2,507 张(每人独立图)
  17. 采样:MIMIC-CXR frontal+单 frontal study+JPG labels 表内
  18. 采样比例:20% MIMIC test set + 80% 其余
  19. 剔除:肺大面积缺失/高旋转/明显翻转;P3 另剔匿名框图
  20. 眼动仪 EyeLink 1000 Plus(25mm 镜头,remote 模式,额头 sticker)
  21. gaze_data 1000 Hz 原始流;fixations 由 EyeLink Host PC 自动解析
  22. 接口 MATLAB R2019a + Psychtoolbox 3.0.7 + 4K 屏
  23. 校准:13 点序列——会话开始/休息后/每 25 cases/质量问题时
  24. 麦克风 PowerMic II 48,000 Hz
  25. 转录 IBM Watson Speech-To-Text(MIMIC-CXR 报告+医生语音定制训练)
  26. 转录双层校正:医生+第三人
  27. 校正后时间戳音节插值重映射(文本 diff 驱动)
  28. 质控剔除:眨眼>3s 或 >15%(n=41)/软件问题(n=6)/提前结束(n=7)/眼镜误判(n=2)/违规图(n=6)
  29. 五类共 62 次剔除≈2%
  30. 目录:main_data/(五件套)+ gaze_data/(1000Hz)
  31. 五件套:fixations.csv/anomaly_location_ellipses.csv/chest_bounding_box.csv/timestamps_transcription.csv/transcription.txt
  32. metadata_phase_N.csv:id/split(MIMIC 原划分)/eye_tracking_data_discarded
  33. 时间戳从录音起秒计;像素坐标左上原点
  34. 作者 9 人全 Utah:Bigolin Lanfredi/Zhang/Auffermann/Chan/Duong/Srikumar/Drew/Schroeder/Tasdizen
  35. 四学科:视觉计算(SCI)+放射科(Schroeder 首席)+心理学眼动(Drew)+NLP(Srikumar)
  36. 论文 Sci Data 9:350 (2022) doi:10.1038/s41597-022-01441-z
  37. 预印本 arXiv 2109.14187(2021-09)
  38. 代码 github.com/ricbl/eyetracking(MIT license)
  39. 资助 NIH NIBIB R21EB028367(Tasdizen PI)
  40. 额外读者 Howard Mann(致谢)
  41. Usage Notes 五用途:saliency/label-specific 定位/椭圆验证/框归一化/框模型训练
  42. Limitations 七条:频繁校准/头动受限/单屏单片/无模板/单数据集/8bit/第二人在场
  43. proof-of-concept 自我定位(页面原话)
  44. 页面无独立 Ethics 段(2021 老格式)——伦理在 Restricted DUA 内
  45. COI 无
  46. References:Li 2018 CVPR/Wang 2017 ChestX-Ray8/Nguyen 2020 VinDr-CXR(rid 125)/Shih 2019 RSNA
  47. 姊妹整合:MIMIC-Eye(REFLACX+EyeGaze+MIMIC-IV 整合包)
  48. 近邻:EyeGaze 数据集(单医生眼动)
  49. 查重:url_name 含 reflacx 0 行
  50. 发布前 MAX(record_id)=621;并行会话在写 522——本条 rid 视 522 落地情况为 622 或 623
  51. 批次预判存照:批次笔记称’525 是 512 的母集’有误——REFLACX 母集是 MIMIC-CXR
  52. Restricted 档批次第二例(对照 512)
  53. 互链目标:rid 125(VinDr)/16/617(MIMIC)/521/522(双层发布同批)
  54. 隐式-显式-归一化三层结构:眼动/椭圆/bounding box
  55. 本集 DAIMS 6.6(方法 8 突出/规模 5 中等)

§12 术语表:五十条

1. REFLACX —— 本条目:Reports and eye-tracking data For Localization of Abnormalities in Chest x-rays

2. 眼动追踪(eye-tracking) —— 记录视线位置与运动的技术——本集的核心模态

3. fixation —— 注视——视线稳定停留;saccade(扫视)之间的停留段

4. fixations.csv —— 解析后的注视点表(时间戳/坐标/时长)

5. gaze.csv —— 1000 Hz 原始眼动流——fixations 的上游

6. EyeLink 1000 Plus —— SR Research 科研级眼动仪——25mm 镜头 remote 模式

7. remote 模式 —— 非侵入眼动采集——额头 sticker+相机追踪,允许有限头动

8. 13 点校准 —— 眼-屏幕对应校准序列——高频校准是 Limitations 之首

9. Psychtoolbox —— MATLAB 心理物理学工具箱——采集界面基础

10. IBM Watson STT —— 语音转文本引擎——本集转录管线(定制训练)

11. 音节插值 —— 转录校正后的时间戳重映射算法——文本 diff 驱动

12. saliency map —— 显著性图——fixations 聚合的注意力分布

13. 隐式定位 —— 从眼动+语音推断病灶位置——本集的方法学主张

14. 显式定位 —— 医生手画椭圆——隐式信号的验证 gold

15. anomaly_location_ellipses.csv —— 椭圆定位表——医生画的异常区域

16. chest_bounding_box.csv —— 肺心边界框——胸片位置归一化基准

17. timestamps_transcription.csv —— 逐词时间戳转录——眼动-语音对齐的桥

18. READING_ID —— 每次读片的唯一标识(如 P102R009922)

19. metadata_phase_N.csv —— 三阶段元数据表(id/split/剔除标志)

20. eye_tracking_data_discarded —— 眼动质量剔除标志——3,052 vs 3,032 的差

21. Proof-of-concept —— 概念验证——本集的官方定位(非完美临床复刻)

22. EyeGaze —— 单医生眼动数据集——本集的同域前辈

23. MIMIC-Eye —— 整合包:REFLACX+EyeGaze+MIMIC-IV+图像

24. Sci Data —— Nature 数据描述期刊——正式论文出处(9:350)

25. Restricted License 1.5.0 —— PhysioNet 受限数据许可——本集档位

26. Restricted DUA 1.5.0 —— 受限数据使用协议——注册+签署即可

27. VinDr-CXR —— 越南医生画框胸片集(rid 125)——显式定位路线对照

28. 弱监督定位 —— 用粗粒度信号(眼动/图像级标签)训练定位——本集的应用主张

29. saccade —— 扫视——注视之间的快速眼动

30. 瞳孔面积归一化 —— 亮度对瞳孔大小影响的补偿——GitHub 示例

31. PowerMic II —— 口述麦克风——48kHz 采集

32. Remote mode —— 眼动仪的非侵入工作模式

33. label-specific localization —— 按报告词定位异常——眼动+转录对齐的产出

34. Utah SCI —— 犹他大学科学计算与影像研究所——本集生产方

35. Tasdizen —— Tolga Tasdizen——PI,SCI 主任

36. Schroeder —— Joyce Schroeder——首席放射科医生

37. Drew —— Trafton Drew——心理学眼动专家

38. Srikumar —— Vivek Srikumar——NLP 方向作者

39. R21EB028367 —— NIH NIBIB 资助编号

40. Stanza 无关项 —— 本集不用 Stanza——切句在转录对齐按词处理(对比 521)

41. 读片过程数据 —— 医生怎么读片的记录——产出数据的对偶概念

42. 过程-产出对偶 —— 本库多模态版图的新维度——525 独有

43. 多模态同步 —— 眼动/音频/标注共享时间轴——本集方法学心脏

44. 3,052/3,032 —— 总读片数/有效眼动数——口径并存

45. 实验室-临床差距 —— 七条 Limitations 的合集语义——外推需谨慎

46. saliency AUC —— 眼动热图与 gold 区域的评测指标——常用口径

47. shape 归一化 —— bounding box 到图像坐标的换算——GitHub 示例核心

48. out-of-chest fixations —— 胸片区域外的注视——需过滤

49. 2021 老页面格式 —— 无 Ethics 段的页面代际特征——对照 2023+ 新页面

50. 孤峰效应 —— 眼动×医学影像方向的稀疏公开生态——本集地位

附录 A:发布时间线与产出链对照

日期 事件
2017 ChestX-Ray8(Wang et al. CVPR)——弱监督定位的问题定义
2018 Li et al. CVPR(Thoracic Disease Identification and Localization with Limited Supervision)——定位弱监督的方法先例
2019 MIMIC-CXR 发布;NIH medical imaging AI roadmap 优先自动标注
2020-11-11 Phase 1 采集开始(109 张共享图,5 医生)
2021-01-04 Phase 1 结束
2021-03-01~11 Phase 2(同 109 图复读)
2021-03-24~06-07 Phase 3 主体采集(2,507 张独立图)
2021-09 arXiv 2109.14187 预印本
2021-09-27 PhysioNet 挂牌 v1.0.0(论文-数据同季)
2022 Sci Data 9:350 正式论文(doi:10.1038/s41597-022-01441-z)
2023+ MIMIC-Eye 整合包发布(REFLACX 为眼动源)
2026-09 Views 679;无版本更新

附录 B:一次读片的数据全景(单 READING_ID)

main_data/P102R009922/
├── fixations.csv                    # 注视点:起止时间/坐标/时长
├── anomaly_location_ellipses.csv    # 异常椭圆:中心/轴/标签(显式 gold)
├── chest_bounding_box.csv           # 肺心框:x/y/width/height(归一化基准)
├── timestamps_transcription.csv     # 逐词时间戳(对齐桥)
└── transcription.txt                # 校正后报告全文
gaze_data/P102R009922/
└── gaze.csv                         # 1000 Hz 原始眼动(可重解析注视判定)

时间轴协议:全部时间戳从音频录音开始计秒——眼动/语音/标注共享同一时间原点,这是"同步"二字的工程含义。

附录 C:三阶段采集设计对照

阶段 窗口 图像集 读者 设计目的
Phase 1 2020-11-11~2021-01-04 109 张共享 5 人全读 变异估计(基线)
Phase 2 2021-03-01~11 同 109 张 5 人全读 变异估计(复测)
Phase 3 2021-03-24~06-07 2,507 张独立 每图 1 人 主体规模采集
合计 约 7 个月 2,616 unique 图 5 人 3,052 次读片

Phase 1→2 的间隔(两个月)还可用于测时间维度的自身一致性——同一医生读同一张图,隔两个月的注视模式稳定吗?这是多数眼动数据集没有的维度。

附录 D:质控剔除全录(五类 62 次)

剔除原因 n 判据
眨眼过长/过频 41 单次眨眼>3s 或眨眼占 case 时长>15%
软件保存问题 6 保存过程故障
提前结束口述 7 医生未完成即结束
眼镜误判 2 眼动仪把眼镜识别为眼睛
违规图像 6 违反过滤规则的图被显示
合计 62 占 3,052 的约 2%

剔除但保留的 20 份(3,052−3,032)用于 manual labels 一致性计算——眼动没了但标注还在,不是废数据。

附录 E:口径差异存照(并列引用,不仲裁)

项 口径 A 口径 B 处置
读片数 3,032(Abstract 有效眼动) 3,052(Data Description 总 IDs) 并列注明差 20 份剔除保留
访问预判 批次笔记 Restricted 实测 Restricted ✓ 命中
母集归属 批次笔记"512 的母集" 实测 MIMIC-CXR 派生 修正存照
论文引用 arXiv 2109.14187(预印本) Sci Data 9:350(2022 正式) 正式版优先
Ethics 段 无独立 section(2021 老格式) 伦理条款在 Restricted DUA 如实标注

附录 F:眼动数据集稀疏图谱(截至 2026)

数据集 读者数 规模 模态 访问
EyeGaze 1 约 3.4 万读片帧级 眼动+音频+解剖框 公开(MIT 处)
REFLACX(本集) 5 3,052 读片 眼动+转录+椭圆+框 Restricted
MIMIC-Eye 整合 REFLACX+EyeGaze+MIMIC-IV 全模态树 PhysioNet
各类 lab 内部集 2-4 百级 眼动为主 私有

REFLACX 是"多读者+验证标注+公开可得"三条件同时满足的唯一解——孤峰地位的成因。

附录 G:本库互链与家族

本库条目 关系 链接语义
rid 16 mimic-cxr 母库 读片图像来源(frontal 子集)
rid 617 mimic-cxr-jpg 平行派生 影像标签层 vs 过程记录层
rid 125 vindr-cxr 路线对照 显式画框大集 vs 隐式眼动探索(References 互引)
rid 5 chexpert 同源对照 粗粒度标签 vs 多模态过程
rid 602/613 分割类 显式掩码 vs 隐式注视
rid 521/522 同批文本层 共指链/图谱 vs 眼动过程——批次七全景

附录 H:批次七生产存照(525 号)

  • 生产序号:批次七 8/10(数据集总序 525;发布后 record_id 视并行会话 522 落地情况为 622 或 623)
  • 核查轮次:3 轮——①版本探测(reflacx/1.0.0/2.0.0/3.0.0 全 404 → reflacx-xray-localization 正确 slug)②正式页面 1.0.0(64,336 B 全段)+alpha.physionet 缓存版对照(采集协议/质控/文件结构补全)③Utah SCI 项目页+GitHub ricbl/eyetracking(论文/代码/团队交叉)+DB 查重
  • 关键存照:3,052 vs 3,032 口径(20 份剔除保留);Restricted 档(预判命中);批次笔记"512 的母集"预判有误(实为 MIMIC-CXR 派生——修正存照);2021 老页面无 Ethics 段
  • 意外收获:音节插值时间戳重映射算法;五类 62 次质控剔除全录;四学科团队配置;MIMIC-Eye 整合包关系;VinDr-CXR 引用互链(rid 125)
  • 成品行数:见发布记录(目标 ≥1200)
  • 下一发:523/524 验收补录或 526 起(视并行会话进度而定)

附录 D 注:62 次剔除的方法学意义

五类剔除里最有信息量的是"眨眼>15%"(n=41)——它不是设备故障而是生理行为:长时间读片必然眨眼,高频眨眼段的眼动数据不可信。15% 的阈值是"数据可用性"与"行为真实性"的折中——更严格的阈值(如 10%)会剔更多真实临床行为样本。研究者用本集做"读片疲劳"或"病例难度"分析时,这 41 例高眨眼样本本身就是信号(它们可能是最难读的片子)——剔除规则同时是元数据。

附录 E 注:Restricted 档的实务清单

申请 REFLACX 的完整动作序列:①PhysioNet 注册账号;②完成所需协议签署(Restricted DUA 1.5.0——无 CITI 强制但建议完成基础伦理培训);③在数据集页面点 Access Request 填用途声明;④等待审批(Restricted 档通常人工审核,快于 Credentialed 的自动流程);⑤获批后 wget/ZIP 下载。对照 Credentialed 档(MIMIC 系)的差别在第②步——Restricted 不要求 CITI 证书上传,但 DUA 条款同样具约束力。审批时间与条款细节以 PhysioNet 当期流程为准。

附录 G 注:批次七的"隐式-显式光谱"

把批次七已产出的条目放在"标注显式度"光谱上,一条清晰的谱线浮现:

条目 标注形态 显式度
516 ext-ils 分割掩码+指令对(全自动生成,95% 人工验收) 显式·机器
617 jpg 14 类五值标签(规则引擎+687 人工验证) 显式·弱监督
519 ms-cxr-t 图像对三态+句对(板证金标) 显式·金标
521 radcoref mention/cluster(i2b2+预标注) 显式·关系
522 radgraph2 12 类实体+关系图谱 显式·图谱
525 reflacx(本集) 注视序列+口述转录(过程数据) 隐式·过程

谱线的另一端站着 616——两端的张力(全自动扩展性 vs 人工金标准确性)正是整个医学标注领域的核心矛盾。REFLACX 的独特位置在隐式端:它不标注"病灶在哪",它记录"医生在看哪"——把标注动作本身变成了数据。这条谱线是批次七规模化生产才能绘出的领域地图。

附录 H 注:与并行会话的分工存照

批次七 523-525 的生产出现会话分工:522 radgraph2 与 523/524 由并行会话按序推进(radgraph2 已见 1,121 行工作稿),本会话跳产 525 REFLACX——错位生产避免重复劳动(521 双发事故的教训落地)。两线产物统一入 tracker:并行会话条目以"验收补录"方式纳入本会话的总账闭环。FACTS.md 先行落档的策略在本条目生效——即使条目让出,核查档案(slug 修正/口径存照/预判修正)无损保留。

收尾:五年后的回望

2021 年 REFLACX 挂牌时,"医生看片的过程数据"还是个方法论赌注;五年后,本库的批次七用 519/521/522 三条目从视觉、语篇、语义三层逼近同一问题,而 REFLACX 的隐式定位主张——把医生的行为变成数据——已经在 MIMIC-Eye 整合包里结出生态果实。50.4 MB 的 520、1,326 对的 519、3,052 次读片的 525:批次七反复证明一个判断——医学 AI 的下一个突破不靠更大的数据,靠更聪明的数据视角。REFLACX 选的视角是所有人的视角里最被低估的:医生的眼睛。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • radvlm-instruction-dataset — 共享标签:医学影像 / 医疗NLP / 多模态 / X光影像
  • radialog-instruct-dataset — 共享标签:医学影像 / 医疗NLP / 多模态 / X光影像
  • mimic-cxr — 共享标签:医学影像 / 多模态 / X光影像
  • latte-cxr — 共享标签:医学影像 / 多模态 / X光影像
  • ms-cxr-t — 共享标签:医学影像 / 医疗NLP / 多模态 / X光影像
  • rsna-series — 共享标签:医学影像 / 多模态 / X光影像
  • mimic-iv-note — 共享标签:医学影像 / 医疗NLP / X光影像
  • ms-cxr — 共享标签:医学影像 / 多模态 / X光影像
  • gmai-mmbench — 共享标签:医学影像 / 医疗NLP / 多模态
  • chexpert-plus — 共享标签:医学影像 / 医疗NLP / X光影像

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集