Poisson 源探测管道为每个候选源报告一个基于似然的检测统计量,例如
XMM-Newton SAS 中的
,并使用该数值进行目录阈值设定和灵敏度图构建。然而在阈值附近,相关对象是底层
Cash 统计量似然比改进
的采样分布,而非仅仅是所报告的标量统计量。我们推导了标准三参数单源 PSF
拟合中
条件均值的可观测量条件化理论——给定拟合源幅度、局部背景、位置依赖的 PSF
和检测掩模——并使用 Fisher 投影给出高信号方差的近似。管道统计量仅被处理为
的最终不完全伽马变换。 我们在 XMM-Newton PN band-4 独立
emldetect 链上验证了该框架。在跨越 17 个探测器位置和
次拟合的自洽参考拟合器模拟中,理论均值在高信号区间内与模拟均值匹配至
0.07
以内,Fisher 投影方差再现模拟方差至
以内。在操作阈值带(–10)内,渐近理论携带已知的低信号偏置,而独立
emldetect
引入了依赖于实现的残差。我们将两者吸收进一个经验的、位置依赖的残差校准中,得到在
处均值/中位数阈值拟合幅度校准,首选的 2D 插值具有 11%
的不确定度(最近校准位置回退为 17%),并已在留出探测器位置上验证,在
–
范围内具有弱的背景依赖性。 所得框架将
选择转换为拟合幅度与检测统计量之间的概率映射。它可后向使用——结合源计数先验解释传统
选定目录;亦可前向使用——构建拟合幅度阈值越界切割和百分位数灵敏度图;生产选择函数需要对散布和尾部模型进行额外验证。
Poisson
计数光子成像中的源探测通常通过在已知背景上拟合参数化源模型并以似然比统计量总结结果来完成。在标准
Cash 统计量表述 (Cash 1979)
下,自然的统计对象是 Cash 改进
,其中
与两倍负 Poisson 对数似然成正比。探测管道通常将
的单调变换报告为"检测似然";例如在 XMM-Newton
科学分析系统(SAS)中,emldetect (Cruddace 等 1988; Watson 等 2009) 对 Poisson
计数图像拟合三参数源模型(一个自由幅度和两个自由位置坐标),并报告
——底层
的不完全伽马变换。所报告的检测似然统计量在操作上非常重要:它被用于决定哪些源进入目录、定义检测阈值以及构建灵敏度图。
灵敏度图和源计数方法已在主要 X 射线巡天中得到广泛开发和应用 (Cappelluti 等 2009;
Georgakakis 等
2008; Laird 等
2009; Luo 等 2017,
e.g.,; Mateos 等
2008; Puccetti 等
2009; Wang 等 2016;
Xue 等
2011)。Poisson
源探测、极限和似然比方法的统计处理在高能天体物理学中也有悠久的历史 (Broos 等 2010, e.g.,; Gehrels 1986; Kashyap 等 2010; Kraft 等 1991; Protassov 等 2002; Starck 等
2002)。emldetect 工具一直是 XMM-Newton
偶然巡天目录的标准 (Carrera 等 2007; Rosen 等 2016; Traulsen 等 2019; Watson 等 2009; Webb 等 2020)。
我们在一开始就强调,本文中使用的 严格作为从 SAS 约定继承的操作单调阈值尺度。我们不将其解释为已校准的频率主义虚警概率。支撑不完全伽马变换的标准 零分布假设了内部正则性条件 (Chernoff 1954; Protassov 等 2002; Self & Liang 1987),这些条件在参数空间边界()处以及当位置参数在零假设下不可识别时被违反。更一般地,Cash 统计量本身的分布在低计数 Poisson 条件下偏离其高计数 极限 (Bonamente 2020)。因此我们对 – 转换的使用纯粹是操作性的:它将巡天分析者所选的检测阈值映射到对应的 值,在该处可观测量条件化理论适用。
实际的阈值区间是低信号区间。对于许多 XMM-Newton 应用,相关的灵敏度图范围是 量级为 6–10。这是源计数陡峭、Poisson 涨落重要、且检测阈值的微小变化即可改变推断极限通量的区间。因此这也是 Eddington 偏差变得重要的区间:随机向上涨落在检测边界附近被优先选择,使得所选样本不再代表未截断的母体分布 (Eddington 1913; Wang 2004)。
核心挑战不在于缺少可预测的均值。拟合源处的期望
长期以来已被解析计算,并在 X 射线灵敏度图构建中作为单一确定性值使用。在
SAS 本身内部,从 4.0 版起 esensmap 携带了
emldetect 风格的解析 Cash 统计量模型,遵循 3XMM 和 4XMM
目录管道的 emldetect
形式 (Rosen 等 2016; Traulsen 等
2019);在 SAS
之外,同样的期望在探测到的(而非注入的)源通量处求值,用于构建
New-ANGELS XMM 遗产巡天的灵敏度图 (Huang 等 2025,
appendix)。这些先前文献所未做的是将
视为来自非平凡采样分布的样本。
然而,分布矩是任何对 Eddington
偏差或通量极限精度的系统性处理最终必须纳入的输入。虽然本工作不构建完整的
Eddington 偏差核,但刻画
的条件均值和方差是必要的基础步骤。我们提供了解析骨架(
的条件均值和 Fisher
投影方差作为显式像素求和公式),将复杂的阈值校准问题简化为在探测器位置空间中插值一个缓慢变化的标量残差。理论本身在高信号区间内闭合;在
–10
的阈值带中,经验残差校准吸收了超出 Fisher 的偏置和独立
emldetect 的实现依赖偏移。然而,管道报告的检测似然统计量是
的非线性不完全伽马变换,因此不是高斯的;在检测阈值附近对所报告统计量进行截断会选择性截断一个非高斯分布,而这正是灵敏度图和源计数修正最容易受到
Eddington 偏差影响的区间。
本文围绕以下叙述组织。第 2 节建立可观测量条件化原则。第 3
节推导三参数
理论的显式像素求和公式。第 4
节通过自洽参考拟合器模拟验证理论,确认高信号闭合并刻画低信号偏置。第 5
节构建独立 emldetect 在阈值带中所需的经验残差校准。第 6
节描述校准
分布的两个目录应用:解释传统
选定目录和构建拟合幅度百分位数灵敏度图。第 7
节罗列已验证和未验证的领域。第 8 节总结结论。
中心统计对象是可观测量空间中 的条件期望,
其中
是拟合源幅度,
是以每像素计数为单位的局部背景,
是拟合模型所使用的像素化 PSF
模板,
是拟合所包含的图像区域。第 3 节对此期望进行解析推导;第 5
节将其转化为可操作的独立 emldetect 阈值校准,第 6
节将其转化为两个目录级用途:传统
选择的向后解释和拟合幅度阈值越界切割的向前构建。
在模拟中,注入的源强度
是已知的,能给出比
更清晰的诊断图,但它不是探测理论可用的条件变量:
在每个真实图像和每个 emldetect
源表中都不存在,在构建灵敏度图时也不可用。以
为条件的理论无法在不注入使用场景中并不存在的信息的情况下应用于真实探测或假源恢复测试。贯穿全文,
仅表示模拟生成标签,而
是条件变量。以
为条件的结果测试模型在已知注入通量下行为是否合理;以
为条件的结果测试它在探测拟合后是否可以使用。只有后者与独立
emldetect 灵敏度图工作相关。
对于每个源或假源试验,理论预测在观测到的拟合量处求值,
残差为
对于一个样本或 bin,
只有当 在 bin 内近似为常数时,观测到的 宽度才简化为 ;否则,混合 或混合位置样本会引入并非条件理论属性的视在方差效应。在 bin 中正确条件化后, 在完整 – 离轴范围内精确至 以内,具有轻微的低 高估且无可分辨的离轴依赖;相应的全局修正见第 4.3 节(公式 [eq:sigma-corr])。较早的单 分箱方式在每个 bin 内混合 ,增大了视在离轴散布,这是条件变量导致的人为效应,而非理论的属性。
是 的非线性单调尾概率变换,
对于单源三参数拟合, 且 。相应的逆变换为 其中 是正则化上不完全伽马函数, 表示对其第二参数求逆。因此 分别对应于 。 中的高斯残差因此在 中不是高斯的,而在观测 上进行选择就是对正在测量其分布的同一带噪量进行选择:它截断了残差分布并在阈值附近使其均值向上偏置。因此阈值范围被转换为 (使用三参数约定),并作为理论或预测 条件(如 $\mu_{3p,\rm ref}\in[\Delta C_\mathrm{ML6},\Delta C_\mathrm{ML10}]$)或其典型预测 落在该区间内的 bin 来应用。这使得条件化独立于 中观测到的随机涨落。
虽然底层统计框架(基于 Kullback–Leibler 散度的条件均值和 Wilks 定理 (Wilks 1938) 下 Cramér–Rao delta 方法的方差)是标准似然理论,但此处的新颖之处在于其在二维像素化 Poisson X 射线数据集上的具体求值。Fisher 矩阵结构与像素阵列点源测量的联合天体测量和测光 Cramér–Rao 分析密切相关 (Mendez 等 2014)。标准单源 PSF 拟合(一个自由幅度和两个自由位置坐标)下 的条件均值和近似方差在下面作为显式像素求和公式推导。
考虑一个包含以 索引像素的拟合区域。观测到的计数是独立的 Poisson 随机变量,
对于局部已知背景上的单个源,拟合源模型为
此处 是像素 中的背景期望, 是以图像模型使用的相同单位表示的源幅度, 是平移到位置 的像素化 PSF 模板。PSF 在完整模板网格上归一化,;掩模 则选择拟合 footprint。因此 表示模板约定中的总源幅度,而非拟合掩模所包围的计数。在当前 PN band-4 验证运行中, 通常是拟合区域内的常数 ,但该符号允许背景按像素变化。
二值拟合掩模 选择拟合中包含的像素;本文的主要结果使用二值掩模。对于分数权重存在加权掩模扩展,但当权重恰好为 0 或 1 时,加权公式退化为此处使用的二值掩模约定。
忽略与模型参数无关的常数后,Cash 统计量为
零模型是仅背景模型,。似然比 Cash 改进为
在此符号约定下,更好的源拟合给出正的 。在固定的拟合模型 处,该统计量可写为
可观测量条件化理论在拟合结果处求值矩
该拟合模型的 Asimov 图像 (Cowan 等 2011, 即观测计数恰好等于模型期望的期望数据集;) 为 。将其代入 Cash 改进中,得到条件均值
对于常数背景 和归一化 PSF ,这成为显式像素求和:
该均值通过完整像素求和依赖于像素化 PSF 和掩模。它不仅是高斯宽度或低阶 PSF 矩的函数,尽管这些总结量可作为有用的诊断。
写 ,公式 [eq:mu3p] 变为 ,即从背景到源加背景的逐像素 Poisson Kullback–Leibler 散度在拟合区域上的求和。这正是似然比的渐近非中心 分布的非中心参数 (Cowan 等 2011, Asimov 似然比;)。 的凸性保证 。
均值与下面推导的方差之间存在一个重要的不对称性。均值 是零阶 Asimov 量:它将期望计数 代入 Cash 改进,但不考虑拟合参数对 Poisson 涨落的吸收(位置优化的 look-elsewhere 效应)。方差 则通过第 3.6 节的 Fisher 投影已经包含了对该吸收的一阶修正。该不对称性是在低拟合信号处观测到的正超出 Fisher 偏置的根源(第 4.3 节):位置参数可以迁移以吸收局部 Poisson 向上涨落,使 超出 Asimov 预测。第 5.1 节引入的经验残差 将该效应吸收进操作校准。
最佳拟合参数满足 score 方程。对于任意拟合参数 ,
在拟合模型周围线性化,写为
一阶 score 约束为
共有三个这样的约束:
这些约束是三参数拟合不等同于简单无约束 Poisson 求和的原因。沿拟合幅度和位置方向的涨落被拟合吸收,在计算残差方差时必须被投影掉。
在固定的拟合模型处, 的一阶随机部分为
如果拟合参数不受 score 方程约束,则该线性残差的方差为
此项 作为诊断是有用的,但不是拟合似然比的最终方差公式。它忽略了 、 和 是为最大化似然而选择的事实。由于下面的 Fisher 投影减去一个半正定二次型, 是局部高斯近似内投影方差的上界。
定义三个拟合参数的 Fisher 信息矩阵:
对于 ,其各元素为
残差与 score 方向 之间的协方差由下式编码
具体而言,
在高斯/Fisher 近似下,以拟合 score 约束为条件会减去残差在拟合参数子空间上的投影。这是标准的多变量高斯条件方差恒等式,
其中 表示线性化 score 约束向量。所得方差为
投影 可通过 Fisher 矩阵的分块结构方便地计算。写 其中 包含 -位置交叉项, 是 和 的 位置块,投影变为 其中 。该分块形式使位置投影显式化,并在数值上便于处理大网格的 和 值。如果移除位置方向仅拟合 ,该公式退化为仅幅度单参数表达式。
方差表达式 是拟合模型周围的局部高斯/Fisher 近似。当似然表面接近二次型且拟合源足够强以至于位置优化不吸收孤立 Poisson 噪声特征时,该近似预期是准确的。正确 条件化的方差诊断,以及吸收残差赤字的全局低 修正,在第 4.3 节和图 [fig:deltac-scatter-variance] 中给出。这些 Fisher/Wilks 近似在 边界失效,并在低信号阈值带中变得不完整;因此剩余的阈值带残差在第 5 节中以经验方式处理。
参考拟合器并非旨在成为 SAS emldetect
的重新实现或替代品。相反,它提供了一个受控的匹配模型基线:模拟源、Poisson
似然拟合器和理论矩计算均使用相同的 psfgen PSF 模板、拟合
footprint
和似然约定。该构造分离了在独立管道比较中原本纠缠在一起的两个问题。第一,它测试当数据生成模型、拟合模型和理论匹配时,解析的可观测量条件化
均值和 Fisher 投影方差是否闭合。第二,通过将独立 emldetect
与该受控基线比较,我们可以将剩余差异识别为低信号渐近偏置和管道特定实现残差(优化器行为、PSF
采样、数值离散化和掩模约定)的组合。第 5 节中的经验
校准旨在在操作阈值带中吸收该残差。
参考验证使用 XMM-Newton PN band-4 配置的高统计量模拟,跨越 17 个探测器位置、8 个注入源强度、6 个背景水平和每个网格单元 1000 次实现。这产生 816,000 次模拟拟合;在要求优化器正常收敛和拟合幅度 后,保留 811,194 次拟合。
模拟使用 XMM-Newton SAS v20.0.0、标准 提取 footprint 和鲁棒的 Nelder–Mead 参考拟合器。参考拟合器验证中不排除任何探测器位置。第 5 节的独立校准网格排除了一个受边缘影响的校准位置,其局部 PSF 几何违反了经验残差模型所用的稳态背景假设。对于独立比较,经验统计量直接从目录 列中提取,并使用 以 转换。
每个模拟源均使用三参数 Poisson 似然拟合器拟合。对于每一行,理论在拟合源强度处求值:
诊断残差为
这是一个可观测量条件化验证,因为预测使用拟合幅度 ,而非注入幅度 。
图 [fig:deltac-scatter-variance] 是自洽参考拟合器理论的核心验证诊断。它在一处展示了本文解析部分所依赖的三个经验事实:均值趋势被可观测量条件化像素求和理论所捕获,剩余低信号偏置是光滑的,Fisher 投影方差给出了正确的高信号尺度。该图使用三个代表性离轴环(行)和五个背景 (颜色)。左列显示单个 值随 的变化,叠加理论条件均值 ; 分层结构规则且单调。中列比较 bin 化模拟均值与 :渐近理论在高 处准确,但携带正的低 超出 Fisher 偏置,该偏置由一个全局双参数修正消除。右列显示残差散布 的相同分解:Fisher 投影 在低 处略微高估模拟散布,该赤字由同类型的全局修正消除。虚线是公式 ([eq:mean-corr])–([eq:sigma-corr]) 的单一闭式表达式,在三个离轴环上相同地应用。修正仅依赖于 :离轴项在统计上可忽略(第 4.4 节),因此残差结构由拟合信号和背景而非离轴角支配。

表 [tab:ref-fitter-validation] 总结了各拟合信号范围的验证。在高信号处(),标准化残差有 和 ,确认理论闭合。更强的 子集更接近零均值和单位宽度,正如高信号区间内 Fisher/高斯近似的预期。在低拟合信号处出现正偏置:位置优化可吸收正 Poisson 噪声特征,似然表面较难被局部二次展开近似。该超出 Fisher 偏置不是网格人为产物;它是高斯/Fisher 近似在低拟合信号处的局限。
各拟合信号范围的参考拟合器验证( 次拟合,17 个探测器位置)。
lrrr 拟合信号范围 &
&
&
拟合信号范围
&
&
&
& 137,517 &
& 0.858
& 192,750 &
& 0.884
& 214,090 &
& 0.933
& 266,837 &
& 0.977
上述低信号偏置可用紧凑的闭式形式描述。在可观测量空间中按
对参考拟合器输出分箱(使用
约束低信号端),跨全部 17 个位置和 6
个背景,均值残差和残差散射比各自可由单一
表达式很好描述。这些全局表达式从经验上支持以下解释:超出 Fisher 的残差是
的光滑、低维函数,无显著离轴依赖(第 4.4
节)。该光滑性激发了第 5
节中部署的经验网格插值策略:如果残差是混乱或高维的,稀疏网格插值将失败。然而,这些具体的闭式全局修正严格保持诊断性质,不直接用于最终操作校准。独立
emldetect 校准将所有低信号偏置和实现特定效应完全吸收到经验
网格中。
这些修正的经验性状态本身是一个受约束的结果,而非仅仅是建模便利。两个直接验证测试(将在别处呈现)界定了更简单的替代方案。第一,对 在幅度 score 上做二阶展开(在无拟合系数下求值),无法再现公式 ([eq:mean-corr])–([eq:sigma-corr]) 中的五个系数:其均值贡献近似为常数位置秩增益,而非观测到的 衰减;其方差项也不产生经验的 散射赤字。这将低信号残差置于局部二次或 Bartlett 型展开之外,与参考拟合器分解中分离出的位置 argmax 机制一致。第二,一个跨 PSF 可迁移性测试使用高斯 像素、宽高斯 像素和 King 像素、 的玩具配置(具有相同 掩模),表明修正系数是 PSF 族特定的:高斯玩具均值律与 XMM-psfgen 模板生产律在最精确的低 bin 中以高显著性差异,且无论 还是 都不能跨 PSF 族归并均值系数。因此,低信号修正必须按 PSF 模板族校准。在本文使用的 XMM psfgen 模板族内,下面展示的 17 位置离轴稳定性恰是已验证的操作域。
该 PSF 族视角的两个进一步后果值得在此记录,它们建立在一项覆盖全部三台
EPIC 相机和两个能段、通过单一模板流水线准备的真实 psfgen
模板的先导研究中。第一,一旦模板准备统一化,修正的逐仪器、逐能段结构便消失:五个系数简化为无标签形式,其中三个是共享常数,两个是标量
PSF 特征(有效 PSF
面积和峰值像素占比)的光滑单变量函数,模型中不再保留任何仪器或能段标识。该简化无标签修正律的完整呈现推迟到后续论文。第二,直接关系到本文中任何修正的应用:修正系数的绝对值依赖于
PSF
模板准备约定(高分辨率采样、重分箱、裁剪和归一化选择)。因此校准和部署必须使用同一模板流水线;在一个准备约定下校准的系数不得与在另一约定下准备的模板组合使用。
条件均值被加法性修正,
其中 ,,(不确定性来自位置级 bootstrap,见下文),残差散射被乘法性修正,
其中 ,。散射修正具有 低信号赤字形式,在渐近极限下消失,在高拟合信号处返回 Fisher 投影方差。公式 ([eq:sigma-corr]) 将经验-理论 比的 bin 级散射从 (未修正)降低到 ,残差与每 bin 散射估计的 Monte Carlo 不确定性一致。在最高背景()和最低拟合信号处仍有轻微残差,其中经验赤字在 上比全局形式更平坦;该区间远低于 检测阈值,不影响已验证的操作范围。
公式 ([eq:mean-corr])–([eq:sigma-corr]) 中的两个修正仅依赖于拟合幅度和背景。在散射模型中加入线性离轴项 基本不改变拟合质量( 每角分;均方根残差在三位小数内不变),且经验 比在完整 – 离轴范围内平坦在 –。因此明显的"远轴"方差偏移并非离轴效应:它是公式 ([eq:sigma-corr]) 的低 赤字,在离轴环中更明显地显现,因为那些位置采样了更大比例的低 拟合。单一 修正即可适用于已验证域中的所有探测器位置。 该族内稳定性与上述跨族依赖形成对比,划定了公式 ([eq:mean-corr])–([eq:sigma-corr]) 的有效性边界。
系数在用于拟合的探测器位置数目变化下保持稳定。位置级 bootstrap(对 17 个位置有放回重采样,400 次实现)恢复了上文引用的中心值,并为公式 ([eq:mean-corr])–([eq:sigma-corr]) 给出的不确定性提供依据。对固定大小 的随机位置子集重采样使中心系数在散射内保持不变,散布按 收缩,表明这些位置独立采样修正且无系统性离轴趋势。
所关注的灵敏度图区间是 约 6–10,对应于 –。对于当前 PN band-4 且 的设置,这大致对应于 –。这严格低于 的高信号验证范围。因此我们明确声明:第 4.2 节的高信号渐近闭合并不直接在操作应用的阈值带中验证该理论。 在该低信号区间,阈值带残差 通过纯经验插值处理。
物理上,
来源于三个方面:(i)
理论本身在
边界附近的超出 Fisher 偏置,其中非负性约束违反了 Wilks
定理的内部点假设;(ii) 独立 emldetect
的实现特定伪影,包括其内部优化器、PSF 采样和数值离散化细节;以及 (iii)
理论中使用的
拟合 footprint 与管道实际应用的掩模之间的差异。虽然
原则上是
的函数,但它在窄阈值带(–)中变化足够缓慢,因此可鲁棒地近似为每位置标量偏移。
同种子配对的参考拟合器和独立 emldetect 实验表明,独立
几乎完美跟踪参考拟合器(相关性
0.996),具有小的仿射偏移和随离轴角增长的实现抖动;这支持将参考理论到独立管道的转移视为经验实现层,而非可观测量条件化形式本身的改变。
标准的 Monte Carlo 假源注入方法(例如 esensmap
模拟模式)将自动捕获所有这些效应:只需在每个天空位置和背景水平注入源,运行完整管道,以数值方式列表化检测分数。该方法因不作理论近似而提供卓越的绝对精度。然而,对于巡天规模灵敏度图中遇到的完整背景、离轴角和
PSF 几何范围上的连续天空映射,它在计算上是不可承受的。
大型现代巡天因此通常依赖广泛的端到端模拟来刻画完备性、纯度和选择阈值,如
eROSITA eFEDS 源探测校准 (Brunner 等 2022;
Liu 等
2022) 即是如此。
第 3 节理论的科学价值在于,它提供了可观测量条件化 期望的正确函数形式,因为背景、PSF 几何和掩模在探测器上连续变化。通过将计算锚定到确定性理论均值 ,操作校准只需在稀疏网格上经验地确定缓慢变化的标量残差 。该混合方法(解析骨架加经验残差校准)牺牲了完整 Monte Carlo 的绝对精度(产生第 5 节报告的 11–17% 恢复误差),但避免了在每个天空位置上密集假源注入的极端计算成本。该操作校准是第 5 节的主题。
emldetect 阈值校准第 4 节已建立可观测量条件化
理论在数据生成模型、拟合模型和理论匹配时闭合(解析骨架的参考拟合器单元测试)。独立
SAS emldetect 引入其自身的源拟合、优化器和
PSF/模型约定;这些实现细节产生了相对于参考理论的位置依赖残差。参考拟合器闭合与独立管道结果之间的差异是下面经验校准的目标。
一个吸收该偏移的经验性、位置依赖残差校准针对阈值区间
–10
构建,适用于独立假源灵敏度图工作。
原始理论预测
如果独立 emldetect 恰好匹配同一模型,则阈值极限可从
求得。实践中,该未校准理论基线在阈值带中仅是临界近似。在验证中,其在
处
最大误差为 19.9%,在
处为 15.6%,在
处为 13.3%。该误差是位置依赖的,而非单一标量偏移。
图 [fig:emldetect-scatter-variance]
是操作独立 emldetect 链的核心诊断。它有意与图 [fig:deltac-scatter-variance]
平行:相同的可观测量条件化结构仍然可见,但独立管道引入了相对于参考拟合器理论的位置依赖残差。这是最终校准不是原始解析方程、而是解析方程加经验
校准的视觉原因。

因此我们定义独立 emldetect 残差
此处
是以单幅图像
约定转换的独立 emldetect Cash
改进,
是拟合的 emldetect 源幅度。校准后的阈值方程为
符号直接来自于残差定义。如果
,独立
emldetect 在相同拟合源强度下产生比原始理论更大的
,因此灵敏度极限所需的理论阈值较低。如果
,所需源幅度较高。
校准使用配对假源模拟,其中每个实现均由参考拟合器和独立 SAS
emldetect 分析。当前校准网格在排除受边缘影响的情况后有 14
个 PN band-4 校准位置。目标阈值带在
空间中使用公式 ([eq:detml-inverse])
的阈值转换定义。行由参考理论预测选择:
这很重要:阈值样本不是通过观测
或观测
选择的,因为这些量携带我们试图校准的随机涨落和实现残差。选择基于可观测量条件化理论中的预测/参考
。基线校准网格在
处构建;向
和
的背景转移包含在下文的不确定度预算中。
残差 在每个探测器位置从阈值带模拟样本估计。比较两种插值方案:在采用的空间坐标(离轴角和扇区编码校准坐标)上对校准网格的双线性插值,以及最近校准位置分配。校准坐标是具有 0、90、180、270 度四个象限编码的扇区编码方位标签;它是概念验证操作坐标,而非物理探测器方位角。未来生产校准应改为将 建模为物理动机预测因子的函数,如局部 PSF 二阶矩 、有效 PSF 翼部参数 、离轴角和探测器边缘距离,而非分类扇区编码。当前扇区坐标对当前 14 位置网格足够,因为 在窄阈值带中变化足够缓慢,插值误差由网格稀疏性而非坐标选择主导。
验证使用留一位置交叉验证:每个位置被留出,校准从剩余位置构建,预测 与留出位置的内部校准参考极限比较。该留出参考极限 使用贯穿第 4 节的同一参考拟合器定义:对于每个模拟源强度,计算重复间的中位数 ,对中位数 随源强度曲线拟合光滑插值样条, 定义为样条跨越 的精确根。留出位置的任何信息都不允许泄漏到 插值模型中,确保严格的样本外预测测试。我们强调该交叉验证测试校准在校准网格上自洽插值管道自身阈值映射的能力;它不是对独立观测数据或注入-恢复检测分数的绝对天体物理验证。此类绝对验证,例如将预测 与在代表性位置密集假源注入的注入-恢复 50% 完备性通量比较,是生产使用的必要未来步骤。报告的误差为
表 [tab:unified-validation] 将参考拟合器闭合、交叉验证 精度和背景转移误差汇总为单一总结。在 处,首选双线性插值给出中位数误差 4.1%,校准包络内位置(14 个留出位置中的 10 个)最大误差 11.0%;最近校准位置分配覆盖全部 14 个位置,最大误差 17.2%。从 向 – 范围的背景转移在 处给 最多增加 5.7% 误差。两误差在更高阈值处减小。
lccc
参考拟合器闭合():
&
&
&
参考拟合器闭合():
& 0.98 & 0.98 & 0.98
校准
:中位数误差(包络内)
& 4.1% & 3.1% & 2.6%
校准
:最大误差(包络内)
& 11.0% & 9.1% & 7.8%
校准
:最大误差(全部位置)
& 17.2% & 12.7% & 10.1%
背景转移最大(–)
& 5.7% & 4.1% & 3.2%
未校准理论在 处 最大误差为 19.9%(中位数 7.2%),使其在最严格阈值处仅是临界独立近似。全局标量修正在 处失败(最大误差 21.6%),确认残差是位置依赖的。校准包络内的双线性插值是首选方法;包络外,最近校准位置分配提供已验证的全位置回退。
前几节校准了 空间中似然比统计量的行为。校准后的分布有两个目录级用途。第一个是传统 选定目录的解释性用途:目录仍可由观测阈值 定义,但前向分布提供了推断相应拟合源幅度分布所需的似然。第二个用途是建设性的:可直接在拟合幅度坐标中定义目录切割,通过要求局部 分布的选定百分位数达到检测阈值。两种用途依赖同一前向核,但使用方向相反(表 [tab:two-catalog-uses])。
此处 表示可观测量条件化理论使用的源幅度坐标,与贯穿本文的拟合幅度约定一致。它不是内在注入通量。
图 1 给出构造的可视化版本。传统 阈值是 空间中的水平切割。从该切割向后读取条件分布给出传统阈值选定目录的拟合幅度分布——一旦指定了源计数先验。向前读取则给出百分位数越界:通常的灵敏度图是均值越界,而较低百分位数越界定义了更保守的拟合幅度阈值越界切割。
emldetect 应用额外包含第 5
节描述的管道残差校准。lll
传统目录 & 后向:
&
所需
拟合幅度切割 & 前向:
& 不需要
对于每个探测器位置,操作的 阈值首先转换为对应的单幅图像三参数 阈值。例如, 在 约定下对应于 。分布计算随后在 空间中进行; 仍仅为最终操作阈值尺度。
在校准的独立 emldetect 情形中,前向核的均值为
其中 是从第 5 节校准网格插值的经验残差。在高斯残差近似下,局部核总结为
对应的 百分位数曲线为
其中 是标准正态分位数。百分位数构造除校准均值残差外,还需要 空间中校准的阈值带散布模型 。因此 ,,,。
在本概念验证应用中,我们使用第 4
节中经验修正后的散布模型作为分布骨架。Fisher
投影方差提供了解析尺度,但完整核或低百分位数图的生产使用需要直接对照独立
emldetect
通过分数验证,因为高信号参考拟合器闭合本身并不验证
–10
阈值带。
第一个应用保留传统目录定义。源由观测检测统计量选定,例如 ,等价地 。新的要素是目录阈值现在可通过公式 ([eq:deltac-forward-kernel]) 中的前向核来解释。
对于具有测量值 的源,目录空间中的拟合幅度后验为
其中 是以拟合幅度坐标表示的源计数先验。对于阈值选定样本,类似表达式为
其中
在高斯残差近似下,该通过概率是在 空间中求值的正态生存函数。该路径不取代传统 阈值。相反,它补充了解释 选定目录拟合幅度分布所需的缺失似然层。这也是 Eddington 偏差进入之处:带噪阈值统计量必须与源计数先验结合,特别是当底层 陡峭时 (Eddington 1913; Georgakakis 等 2008; Wang 2004)。因此指定的 值或阈值本身并不定义通量分布;它在 空间中定义一个似然因子。要获得 或 ,必须将该似然与源计数先验结合,例如以拟合幅度坐标表示的幂律 斜率或指数。因为这是反问题,它必然依赖于种群先验。如果所需先验是内在 而非拟合目录幅度先验,则需要额外的连接 与拟合幅度 的测量模型。
因此相应的天覆盖是概率性的,而非来自单一极限幅度的阶跃函数面积。在给定像素 处,检测到拟合幅度 的源具有目录空间密度
在拟合幅度坐标上的归一化常数范围内。因此传统阈值目录在每个像素处为检测到的幅度分配概率,而非单一确定性极限幅度。在拟合幅度 处的相应有效面积为
其中 索引天或探测器像素。如果目标是区间 内检测到的拟合幅度的期望数量,则同一概率加权面积与源计数先验结合,
这就是应用 I 的天覆盖遵循检测到的拟合幅度概率分布的意义所在,而下面的百分位数切割构造则从选定的拟合幅度阈值越界概率出发。
第二个应用在前向使用同一核。不是从带噪 选定样本出发询问其包含的拟合幅度,而是询问在指定比例的实现中超过检测阈值所需的拟合幅度。该地图构建步骤固定 并求值 ,因此不需要 斜率或源计数指数。
通常的灵敏度图计算作为均值曲线交叉恢复为
在对称高斯残差近似下,这也是第 50 百分位数阈值越界点。我们避免将其称为经验 50% 完备性通量,因为注入-恢复完备性通常以注入通量坐标中的 定义。
更保守的拟合幅度切割通过以更低百分位数曲线求解阈值方程获得,
其中 。方向很重要。要求给定拟合幅度处 90% 的实现超过阈值使用的是低 10 百分位数,而非高 90 百分位数:
类似地,在高斯近似下使用 下包络对应于约 97.7% 的阈值越界判据。表 [tab:threshold-crossing-terms] 总结了本文使用的术语。
lll
均值极限 &
& 标准 Asimov 图
50% 阈值越界 &
& 高斯下均值交叉
90% 阈值越界 &
& 90% 预期通过
注入 50% 完备性 &
& 假源恢复
将同一越界规则应用于每个探测器像素产生一族拟合幅度灵敏度图:均值阈值图、来自低 16 百分位数的 84% 阈值越界图、来自低 10 百分位数的 90% 阈值越界图,等等。每张图可通过计数局部极限幅度低于试验拟合幅度的天面积转换为阈值越界天覆盖曲线,
其中 索引天或探测器像素, 表示公式 ([eq:percentile-threshold-crossing]) 中使用的百分位数曲线。该阈值越界天覆盖计算是与可观测量条件化理论使用的拟合幅度坐标相同的仪器、目录空间量:它依赖于局部背景、PSF、掩模、阈值和残差校准,但不需要假设的 斜率。源计数模型仅在后续种群推断中需要。
两种应用来自同一条件分布 ,但回答不同的问题。应用 I 是后向的:它从观测 值或 选定目录出发推断拟合幅度分布。这是 Eddington 偏差建模的自然设定,因为检测阈值附近的不对称性是由带噪阈值统计量与陡峭源计数先验结合产生的。
应用 II 是前向的:它从拟合幅度出发询问越过 阈值的概率。这并不从光度函数推断中消除种群层面的 Eddington 偏差,但允许构造一个具有明确说明的阈值越界概率的仪器目录空间子样本。在这个意义上,百分位数灵敏度图是目录构造工具,而阈值选定后验是目录解释工具。
第 5 节的交叉验证验证了均值/中位数阈值拟合幅度映射:在
处,首选双线性插值在校准包络内达到最大误差
11.0%,而最近校准位置回退在所有留出位置达到
17.2%。上述两种应用需要在此均值交叉测试之外进行额外验证。对于应用 I,似然核应根据留出模拟中独立
emldetect
值的观测分布进行测试。对于应用 II,散布和尾部模型应通过比较预测的阈值越界概率与经验检测分数来验证,例如在预测概率
0.5、0.7 和 0.9
附近分箱。经验通过分数与预测概率的一致性是将低百分位数图用作目录阈值越界灵敏度切割的必要验证。
因此,此处提出的应用是一个快速的、分布式的、面向目录的框架,用于阈值解释和拟合幅度阈值越界灵敏度。完整的注入-恢复模拟仍然是复杂巡天场生产选择函数的绝对验证标准。
校准网格、交叉验证表、图形生成脚本、配置文件以及重现关键验证结果的最小脚本将在发表时通过持久 Zenodo 档案提供。
所提出的框架聚焦于方法论进展:条件均值公式、Fisher 投影方差和可观测量条件化原理以代数方式转移到任何采用标准三参数拟合的 Poisson PSF 拟合源探测管道;然而,定量使用需要管道特定的重新校准。此外,定量校准(具体为位置依赖残差网格、留一交叉验证误差预算和阈值越界拟合幅度映射)已通过 XMM-Newton PN band-4 设定中的单幅图像假源模拟进行了专门验证。将此方法应用于不同仪器、能段或探测管道将需要重新推导管道特定的似然变换并使用匹配的假源网格对实现残差进行完整重新校准。
虽然自洽参考拟合器在高信号区间()确认了理论模型结构,但这些结果不能盲目外推到阈值带(–10)。在较低拟合信号处(),参考拟合器表现出正的超出 Fisher 偏置。独立校准将此偏差连同其他算法效应吸收到经验 残差中,为局部 和 分布提供操作预测。
此外,我们强调我们的经验校准并非对官方 XMM-Newton 偶然源目录(例如 4XMM)的全面修正。目录环境涉及诸如复杂背景图变化、多观测叠加、渐晕加权和源混淆效应等复杂性,这些在我们的单幅图像独立模拟中未被完全捕获。 其他当前 X 射线目录管道以实质上不同的机制处理相关复杂问题,例如 eROSITA eSASS/eFEDS 模拟校准探测链 (Brunner 等 2022; Liu 等 2022),以及具有合并观测、局部 PSF 建模和贝叶斯孔径测光的 Chandra Source Catalog Release 2 系列 (Evans 等 2024)。这些例子强化了此处开发的残差校准是管道特定的。
关于空间插值,校准包络内的双线性插值提供最小误差,而最近校准位置分配提供已验证的全位置回退。所采用的扇区坐标是校准坐标而非物理探测器方位角。校准保持弱的背景依赖性;将 校准转移到 背景水平在推断灵敏度极限中引入高达 5.7% 的误差,表明应避免在未重新校准的情况下外推到实质上不同的背景。
如果没有 校准网格可用,未校准理论可用作近似估计,在 处 最大误差为 19.9%。这是回退,而非推荐的校准方法。 如果目标设置与已验证域不同,校准应被视为未验证。示例包括:MOS 仪器;合并图像或多图像拟合;具有不同自由度数的固定位置拟合;测试范围 – 之外的背景;与校准网格不匹配的 PSF 或掩模约定;或官方 4XMM 目录产品。
最后,第 6 节区分了同一前向核的两种用途。传统 选定目录的后向解释是种群推断问题,需要源计数先验。前向拟合幅度百分位数图在地图构建阶段不需要此类先验,但源计数和 Eddington 偏差修正仍需要假设或拟合的源通量分布,以及在需要时连接内在通量与拟合通量的测量模型。
Cash 统计量在拟合源处的条件均值改进,
在 SAS 单幅图像约定(,;,因此 对应于 )下,针对标准三参数(一个幅度、两个位置)单源 PSF 拟合以闭式形式推导。将 视为采样分布而非单一确定性值是本框架与先前解析均值灵敏度图文献的区别所在。
跨越 17 个 PN band-4
探测器位置(
次拟合)的自洽 psfgen
模板参考拟合器模拟在高信号区间()将预测均值闭合到
0.07
以内,将 Fisher 投影方差闭合到
以内。阈值带
–10
处于较低拟合信号(在
处大约
–),其中渐近低信号偏置和独立
SAS emldetect 的实现依赖残差需要经验的、位置依赖残差校准
。已验证的均值/第
50 百分位数越界方程
在 PN band-4 校准网格上 处以 11%(首选双线性插值,14 个包络内留出位置中的 10 个)和 17%(最近校准位置回退,全部 14 个位置)的精度重现留出参考极限幅度,在 – 范围内具有弱背景依赖性(最大测试转移误差 5.7%)。所采用的扇区坐标是校准坐标,而非物理探测器方位角。
对于目录工作,校准核可在两个方向使用。后向,它提供似然因子如 或 ,用于结合源计数先验解释传统 选定目录。前向,它给出局部拟合幅度阈值越界概率 。例如,90% 阈值越界拟合幅度极限是预测 分布的第 10 百分位数等于检测阈值的源幅度。作为拟合幅度函数的天面积随后通过计数满足所选阈值越界条件的探测器像素得到。
方法论核心独立于 XMM-Newton:三参数 Poisson PSF
源拟合的可观测量条件化
理论,以及
残差空间而非管道报告检测统计量空间的阈值校准。扩展到其他 Poisson PSF
拟合源探测管道是自然的后续工作;上述 XMM-Newton emldetect
结果是本框架内的首次具体验证和校准应用。
校准网格、交叉验证表、图形生成脚本、SAS
配置文件以及重现关键验证结果的最小脚本(包括精确命令、随机种子、psfgen
参数和 emldetect 调用标志)已存入 Zenodo
档案。私有审稿链接可用;最终 DOI 将在接受后插入。
校准网格以机器可读表格提供。代码在开源许可下发布。
图 2 是对条件变量的诊断检查。模拟知道注入的源强度 ,但理论和操作校准以拟合幅度 为条件。在固定的检测 处,来自不同 子集的标准化残差分布紧密重叠。最低 bin 中的残差偏移是第 4.2 节讨论的同一低信号超出 Fisher 偏置,而非以 为条件的证据。
我们感谢国家自然科学基金的支持。本研究使用了从 XMM-Newton 卫星获得的数据,XMM-Newton 是一项 ESA 科学任务,其仪器和贡献由 ESA 成员国和 NASA 直接资助。