<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>增量抽取 - tag - 沐木</title><link>https://oldletter.cn/tags/%E5%A2%9E%E9%87%8F%E6%8A%BD%E5%8F%96/</link><description>增量抽取 - tag - 沐木</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><lastBuildDate>Sun, 19 Jul 2026 01:00:00 +0800</lastBuildDate><atom:link href="https://oldletter.cn/tags/%E5%A2%9E%E9%87%8F%E6%8A%BD%E5%8F%96/" rel="self" type="application/rss+xml"/><item><title>千万级数据同步与 ETL 实战（一）：边界、降级策略与整体架构</title><link>https://oldletter.cn/posts/data-sync-etl-01-boundaries-and-architecture/</link><pubDate>Sun, 19 Jul 2026 01:00:00 +0800</pubDate><author>mumu</author><guid>https://oldletter.cn/posts/data-sync-etl-01-boundaries-and-architecture/</guid><description><![CDATA[<blockquote>
<p>系列导航：<a href="/posts/data-sync-etl-01-boundaries-and-architecture/" rel="">1</a> | <a href="/posts/data-sync-etl-02-snapshot-watermark/" rel="">2</a> | <a href="/posts/data-sync-etl-03-hash-wheel-fingerprint/" rel="">3</a> | <a href="/posts/data-sync-etl-04-micro-batch-correctness/" rel="">4</a> | <a href="/posts/data-sync-etl-05-merkle-iblt/" rel="">5</a> | <a href="/posts/data-sync-etl-06-true-streaming/" rel="">6</a></p></blockquote>
<p>数据同步项目开工时，团队常先讨论 Kafka、Flink 或 Debezium。这个顺序容易忽略一个基础问题：源系统究竟能提供什么。很多企业数据源只有只读账号、分页接口或定期投递的文件。数据库日志权限拿不到，表里也未必有可靠的更新时间。此时直接套用 CDC 架构，实施阶段会在权限、版本、网络和运维能力上不断返工。</p>
<p>本文先给系统划定边界。目标数据集以单表或单集合不超过 1000 万行为基准，变更速率不高，业务接受几十秒到数小时的延迟。系统需要发现新增、修改和删除，支持断点恢复，并限制对源库的影响。每秒数十万事件、复杂事件时间计算、强实时交易链路不在这套微批架构的处理范围内，第六篇会单独讨论真正的流式系统。</p>
<h2 id="一先盘点数据源能力">一、先盘点数据源能力</h2>
<p>同一个“查询数据”接口，能提供的增量能力差别很大。建任务前要探测并固化以下信息：</p>
<table>
  <thead>
      <tr>
          <th>能力</th>
          <th>需要确认的内容</th>
          <th>缺失后的影响</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>变更日志</td>
          <td>Binlog、WAL、LSN、SCN、日志保留时间</td>
          <td>无法按日志位置持续消费</td>
      </tr>
      <tr>
          <td>版本字段</td>
          <td>单调版本号、精度、是否覆盖删除</td>
          <td>只能依赖时间或扫描</td>
      </tr>
      <tr>
          <td>更新时间</td>
          <td>是否有索引、是否随每次修改更新</td>
          <td>历史回改可能漏读</td>
      </tr>
      <tr>
          <td>稳定键</td>
          <td>单主键、复合业务键、键是否会变化</td>
          <td>无法可靠识别同一条记录</td>
      </tr>
      <tr>
          <td>一致性快照</td>
          <td>隔离级别、快照时长、日志衔接点</td>
          <td>首次全量与增量可能断层</td>
      </tr>
      <tr>
          <td>分页方式</td>
          <td>游标、Keyset、页码、排序稳定性</td>
          <td>并发写入时可能漏读或重复</td>
      </tr>
      <tr>
          <td>删除信息</td>
          <td>删除日志、软删字段、墓碑记录</td>
          <td>需要周期扫描才能识别删除</td>
      </tr>
      <tr>
          <td>源端改造</td>
          <td>能否加索引、生成列、触发器</td>
          <td>分桶扫描可能退化成全表计算</td>
      </tr>
  </tbody>
</table>
<p>能力探测结果进入数据集版本，不能只留在部署人员的经验里。任务发布后如果主键、时区或更新时间精度发生变化，旧 Checkpoint 可能失效。调度器需要暂停任务，完成迁移验证后再恢复。</p>
<p>建议把增量策略设计成一条降级链：</p>
<div class="mermaid" id="id-4" data-mermaid-definition="Zmxvd2NoYXJ0IExSCiAgICBBWyLor7vlj5bmupDnq6/og73lipsiXSAtLT4gQnsi5Y&#43;v5raI6LS55Y&#43;Y5pu05pel5b&#43;XIn0KICAgIEIgLS0&#43;fOaYr3wgQ1siQ0RDIC8g5pel5b&#43;X5aKe6YePIl0KICAgIEIgLS0&#43;fOWQpnwgRHsi5pyJ54mI5pys5Y&#43;35oiW5pu05paw5pe26Ze0In0KICAgIEQgLS0&#43;fOaYr3wgRVsiVmVyc2lvbiAvIFdhdGVybWFyayJdCiAgICBEIC0tPnzlkKZ8IEZ7IuaVsOaNruWPqui/veWKoCJ9CiAgICBGIC0tPnzmmK98IEdbIuiHquWinumUruWinumHjyJdCiAgICBGIC0tPnzlkKZ8IEhbIkhhc2ggV2hlZWwg5YiG5qG25omr5o&#43;PIl0KICAgIEggLS0&#43;IElbIuWFqOmHj&#43;aMh&#43;e6ueagoemqjOWFnOW6lSJd">flowchart LR
    A[&#34;读取源端能力&#34;] --&gt; B{&#34;可消费变更日志&#34;}
    B --&gt;|是| C[&#34;CDC / 日志增量&#34;]
    B --&gt;|否| D{&#34;有版本号或更新时间&#34;}
    D --&gt;|是| E[&#34;Version / Watermark&#34;]
    D --&gt;|否| F{&#34;数据只追加&#34;}
    F --&gt;|是| G[&#34;自增键增量&#34;]
    F --&gt;|否| H[&#34;Hash Wheel 分桶扫描&#34;]
    H --&gt; I[&#34;全量指纹校验兜底&#34;]</div><p>降级需要记录原因。例如数据库支持 Binlog，但账号缺少复制权限，任务可以暂时使用 Watermark，同时持续告警“当前链路无法直接识别物理删除”。若系统只把模式保存为一个枚举，维护人员看不到能力缺口，也无法判断将权限补齐后能获得什么收益。</p>]]></description></item><item><title>千万级数据同步与 ETL 实战（三）：Hash Wheel、行指纹与删除识别</title><link>https://oldletter.cn/posts/data-sync-etl-03-hash-wheel-fingerprint/</link><pubDate>Sun, 19 Jul 2026 01:00:00 +0800</pubDate><author>mumu</author><guid>https://oldletter.cn/posts/data-sync-etl-03-hash-wheel-fingerprint/</guid><description><![CDATA[<blockquote>
<p>系列导航：<a href="/posts/data-sync-etl-01-boundaries-and-architecture/" rel="">1</a> | <a href="/posts/data-sync-etl-02-snapshot-watermark/" rel="">2</a> | <a href="/posts/data-sync-etl-03-hash-wheel-fingerprint/" rel="">3</a> | <a href="/posts/data-sync-etl-04-micro-batch-correctness/" rel="">4</a> | <a href="/posts/data-sync-etl-05-merkle-iblt/" rel="">5</a> | <a href="/posts/data-sync-etl-06-true-streaming/" rel="">6</a></p></blockquote>
<p>有些源表只有主键和业务字段，没有更新时间、行版本、删除标记，也拿不到数据库日志。要发现历史记录被修改或删除，完整周期仍需检查全部记录。工程上的问题变成：怎样把一次重扫描拆开，怎样保证同一条记录总落到同一个分区，怎样避免读取中断造成误删除，以及怎样把目标写入量限制在真实变化量附近。</p>
<p>Hash Wheel 负责把全表检查平摊到时间轴，Fingerprint Index 保存上一次看到的状态，Generation 在完整扫描后识别删除。这三个组件必须共同工作。只实现“主键取模加定时查询”，无法形成可恢复的变化检测链路。</p>
<h2 id="一身份键和内容指纹分开">一、身份键和内容指纹分开</h2>
<p>每条记录先抽象为二元组：</p>
<p>$$
Entry=(IdentityKey, RowFingerprint)
$$</p>
<p><code>IdentityKey</code> 由稳定主键或业务键得到，用于确认记录身份。<code>RowFingerprint</code> 由参与同步的字段计算，用于判断内容变化。两者的判断关系如下：</p>
<table>
  <thead>
      <tr>
          <th>旧状态</th>
          <th>本轮状态</th>
          <th>结果</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>不存在</td>
          <td>存在</td>
          <td>INSERT</td>
      </tr>
      <tr>
          <td>存在</td>
          <td>指纹不同</td>
          <td>UPDATE</td>
      </tr>
      <tr>
          <td>存在</td>
          <td>指纹相同</td>
          <td>NO_CHANGE</td>
      </tr>
      <tr>
          <td>存在</td>
          <td>完整扫描后未见</td>
          <td>DELETE</td>
      </tr>
  </tbody>
</table>
<p>业务键允许修改时，它不再是稳定身份。系统只能把键变更表达成旧键删除和新键新增，除非源端另有不可变 ID 或变更日志能够关联前后值。这个限制需要进入数据集契约。</p>
<p>身份键可直接保存原主键，也可以保存带命名空间的摘要：</p>
<p>$$
IdentityKey=H(datasetId \parallel canonical(primaryKey))
$$</p>
<p>跨数据集使用同一主键时，<code>datasetId</code> 防止状态键冲突。原主键是否保留取决于审计和回查需求；只有摘要会增加碰撞处理与问题定位成本。</p>
<h2 id="二hash-前先定义-canonicalization">二、Hash 前先定义 Canonicalization</h2>
<p>指纹错误通常源于编码规则，而非 Hash 函数。以下值在某些业务语义下相同，直接转字符串却会得到不同字节：</p>
<div class="code-block code-line-numbers open" style="counter-reset: code-block 0">
    <div class="code-header language-text">
        <span class="code-title"><i class="arrow fas fa-angle-right" aria-hidden="true"></i></span>
        <span class="ellipses"><i class="fas fa-ellipsis-h" aria-hidden="true"></i></span>
        <span class="copy" title=""><i class="far fa-copy" aria-hidden="true"></i></span>
    </div><div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">Decimal: 1、1.0、1.00
</span></span><span class="line"><span class="cl">Time:    2026-07-19 10:00:00、2026-07-19T02:00:00Z
</span></span><span class="line"><span class="cl">JSON:    {&#34;a&#34;:1,&#34;b&#34;:2}、{&#34;b&#34;:2,&#34;a&#34;:1}
</span></span><span class="line"><span class="cl">String:  Unicode 组合字符与预组合字符</span></span></code></pre></div></div>
<p>每次编码口径调整都要提升 <code>canonicalizationVersion</code>，旧指纹只按旧口径解释。字段规则包括：</p>]]></description></item></channel></rss>