| BLOG.zh-CN.md |
从 0 到 1 的完整优化博客,持续更新 |
| PROGRAM.md |
人或 Coding Agent 执行实验时必须遵守的循环 |
| PLAN.md |
阶段路线、优先级和完成定义 |
| SCHEMA.md |
分数、状态、结果表和图表字段合同 |
| SATURATION.md |
已穷举的局部搜索空间与架构级下一阶段边界 |
| results.tsv |
一行一个实际实验;计划不进入结果表 |
| steps/ |
每个优化步骤的假设、边界、测试和反驳实验 |
| experiments/ |
实际执行后新增的详细实验报告 |
| assets/progress.svg |
从 results.tsv 生成的当前进度图 |
| assets/bottleneck-map.svg |
当前瓶颈和目标架构图 |
| assets/bf16-gemm.svg |
BF16 mixed GEMM 独立 shape track |
| bf16-results.tsv |
BF16 shape、速度、误差原始表 |
| assets/bf16-model-policy.svg |
被否决的官方模型 BF16 策略图 |
| bf16-model-policy.tsv |
三进程中位数、显存和 token gate |
| assets/bf16-ffn-island.svg |
连续 BF16 FFN 激活岛独立曲线 |
| experiments/030-data/ |
36 条 raw JSONL、摘要和 kernel trace |
| assets/bf16-model-inference.svg |
官方模型 BF16 FFN 与两条 reference |
| experiments/031-data/ |
18 条 raw、准备峰值和聚合摘要 |
| assets/bf16-prefill-allocator.svg |
prefill allocator 前后与 PyTorch 门 |
| experiments/032-data/ |
两模型/两策略三进程复测 |
| experiments/033-data/ |
DeepSeek decode kernel/HIP API 聚合统计 |
| assets/bf16-attention.svg |
per-Linear cast 失败与 shared-cast 三进程结果 |
| experiments/034-data/ |
官方 logits/token、candidate raw 与 pilot |
| experiments/035-data/ |
retained Attention 后的 profiler 聚合 |
| assets/bf16-plan-cache.svg |
BF16 plan cache 与 PyTorch BF16 四项验收 |
| experiments/036-data/ |
plan-cache 三进程 official raw/summary |
| assets/bf16-training.svg |
FP32 master BF16 training 的成功与失败门 |
| experiments/037-data/ |
18 条 official train raw、摘要和 native-BF16 失败 |
| experiments/038-data/ |
Qwen FP32/BF16 单步 profiler 对照 |
| assets/bf16-training-qkv-discard.svg |
少 cast/allocation 但吞吐未改善 |
| experiments/039-data/ |
shared-QKV candidate 三进程 raw/summary |
| assets/bf16-training-mirrors.svg |
持久 BF16 权重镜像的吞吐/显存取舍 |
| experiments/040-data/ |
两模型三进程镜像训练 raw/summary |
| assets/bf16-training-ffn-island-discard.svg |
同窗口 control 揭示共享 GPU 漂移与 1.1% 无效收益 |
| experiments/041-data/ |
Qwen raw、DeepSeek early-stop 与 profiler 聚合 |
| assets/bf16-training-shape-matrix.svg |
Qwen batch/context 吞吐和显存曲线 |
| experiments/042-data/ |
四 shape、两框架、三进程的 24 条 raw |
| assets/bf16-weight-gradient-routing.svg |
transpose weight-gradient 路由前后曲线 |
| experiments/043-data/ |
24 条候选 raw、microbench 与三组 profiler 聚合 |
| assets/fused-causal-gqa-training.svg |
full-sequence Attention 融合前后吞吐/显存 |
| experiments/044-data/ |
24 条 raw、前后比较与 retained profiler |
| assets/deepseek-training-shapes.svg |
DeepSeek shape 与 load gap 曲线 |
| experiments/045-data/ |
优化前 pilot、24 条正式 raw 与 load 摘要 |
| assets/deepseek-context128-profile.svg |
DeepSeek context 128 训练热点与阶段污染边界 |
| experiments/046-data/ |
retained Kernel/HIP API 聚合与可验证 profile 合同 |
| assets/stable-gradient-buffer-discard.svg |
稳定梯度地址的吞吐/显存反例 |
| experiments/047-data/ |
匹配协议 raw、错误协议保留与 discard 合同 |
| assets/chunked-adamw-discard.svg |
全量/小 Tensor 分组与端到端反例 |
| experiments/048-data/ |
早停 pair、四 shape 24 条 raw 与 dispatch 合同 |
| assets/vectorized-adamw-explicit.svg |
exact-shape 算子收益与官方模型反例 |
| experiments/049-data/ |
width4/8、sqrt/rsqrt、mirror/no-mirror 与 Qwen pilot raw |
| assets/streaming-safetensors-load.svg |
Qwen/DeepSeek load、H2D 和训练非退化 |
| experiments/050-data/ |
load smoke、DeepSeek 24 条正式 raw 与安全合同 |
| assets/context512-training-profile.svg |
T=512 PyTorch 比率、显存与 Kernel 类别 |
| experiments/051-data/ |
pilot、12 条正式 raw 与 retained profiler 聚合 |
| assets/split-kv-backward-discard.svg |
atomic 基线与两阶段 K/V 反例 |
| experiments/052-data/ |
pilot、candidate profiler 与 discard 合同 |
| assets/strided-batched-hipblaslt.svg |
Qwen Attention batch GEMM exact-shape 加速 |
| experiments/053-data/ |
6 条 Event raw、错误计时和 dispatch 合同 |
| assets/batched-attention-backward.svg |
T512 两模型吞吐与 retained profile |
| experiments/054-data/ |
正式12条 raw、T128 fallback 与 profiler 聚合 |
| assets/saved-attention-probabilities.svg |
T512 吞吐、固定显存成本与 row profile |
| experiments/055-data/ |
正式12条 raw、fallback 与 retained profile |
| assets/batched-attention-forward.svg |
T512 两模型吞吐与 forward/全进程 Kernel 变化 |
| experiments/056-data/ |
正式12条 raw、T128 fallback 与 retained profiler 聚合 |
| assets/full-batched-attention-backward.svg |
T512 两模型吞吐与完整 batched backward 设备时间 |
| experiments/057-data/ |
正式12条 raw、T128 fallback 与 retained profiler 聚合 |
| assets/block-row-causal-softmax.svg |
T512 两模型吞吐与 softmax 前后向设备时间 |
| experiments/058-data/ |
正式12条 raw、T128 fallback 与 retained profiler 聚合 |
| assets/block-column-rmsnorm-weight-gradient.svg |
T512 两模型吞吐与 RMSNorm weight-gradient 设备时间 |
| experiments/059-data/ |
正式12条 raw、T128 fallback 与 retained profiler 聚合 |
| assets/inference-context-batch-matrix.svg |
context吞吐比、batch效率和KV Cache边界 |
| experiments/060-data/ |
核心108条、batch48条、long60条、无效pilot和最终schema smoke |
| assets/batched-long-prefill-inference.svg |
T512/T1024 prefill自身加速、显存和profile |
| experiments/061-data/ |
正式24条、T128 fallback、未命中pilot和前后profile |
| assets/full-prefill-kv-cache.svg |
cache prepare/end-to-end与token/full profile |
| experiments/062-data/ |
正式36条、T2048、两条失败修复和前后profile |
| assets/device-rowwise-argmax.svg |
batch shape加速、D2H字节和profile解释 |
| experiments/063-data/ |
host/device各16条、transfer control和前后profile |
| assets/batched-kv-cache.svg |
cached batch吞吐、扩展效率、KV字节与profile |
| experiments/064-data/ |
pilot16条、正式48条、retained B8 profile |
| assets/bf16-kv-cache.svg |
Release吞吐、T2048 B8 Cache字节与精度门 |
| experiments/065-data/ |
Release前后各72条、12条完整logits、profile和被拒绝向量化 |
| assets/fused-prefix-pair-discard.svg |
prepare矩阵、零D2D局部成功和长batch反例 |
| experiments/066-data/ |
正式72条、精度12条、profile和discard决定 |
| assets/mixed-layer-kv-policy.svg |
RMSE修复、Cache字节和显式性能代价 |
| experiments/067-data/ |
16组搜索、两套12-shape精度、72条formal和profile |
| assets/targeted-prefix-pair-discard.svg |
单FP32层D2D下降与同binary反例 |
| experiments/068-data/ |
reference/paired各6条、精度和discard决定 |
| assets/same-binary-kv-policy.svg |
DeepSeek六shape策略比与跨窗口结论修正 |
| experiments/069-data/ |
72条交替策略raw和12条同binary summary |
| assets/kv-policy-prompt-robustness.svg |
prompt反例、14/14 robust策略和代价 |
| experiments/070-data/ |
layer1挑战、constant搜索、first4精度/性能数据 |
| assets/qwen-kv-prompt-failure.svg |
Qwen pattern矩阵、context反例和FP32 fallback |
| experiments/071-data/ |
uniform/first2挑战和T512/T2048层数搜索 |
| assets/reference-serving-scheduler.svg |
请求状态机、CPU/HIP吞吐与零batch边界 |
| experiments/072-data/ |
CPU/HIP 24条raw、8条中位数和fixed workload |
| assets/static-batch-generation.svg |
HIP batch吞吐、扩展效率和static限制 |
| experiments/073-data/ |
CPU/HIP 24条static/reference raw与8条summary |
| assets/admission-batch-scheduler.svg |
分组吞吐、group数量和B4平台 |
| experiments/074-data/ |
CPU/HIP 30条raw、10条中位数和compatibility合同 |
| experiments/075-request-cancellation-lifecycle.md |
取消终态、幂等、立即Cache释放与batch排除 |
| experiments/075-data/ |
CPU/HIP/sanitizer生命周期门摘要 |
| assets/expanded-inference-service-matrix.svg |
长短context、batch效率、KV显存与精度分叉 |
| experiments/076-data/ |
120条Qwen/DeepSeek prefill、FP32/BF16 cached raw与summary |
| assets/serving-last-logit-prefill.svg |
full→last吞吐、峰值、D2H和新Attention热点 |
| experiments/077-data/ |
full/last正式矩阵、48条shape、完整logits和前后profile统计 |
| assets/folded-gqa-discard.svg |
性能/显存成功与完整logits反驳门 |
| experiments/078-data/ |
三进程候选、T2048 B8完整logits和机制profile |
| assets/register-softmax.svg |
softmax设备时间、配对吞吐、无spill和异常复测 |
| experiments/079-data/ |
bit-exact、A/B paired、16-shape survey、targeted recheck和profile |
| assets/readable-fused-attention-discard.svg |
无T²可读Kernel的吞吐/显存反例与backend盘点 |
| experiments/080-data/ |
T512 B1 paired route pilot和ROCm backend inventory |
| assets/inplace-causal-softmax.svg |
score/prob生命周期、精确T²字节和context显存曲线 |
| experiments/081-data/ |
bit-exact、paired memory track、16-shape survey和alias profile |
| assets/stop-token-early-completion.svg |
不同row终止时间、B1 Cache释放与未回收slot边界 |
| experiments/082-data/ |
CPU/HIP GoogleTest raw、生命周期合同和环境 |
| assets/kv-cache-clear-row.svg |
B2完整capacity清零、其他row保护和shared-position边界 |
| experiments/083-data/ |
CPU/HIP storage对齐、零transfer与生命周期合同 |
| assets/kv-cache-per-row-positions.svg |
uniform/divergent状态转移与严格失败边界 |
| experiments/084-data/ |
CPU/HIP metadata、reset/advance和错误合同 |
| assets/steady-inference-shape-memory.svg |
一token一forward的Release吞吐与长batch显存 |
| experiments/085-data/ |
semantic/Release矩阵、build-type审计和invalid runner证据 |
| assets/deepseek-steady-profile-d2h-discard.svg |
T2048热点组成与D2H候选的B8反例 |
| experiments/086-data/ |
rocprof聚合表、三对交替进程和allocator counter |
| assets/immediate-default-stream-pool.svg |
去除16-block相位后的allocation与吞吐门 |
| experiments/087-data/ |
T2048/T512交替对、官方shape survey与Stream安全合同 |
| assets/bf16x2-key-load-discard.svg |
小算子通过与百万官方logit失败的反例 |
| experiments/088-data/ |
T2048 B1/B8完整logit误差、token和rollback门 |
| assets/raw-packed-key-load-discard.svg |
两种pair转换得到相同失败的反驳实验 |
| experiments/089-data/ |
public scalar恢复、相同误差和搜索关闭证据 |
| assets/device-token-history.svg |
allocator稳定后D2H 24→3与中性性能门 |
| experiments/090-data/ |
T2048/T512交替对、六shape survey和公共API合同 |
| assets/normalize-cached-probabilities-discard.svg |
位级一致与中性负性能的对照 |
| experiments/091-data/ |
百万logit exact门与T2048交替性能 |
| assets/bf16-paired-value-load-discard.svg |
双column位级正确但lane减少的性能反例 |
| experiments/092-data/ |
Value pair完整logit与T2048三对性能 |
| assets/divergent-cached-row-reference.svg |
shared Storage上的不同position与B1 view执行 |
| experiments/093-data/ |
两步状态转移、CPU/HIP、dtype与serial边界 |
| assets/slot-row-prefill.svg |
新prompt进入一个空row且旧row保持不变 |
| experiments/094-data/ |
单槽位prefill状态转移、CPU/HIP、dtype与失败合同 |
| assets/serving-inference-efficiency.svg |
N64短中长context的吞吐、显存与不稳定失败 |
| experiments/095-data/ |
28条paired raw、三次反驳复测和KV/forward/transfer证据 |
| assets/continuous-slot-scheduler.svg |
A完成、C补位、B继续与divergent性能反例 |
| experiments/096-data/ |
CPU/HIP状态机合同、5条divergent和3条uniform MI300X数据 |
| assets/active-row-compaction.svg |
空slot从dummy模型计算变为显式skip |
| experiments/097-data/ |
8条Release矩阵、12条交替A/B与inactive capacity证据 |
| assets/positions-aware-decode.svg |
不同position通过小映射表进入同一active batch |
| experiments/098-data/ |
8条Release矩阵、18条交替A/B与4097 fallback证据 |
| assets/continuous-profile-scatter-discard.svg |
干净Kernel组成与scatter负面A/B |
| experiments/099-data/ |
两份pftrace、原始CSV、stdout与12条scatter交替数据 |
| assets/packed-decode-metadata.svg |
三份小metadata合成一个H2D Storage |
| experiments/100-data/ |
12条交替A/B与H2D/D2H/D2D精确counter |
| assets/batched-slot-prefill.svg |
相同长度prompt从8个B1变成一个[A,T]prefill |
| experiments/101-data/ |
18条交替A/B与logical/physical prefill计数 |
| assets/official-continuous-serving.svg |
官方Qwen/DeepSeek吞吐、KV利用率和精度红门 |
| experiments/102-data/ |
24条microLLM多进程、8条PyTorch参考和逐token比较 |
| assets/continuous-slot-sweep.svg |
固定8请求的S1–S8效率、KV代价和失败修复 |
| experiments/103-data/ |
修复前后各48进程、效率和跨slot token证据 |
| assets/continuous-divergence.svg |
top-2低margin翻转和prefill-only反驳实验 |
| experiments/104-data/ |
18条诊断、serial counterfactual和PyTorch门 |
| assets/prefill-row-audit.svg |
B2 row交换、重复prompt和row-copy反驳 |
| experiments/105-data/ |
12条显式offset官方模型row/order证据 |
| assets/prefill-layer-drift.svg |
embedding到完整logits的relative-L2增长 |
| experiments/106-data/ |
三对fresh B1/B2的31-stage完整值误差 |
| assets/block0-drift.svg |
block0 Attention exact到FFN首次非零的边界 |
| experiments/107-data/ |
三对43-stage block0子阶段完整值误差 |
| assets/bf16-ffn-drift.svg |
cast exact到gate/up GEMM首次漂移 |
| experiments/108-data/ |
三对48-stage FFN内部完整值误差 |
| assets/bf16-algorithm-inventory.svg |
M32/M64候选集合与53个交集 |
| experiments/109-data/ |
solution index、workspace和waves原始JSON |
| assets/bf16-same-algorithm.svg |
exact恢复与吞吐代价 |
| experiments/110-data/ |
3对精度和12条无trace性能A/B |
| assets/qwen-common-algorithm-discard.svg |
Qwen中性性能但非exact的拒绝证据 |
| experiments/111-data/ |
56候选inventory、精度和性能A/B |
| assets/qwen-algorithm-search.svg |
56受支持、0 exact与最佳误差 |
| experiments/112-data/ |
全56候选完整logits搜索 |
| assets/request-latency.svg |
short/long slot延迟权衡 |
| experiments/113-data/ |
48条请求级TTFT/completion/KV数据 |
| assets/length-bucket-tradeoff.svg |
KV、TTFT、吞吐与完成延迟的分桶取舍 |
| experiments/114-data/ |
12条Release A/B、路由、token和GPU负载证据 |
| assets/bucket-pareto-sweep.svg |
1/2/4桶的Cache、吞吐和延迟Pareto曲线 |
| experiments/115-data/ |
18条idle-gated正式矩阵和一轮污染拒绝证据 |
| assets/traffic-skew-tail.svg |
固定桶的median改善与P95排队反例 |
| experiments/116-data/ |
36条偏斜/延迟到达矩阵和两次设备门阻断记录 |
| assets/compatible-overflow.svg |
短请求借大桶后的吞吐与P95恢复 |
| experiments/117-data/ |
54条三策略矩阵和一次路由合同失败 |
| assets/slot-ratio-sweep.svg |
short/long-heavy下静态slot最优比例翻转 |
| experiments/118-data/ |
48条2:6/4:4/6:2正式矩阵 |
| assets/mi300-precision-roofline.svg |
128–1024的FP32/16/BF16/FP8 achieved TFLOPS |
| experiments/119-data/ |
20条executed precision与roofline证据 |
| assets/large-precision-roofline.svg |
2048/4096低精度TFLOPS与峰值利用率 |
| experiments/120-data/ |
10条FP32-reference大GEMM证据 |
| assets/mi300-int8-probe.svg |
128–4096 raw INT8 executed TOPS |
| experiments/121-data/ |
6条INT8 exact-sample与roofline证据 |
| assets/official-fp8-static-scale.svg |
official FP8速度/内存与四个精度红门 |
| experiments/122-data/ |
36条FP32/BF16/FP8和一次worker失败 |
| assets/fp8-global-scale-grid.svg |
两个官方模型的全局scale网格最低RMS与精度门 |
| experiments/123-data/ |
34条fresh-process reference/scale候选和0/32过门证据 |
| assets/fp8-scale-boundary.svg |
activation上边界扩展后的官方模型RMS曲线 |
| experiments/124-data/ |
18条0.1/0.2边界扩展和0/16过门证据 |
| assets/fp8-scale-turn.svg |
Qwen/DeepSeek全局scale误差曲线的分叉 |
| experiments/125-data/ |
18条0.4/0.8边界扩展和top-token反例 |
| assets/qwen-fp8-scale-closure.svg |
Qwen扩展到3.2后的边际收益和剩余精度差距 |
| experiments/126-data/ |
9条Qwen-only边界收尾和诚实结论门 |
| assets/fp8-tensor-amax-weight.svg |
per-Tensor weight scale的误差改善、剩余门差距和准备成本 |
| experiments/127-data/ |
36条正式矩阵、3条pilot和15条被拒绝的计时缺失数据 |
| assets/fp8-activation-range.svg |
全层Linear输入相对固定FP8范围的冲突 |
| experiments/128-data/ |
208个正式activation边界、完整trace、pilot和一次合同失败 |
| assets/fp8-device-activation-amax.svg |
device动态scale的RMS改善与长context性能失败 |
| experiments/129-data/ |
36条正式FP32/BF16/dynamic-FP8与3条pilot |
| assets/fp8-activation-row-range.svg |
Attention/FFN内部token row范围差异 |
| experiments/130-data/ |
208个Tensor的全部逐row amax与full-trace manifest |
| assets/fp8-ffn-outer-row.svg |
FFN row策略的速度恢复、精度红门与fallback次数 |
| experiments/131-data/ |
36条正式矩阵与3条pilot |
| assets/fp8-device-weight-amax.svg |
host/device权重准备时间与冷启动加速 |
| experiments/132-data/ |
36条正式、fresh pilot、stale binary与fresh-build失败证据 |
| assets/fp8-multiblock-amax.svg |
weight冷启动与T512 activation双重加速 |
| experiments/133-data/ |
两套18-worker矩阵与fresh build |
| assets/fp8-dynamic-activation-profile.svg |
dynamic三段与GEMM可归因时间 |
| experiments/134-data/ |
两模型parsed profile与kernel/API stats |
| assets/fp8-shared-activation-quantization.svg |
QKV/gate-up共享后的T512吞吐 |
| experiments/135-data/ |
18条正式矩阵、verification与fresh build |
| assets/fp8-shared-activation-profile.svg |
共享前后known-forward profile |
| experiments/136-data/ |
两模型复测parsed profile与stats |
| assets/fp8-layer-drift.svg |
Qwen21/Deep27误差定位 |
| experiments/137-data/ |
56阶段完整差异、完整性审计与trace manifest |
| assets/fp8-block-detail.svg |
Q21/Deep27内部误差与残差相加跳变 |
| experiments/138-data/ |
32个内部阶段、fresh build与trace manifest |
| assets/fp8-residual-cancellation.svg |
残差误差的分子/分母精确分解 |
| experiments/139-data/ |
两模型完整值代数与重建门 |
| assets/fp8-selective-block-counterfactual.svg |
关键层FP32的短/长context精度反例与显存代价 |
| experiments/140-data/ |
36个正式worker、fresh build、完整logits与策略拒绝门 |
| assets/fp8-error-source-isolation.svg |
权重/激活单侧舍入的完整logits RMS对比 |
| experiments/141-data/ |
24个正式worker、两种诊断合同和误差归因 |
| assets/fp8-native-vs-roundtrip.svg |
原生GEMM直接扰动与最终总RMS的两条判定门 |
| experiments/142-data/ |
12个worker、4组直接完整向量比较和fresh build |
| assets/fp8-output-channel-policy.svg |
Qwen/DeepSeek相反精度与共同T512速度回退 |
| experiments/143-data/ |
36个worker、scale/显存/调用计数和keep门 |
| assets/fp8-output-column-native-probe.svg |
outer-vector拒绝与scalar+post有效路径 |
| experiments/144-data/ |
fresh GTest JSON、6个模型worker和能力门 |
| assets/fp8-weight-reconstruction-audit.svg |
Attention/FFN/head权重重建与模型放大反例 |
| experiments/145-data/ |
365个真实Linear、分组SSE和外部诊断边界 |
| assets/fp8-output-head-only.svg |
同revision零数值变化、微小速度/显存代价 |
| experiments/146-data/ |
候选/control共72 worker与错误基线审计 |
| assets/fp8-attention-only.svg |
7/8误差改善、Qwen长RMS反例和T512速度门 |
| experiments/147-data/ |
同revision候选/control、72 worker和scope计数 |
| assets/fp8-attention-output-only.svg |
Qwen零回归、Deep改善与T512 keep门 |
| experiments/148-data/ |
O-only/control共72 worker和targeted keep证据 |
| assets/fp8-clipped-pilot-invalid.svg |
外部GPU争用时间线和严格拒绝门 |
| experiments/149-data/ |
0/4有效fraction、污染行排除和重试合同 |
| assets/fp8-fraction-pilot-workload-invalid.svg |
retained/执行weight起点不一致 |
| experiments/150-data/ |
20 worker执行合同与4/4 baseline mismatch |
| assets/fp8-clipped-coarse-grid.svg |
fraction下降时worst RMS/Max急剧恶化 |
| experiments/151-data/ |
有效20-worker coarse grid与精细网格交接 |
| assets/fp8-clipped-fine-grid.svg |
0.95/0.9/0.85的worst RMS恶化曲线 |
| experiments/152-data/ |
精细20-worker网格与模型clipping关闭门 |
| assets/fp8-e5-activation-discard.svg |
E5相对E4的八项完整logits误差回归 |
| experiments/153-data/ |
E5/control共72 worker、格式与调度计数及拒绝门 |
| assets/fp8-layer-leave-one-out.svg |
Qwen/DeepSeek全部单层FP32敏感度与反例 |
| experiments/154-data/ |
56行完整logits、52层排名与routing合同 |
| assets/fp8-qwen-layer9-formal-discard.svg |
Qwen layer9短上下文改善与长上下文反转 |
| experiments/155-data/ |
candidate/control共36 worker、显存/速度/精度拒绝门 |
| assets/block-reduction-determinism.svg |
reduction数据竞争从20/20不同到bit-exact |
| experiments/156-data/ |
旧revision反例、20进程门与三进程性能证据 |
| assets/adamw-correctness-before-timing.svg |
完整optimizer状态门、真实参数量速度与Scalar保留结论 |
| experiments/157-adamw-correctness-before-timing.md |
exact key/cache、15进程MI300矩阵与端到端中性回归 |
| assets/cooperative-bias-gradient.svg |
32-row边界、真实宽度算子加速与两模型整机收益 |
| experiments/158-cooperative-bias-gradient.md |
78行完整输出、同revision A/B与rocprofv3归因 |
| assets/post-bias-training-profile.svg |
每训练step分类、load-only反例与下一热点选择 |
| experiments/159-post-bias-training-profile.md |
1步/3步相位差分与53.47% GEMM结论 |
| assets/bf16-training-solution-discard.svg |
八shape算子收益、两种模型策略与拒绝门 |
| experiments/160-bf16-training-solution-discard.md |
1536候选、24进程和同revision整机反驳 |
| assets/tied-embedding-sparse-add.svg |
gradient来源、Qwen峰值与稀疏累加路径 |
| experiments/161-tied-embedding-sparse-add.md |
71.2%元素归因、两模型A/B和profile归因 |
| assets/attention-rope-layout-fusion.svg |
Q/K布局复制、两模型T512与rocprofv3归因 |
| experiments/162-attention-rope-layout-fusion.md |
前向/双梯度门、60% copy消除与保留结论 |
| assets/attention-interleaved-pv.svg |
交错head地址、五shape算子速度与边界反例 |
| experiments/163-attention-interleaved-pv.md |
30进程完整输出与hipBLASLt布局能力证据 |
| assets/attention-context-layout-fusion.svg |
BTHD前后向、零strided-copy与两模型整机门 |
| experiments/164-attention-context-layout-fusion.md |
output/dP/dV/QKV梯度、T512 A/B与profile |
| assets/post-layout-training-profile.svg |
零copy后的Kernel重排与interleaved plan假设 |
| experiments/165-post-layout-training-profile.md |
1步/3步相位差分、关闭路线与下一节点 |
| assets/attention-layout-plan-cache-discard.svg |
算子收益与整机拒绝的并列证据 |
| experiments/166-attention-layout-plan-cache-discard.md |
exact cache路由、24算子进程与12模型进程 |
| assets/attention-gemm-scale-fusion-discard.svg |
scale Kernel归零与两模型混合拒绝门 |
| experiments/167-attention-gemm-scale-fusion-discard.md |
alpha算子、12模型进程、rounding与profile |
| assets/paired-gqa-repeat-discard.svg |
repeat Kernel减半与Qwen反例 |
| experiments/168-paired-gqa-repeat-discard.md |
成对前后向、12模型进程与完整profile |
| assets/gqa-zero-stride-value-broadcast.svg |
Qwen/DeepSeek相反的零stride P×V结果 |
| experiments/169-gqa-zero-stride-value-broadcast.md |
30算子进程、MHA反例与width-selective下一门 |
| assets/selective-gqa-value-broadcast-discard.svg |
width选择、Deep整机拒绝与profile抵消 |
| experiments/170-selective-gqa-value-broadcast-discard.md |
dP/QKV梯度、12模型进程与Deep profile |
| assets/forward-only-gqa-value-broadcast-discard.svg |
forward-only整机/参数/profile最终拒绝 |
| experiments/171-forward-only-gqa-value-broadcast-discard.md |
zero-stride模型路线关闭证据 |
| assets/unique-gradient-inplace-add-discard.svg |
真正少allocation但不减少device工作的反例 |
| experiments/172-unique-gradient-inplace-add-discard.md |
独占owner合同、两模型A/B与rocprofv3拒绝门 |
| assets/hip-graph-submission-crossover.svg |
1/8节点反例与32–512节点Graph收益拐点 |
| experiments/173-hip-graph-runtime.md |
caller-owned capture、sticky-error恢复与模型阻塞边界 |
| assets/hip-graph-gemm-discard.svg |
Qwen边缘收益与DeepSeek vendor-GEMM反例 |
| experiments/174-hip-graph-gemm-discard.md |
stable matmul输出、36进程矩阵与profile拒绝门 |
| assets/scoped-model-stream-discard.svg |
Stream路由成功但Storage lifetime导致完整logits错误 |
| experiments/175-scoped-model-stream-discard.md |
三次稳定失败、候选移除与deferred-release前置条件 |
| assets/deferred-hip-deallocation.svg |
310次同步消除、速度与pending-memory代价 |
| experiments/176-deferred-hip-deallocation.md |
explicit lifetime合同、36进程矩阵与overflow测试 |
| assets/scoped-deferred-model-stream.svg |
8个官方workload速度比与14.5GiB代价 |
| experiments/177-scoped-deferred-model-stream.md |
bit-exact模型Stream、48进程矩阵与allocator归因 |
| assets/per-device-hipblaslt-handles.svg |
RCCL 6/11→11/11与四项单卡非回归 |
| experiments/178-per-device-hipblaslt-handles.md |
handle设备所有权、交替GPU测试与12进程矩阵 |
| assets/stream-ordered-allocator.svg |
eager async与Graph allocation-node速度/地址反例 |
| experiments/179-stream-ordered-allocator.md |
72进程矩阵、pool high-water和profile关闭门 |
| assets/activation-arena.svg |
stable two-slot eager/Graph速度与setup回本次数 |
| experiments/180-activation-arena.md |
72进程矩阵、compute-only Graph和liveness合同 |
| assets/arena-ffn.svg |
Qwen/DeepSeek四算子FFN速度与短行反例 |
| experiments/181-arena-ffn.md |
official shape、36进程、四节点Graph与profile |
| assets/bf16-arena-ffn.svg |
BF16 caller-owned FFN六shape速度与Graph反例 |
| experiments/182-bf16-arena-ffn.md |
54进程、direct/fallback节点与分配profile |
| assets/bf16-ffn-arena-model.svg |
两模型五case完整推理比率与选择边界 |
| experiments/183-bf16-ffn-arena-model.md |
60进程完整logits、分配profile与全局策略拒绝 |
| assets/bf16-ffn-arena-selective.svg |
rows≥512 eligible与八个精确bypass case |
| experiments/184-bf16-ffn-arena-selective.md |
两模型长prefill keep、60进程与profile |
| assets/bf16-qkv-arena-discard.svg |
QKV eligible/bypass完整模型失败图 |
| experiments/185-bf16-qkv-arena-discard.md |
分配下降但T512仅1.004×/1.005× |
| assets/allocation-source-attribution.svg |
Qwen/DeepSeek T512 source bytes堆叠图 |
| experiments/186-allocation-source-attribution.md |
6进程确定性分布与Attention core选择 |
| assets/attention-core-arena-discard.svg |
最大allocation source的整模失败证据 |
| experiments/187-attention-core-arena-discard.md |
600/700分配下降但仅1.004×/1.002× |
| assets/fp32-attention-solutions.svg |
四个FP32 QK/PV exact solution加速 |
| experiments/188-fp32-attention-solutions.md |
12进程、64共同候选与完整输出门 |
| assets/fp32-attention-model-gate.svg |
QK/PV/both整模速度与bit-exact门 |
| experiments/189-fp32-attention-model-gate.md |
精确注册、24进程与默认策略拒绝 |
| assets/bf16-grouped-qkv.svg |
pointer-stable算子收益与两模型整模分叉 |
| experiments/190-bf16-grouped-qkv.md |
phase delta、24进程、plan cache与默认拒绝 |
| assets/bf16-grouped-qkv-expanded.svg |
64候选、两模型steady keep与setup gate |
| experiments/191-bf16-grouped-qkv-expanded.md |
user arguments、24进程与显式预热策略 |
| assets/bf16-grouped-qkv-prewarm.svg |
lazy与prewarm首请求时间线 |
| experiments/192-bf16-grouped-qkv-prewarm.md |
18进程、prewarm API与admission边界 |
| assets/hipblaslt-preload.svg |
全kernel预载的两模型冷启动反例 |
| experiments/193-hipblaslt-preload.md |
18进程、wall/forward/显存与策略拒绝 |
| assets/bf16-exact-startup.svg |
exact gate/up算子、cold和steady三层对照 |
| experiments/194-bf16-exact-startup.md |
6 tuner + 24模型进程与bit-exact拒绝 |
| assets/bf16-grouped-gate-up.svg |
双gate/up稳定、device arguments与重初始化对照 |
| experiments/195-bf16-grouped-gate-up.md |
6进程、64候选与FFN Arena接入门 |
| assets/bf16-grouped-gate-up-model.svg |
两模型吞吐与每层少一次GEMM提交 |
| experiments/196-bf16-grouped-gate-up-model.md |
exact registry、12进程、setup/peak/profile gate |
| assets/bf16-grouped-composition.svg |
baseline、QKV、gate/up、both四策略吞吐 |
| experiments/197-bf16-grouped-composition.md |
24进程、双registry dispatch与组合setup |
| assets/bf16-grouped-shape-matrix.svg |
rows256/1024两模型两projection user-args收益 |
| experiments/198-bf16-grouped-shape-matrix.md |
24进程、winner集合与重初始化反驳 |
| assets/bf16-grouped-shape-models.svg |
B1/T256、B1/T1024、B2/T512完整模型 |
| experiments/199-bf16-grouped-shape-models.md |
36进程、batch-row top-1与CLI导出修复 |
| assets/bf16-grouped-composed-profile.svg |
组合后GEMM calls与剩余时间占比 |
| experiments/200-bf16-grouped-composed-profile.md |
四trace、phase delta与下一热点选择 |
| assets/hf-strided-copy-sources.svg |
Attention layout/core剩余copy字节 |
| experiments/201-hf-strided-copy-sources.md |
source-aware diagnostics、6进程与BTHD选择 |
| assets/inference-bthd-attention.svg |
copy 96/112→0与完整模型速度 |
| experiments/202-inference-bthd-attention.md |
24进程、bit-exact、peak与显式fallback |
| assets/inference-bthd-shape-models.svg |
BTHD长短序列与batch速度 |
| experiments/203-inference-bthd-shape-models.md |
42进程、Attention copy 0与B2 residual |
| assets/inference-bthd-profile.svg |
BTHD前后Kernel时间与新热点 |
| experiments/204-inference-bthd-profile.md |
四trace、strided归零与cast候选 |
| assets/inference-bthd-bf16-qk.svg |
五进程整模收益与cast删除证据 |
| experiments/205-inference-bthd-bf16-qk.md |
BF16 Q/K直入融合RoPE;三进程反例与五进程正式门 |
| assets/inference-bthd-bf16-qk-shapes.svg |
两模型三case五进程收益与1.01门 |
| experiments/206-inference-bthd-bf16-qk-shapes.md |
B1/T256、B1/T1024、B2/T512完整矩阵 |
| assets/causal-softmax-128-discard.svg |
128线程六shape算子矩阵与拒绝门 |
| experiments/207-causal-softmax-128-discard.md |
DeepSeek T512反例;模型/CLI策略未进入 |
| assets/bf16-repeat-fusion-discard.svg |
BF16 V cast+repeat八shape矩阵 |
| experiments/208-bf16-repeat-fusion-discard.md |
小B1加速与B2反例;模型接入取消 |
| assets/post-bf16-qk-saturation.svg |
当前Kernel占比、理论上限与反驳链 |
| experiments/209-post-bf16-qk-saturation.md |
推理微融合局部饱和;online Attention合同 |
| assets/training-add-rms-norm-discard.svg |
训练融合少72次launch但端到端回退 |
| experiments/210-training-add-rms-norm-fusion-discard.md |
分支梯度完整对齐与两模型拒绝门 |
| assets/multi-tensor-adamw-discard.svg |
290/339次AdamW启动合一与DeepSeek带宽反例 |
| experiments/211-multi-tensor-adamw-discard.md |
pinned异步metadata、五进程模型门与隔离profile |
| assets/training-bf16-shared-activation-discard.svg |
共享cast的三策略模型反例与结构命中 |
| experiments/212-training-bf16-shared-activation-discard.md |
56进程、双模型profile与多输出梯度门 |
| assets/post-training-micro-saturation.svg |
去除加载后的训练Kernel占比与完美消除上限 |
| experiments/213-post-training-micro-saturation.md |
GEMM+AdamW占72.71%/83.77%的收口证据 |
| assets/bf16-adamw-moments.svg |
两模型吞吐、optimizer与峰值显存对照 |
| experiments/214-bf16-adamw-moments-partial.md |
BF16 moment、计时修复、multi-tensor反例与partial keep |
| assets/hybrid-bf16-adamw.svg |
六阈值搜索、1M正式门和16M反例 |
| experiments/215-hybrid-bf16-adamw.md |
小Tensor分层合并与HIP Auto边界 |
| assets/post-hybrid-training-profile.svg |
Hybrid前后总Kernel/AdamW与新类别占比 |
| experiments/216-post-hybrid-training-profile.md |
差分profile与训练GEMM下一合同 |
| assets/grouped-weight-gradient-discard.svg |
direct/materialized八格能力失败 |
| experiments/217-grouped-weight-gradient-discard.md |
FP32 GroupedGemm能力门与路由拒绝 |
| assets/packed-weight-gradient-discard.svg |
四项pack+大GEMM速度与显存代价 |
| experiments/218-packed-weight-gradient-discard.md |
12进程完整输出反例与组合搜索关闭 |
| assets/fp32-weight-gradient-solutions-discard.svg |
operator winner、exact hits与模型反例 |
| experiments/219-fp32-weight-gradient-solutions-discard.md |
rank-2 registry和solution默认拒绝 |
| assets/training-graph-capture-boundary.svg |
FP32/BF16四阶段capture与两类阻塞条件 |
| experiments/220-training-graph-capture-boundary.md |
24进程、失败恢复与完整训练Graph拒绝 |
| assets/adamw-graph-replay.svg |
device step下FP32/BF16大小/Tensor数性能边界 |
| experiments/221-adamw-device-step-graph.md |
60进程、53步状态对齐与显式partial keep |
| assets/adamw-graph-multi.svg |
per-Tensor与两节点multi Graph的对数速度矩阵 |
| experiments/222-adamw-stable-descriptor-multi-graph.md |
90进程、immutable descriptor与大FP32反例 |
| assets/gradient-address-stability.svg |
六case稳定/变化gradient字节与Tensor数 |
| experiments/223-gradient-address-stability.md |
18进程、context反例与Graph eligibility边界 |
| assets/optimizer-graph-model-preflight.svg |
Stream创建到安全拒绝的完整因果链 |
| experiments/224-optimizer-graph-model-preflight.md |
12进程、pool disable与零launch模型反例 |
| assets/quiescent-allocator-handoff.svg |
default/Graph阶段状态机与四case救回结果 |
| experiments/225-quiescent-allocator-handoff.md |
24进程、三次handoff与Deep长上下文反例 |
| assets/optimizer-graph-model-gate.svg |
optimizer/完整step双指标模型反例 |
| experiments/226-optimizer-graph-model-gate.md |
21进程精确状态、零metadata copy与模型拒绝 |
| assets/rocwmma-qk-tile.svg |
T16–2048、D64/128的rocWMMA/标量/hipBLASLt边界 |
| experiments/227-rocwmma-qk-tile.md |
矩阵单元能力门、完整输出与online Attention原型准入 |
| assets/rocwmma-online-attention.svg |
两种真实GQA配置的candidate/current曲线与T2048显存删除量 |
| experiments/228-rocwmma-online-attention.md |
online max/sum、MFMA QK/PV、失败修正与operator准入 |
| assets/rocwmma-online-operator.svg |
10个native与4个fallback公共API速度/路由边界 |
| experiments/229-rocwmma-online-operator.md |
公共API、CMake feature、PyTorch与模型门准入 |
| assets/rocwmma-online-model-discard.svg |
六格整模吞吐、显存节省与logit失败 |
| experiments/230-rocwmma-online-model-discard.md |
36进程整模反例与模型路由拒绝 |
| assets/rocwmma-direct-bf16-model-discard.svg |
三cast与direct-BF16整模速度配对 |
| experiments/231-rocwmma-direct-bf16-model-discard.md |
direct-BF16反驳与online模型track关闭 |
| assets/current-inference-profile.svg |
当前B1T1024默认路径分类占比 |
| experiments/232-current-inference-profile.md |
4进程rocprof、phase delta与新GEMM合同 |
| assets/fp32-attention-t1024-discard.svg |
四个operator winner与两个整模反例 |
| experiments/233-fp32-attention-t1024-discard.md |
descriptor mismatch、logits与默认拒绝 |
| assets/bf16-swiglu-vector-discard.svg |
operator加速与整模收益落差 |
| experiments/234-bf16-swiglu-vector-discard.md |
预分配测量、bit-exact门与Auto拒绝 |
| assets/bf16-grouped-swish-discard.svg |
grouped epilogue局部收益和整模反例 |
| experiments/235-bf16-grouped-swish-discard.md |
64-candidate能力门、same-binary A/B与路线关闭 |
| assets/bf16-rms-norm-output.svg |
Qwen/DeepSeek Event与wall加速 |
| experiments/236-bf16-rms-norm-output.md |
GPU reference修正、位级门和operator准入 |
| assets/bf16-ffn-norm-model.svg |
整模吞吐、allocation与精度门 |
| experiments/237-bf16-ffn-norm-model.md |
Arena直入、fallback修正和默认决定 |
| assets/post-bf16-ffn-norm-profile.svg |
融合前后Kernel时间与cast调用 |
| experiments/238-post-bf16-ffn-norm-profile.md |
四进程phase delta与下一合同 |
| assets/bf16-attention-norm-model.svg |
整模吞吐、峰值、allocation和精度 |
| experiments/239-bf16-attention-norm-model.md |
QKV precast合同与默认路由 |
| assets/post-bf16-attention-norm-profile.svg |
两Norm融合前后Kernel和cast |
| experiments/240-post-bf16-attention-norm-profile.md |
剩余一进一出边界和下一合同 |
| assets/bf16-pv-output-discard.svg |
BTHD/GQA两种descriptor能力拒绝 |
| experiments/241-bf16-pv-output-discard.md |
status 6、0计时与API撤回 |
| assets/bf16-value-pv-discard.svg |
BF16 V的BTHD/GQA能力拒绝 |
| experiments/242-bf16-value-pv-discard.md |
反向cast能力门与vendor路线关闭 |
| assets/inference-local-saturation.svg |
剩余cast上限与六条关闭路线 |
| experiments/243-inference-local-saturation.md |
当前推理局部策略搜索的停止门 |
| assets/current-training-profile.svg |
当前B1T512训练Kernel时间分布 |
| experiments/244-current-training-profile.md |
四进程重采样与下一训练架构合同 |
| assets/bf16-weight-gradient-shapes.svg |
六个真实weight-gradient shape的胜负矩阵 |
| experiments/245-bf16-weight-gradient-shapes.md |
BF16数学门、四个反例与gate/up准入 |
| assets/bf16-weight-gradient-model.svg |
两模型吞吐、路由、loss与峰值门 |
| experiments/246-bf16-weight-gradient-model.md |
接线反例、短模型门与显式保留决定 |
| assets/bf16-weight-gradient-trajectory-discard.svg |
五个长轨迹门与模型路由拒绝 |
| experiments/247-bf16-weight-gradient-trajectory-discard.md |
20-step、完整参数和候选清理 |
| assets/bf16-weight-gradient-allocation-attribution.svg |
route、逻辑分配与cast字节恒等式 |
| experiments/248-bf16-weight-gradient-allocation-attribution.md |
cache复用、零backend增量与workspace前置门 |
| assets/bf16-weight-gradient-workspace-discard.svg |
allocating/preallocated Event与wall反例 |
| experiments/249-bf16-weight-gradient-workspace-discard.md |
0/2 workspace门与API拒绝 |
| assets/training-local-saturation.svg |
当前profile、cast上限与六条关闭路线 |
| experiments/250-training-local-saturation.md |
训练局部策略停止门与下一架构尺度 |
| assets/current-data-parallel-audit.svg |
当前双卡阶段占比与production gap |
| experiments/251-current-data-parallel-audit.md |
RCCL14/14、20-step与第一production合同 |
| assets/data-parallel-verification-interval.svg |
三种审计policy的steady total与检查次数 |
| experiments/252-data-parallel-verification-interval.md |
隐式同步修复、loss等价与默认兼容 |
| assets/data-parallel-bucket-matrix.svg |
bucket count、通信与total矩阵 |
| experiments/253-data-parallel-bucket-matrix.md |
tiny overlap workload拒绝与Model-S交接 |
| assets/data-parallel-model-s-buckets.svg |
Model-S bucket/communication/total/peak矩阵 |
| experiments/254-data-parallel-model-s-buckets.md |
3-bucket reducer baseline与copy归因交接 |
| assets/data-parallel-bucket-copy-attribution.svg |
126 Tensor、228 copy与374MB恒等式 |
| experiments/255-data-parallel-bucket-copy-attribution.md |
backend分配热点与persistent reducer准入 |
| assets/data-parallel-inplace-average.svg |
allocating/in-place通信与total A/B |
| experiments/256-data-parallel-inplace-average.md |
地址稳定、RCCL门与默认保留 |
| assets/data-parallel-persistent-buckets.svg |
persistent通信/total收益与live/peak代价 |
| experiments/257-data-parallel-persistent-buckets.md |
后续allocation归零、保持显式与bucket-view交接 |
| assets/data-parallel-gradient-bucket-views.svg |
三策略速度、live/peak与unpack删除对比 |
| experiments/258-data-parallel-gradient-bucket-views.md |
114个Storage/copy删除与direct-backward交接 |
| assets/data-parallel-direct-bucket-gradient-discard.svg |
copy归零但forward/backward回退的反例 |
| experiments/259-data-parallel-direct-bucket-gradients-discard.md |
模型route拒绝与producer out-kernel交接 |
| assets/gradient-producer-out-matrix.svg |
五shape Event/Wall与allocation 1→0算子门 |
| experiments/260-gradient-producer-out-matrix.md |
CPU/HIP/PyTorch对齐与scoped Autograd准入 |
| assets/scoped-autograd-gradient-producer-discard.svg |
allocation减少但Autograd无收益的反例 |
| experiments/261-scoped-autograd-gradient-producer-discard.md |
0/5门、route撤回与gradient-ready交接 |
| assets/data-parallel-gradient-ready-order.svg |
57参数逆序与3个自然bucket完成窗口 |
| experiments/262-data-parallel-gradient-ready-audit.md |
两rank/多step一致性与Event overlap准入 |
| assets/data-parallel-gradient-overlap.svg |
transient/sync/overlap total、wait与peak对比 |
| experiments/263-data-parallel-gradient-overlap.md |
1.0159×显式保留与one-process-per-GPU交接 |
| assets/one-process-per-gpu-bootstrap.svg |
独立rank/CPU reference/RCCL ID与故障传播 |
| experiments/264-one-process-per-gpu-bootstrap.md |
728值等价、peer终止与rank bucket准入 |
| assets/ranked-gradient-buckets.svg |
collective 12×缩减与tiny启动反例 |
| experiments/265-ranked-gradient-buckets.md |
同步bucket baseline与Model-S交接 |
| assets/ranked-model-s-buckets.svg |
Model-S collective、Reducer范围与端到端差异 |
| experiments/266-ranked-model-s-buckets.md |
19× collective缩减、89.3%方差与cold/steady交接 |
| assets/ranked-steady-reducer-discard.svg |
cold/steady反转、分配/copy归因与transient拒绝 |
| experiments/267-ranked-steady-reducer-discard.md |
bucket steady 0.6747×与persistent Storage准入 |
| assets/ranked-persistent-buckets.svg |
三策略steady速度、分配归零与current/peak代价 |
| experiments/268-ranked-persistent-buckets.md |
persistent显式保留与rank gradient views准入 |
| assets/ranked-gradient-bucket-views.svg |
四策略速度、unpack删除与显存恢复 |
| experiments/269-ranked-gradient-bucket-views.md |
views显式保留与rank ready overlap准入 |
| assets/ranked-gradient-overlap-discard.svg |
finish wait收益与backward enqueue抵消关系 |
| experiments/270-ranked-gradient-overlap-discard.md |
T32 total 1.0052×拒绝与尺度track交接 |
| assets/ranked-overlap-context-scale.svg |
T32/T128 finish、total、CV与显存边界 |
| experiments/271-ranked-overlap-context-scale.md |
T128 context-selective keep与一般默认边界 |
| assets/ranked-checkpoint-resume.svg |
rank0写、2+3恢复/5步控制与失败传播时间线 |
| experiments/272-ranked-checkpoint-resume.md |
完整checkpoint字节等价与Model-S准入 |
| assets/ranked-model-s-checkpoint.svg |
187MB状态构成、写/等/读/恢复资源时间 |
| experiments/273-ranked-model-s-checkpoint.md |
Model-S恢复等价与world-size边界交接 |
| assets/ranked-world-size-boundary.svg |
world1/2成功与world4共享内存失败边界 |
| experiments/274-ranked-world-size-boundary.md |
一般接口保留、当前四卡能力不声明 |
| assets/ranked-rccl-preflight.svg |
visible GPU、shm total/free与debug根因 |
| experiments/275-ranked-rccl-preflight.md |
4/4 No-space证据、unknown总需求与world2非回归 |
| assets/ranked-input-weighting.svg |
[B1,B2] token交换、scale与CPU global-batch等价 |
| experiments/276-ranked-input-weighting.md |
默认拒绝、显式weighted保留与Model-S交接 |
| assets/ranked-model-s-input-weighting.svg |
Model-S [B1,B2] scale、精度与显存smoke |
| experiments/277-ranked-model-s-input-weighting.md |
同步weighted保留与scale-before-ready交接 |
| assets/ranked-weighted-overlap-discard.svg |
finish收益、leaf scale代价与0.9594x整步反例 |
| experiments/278-ranked-weighted-overlap-discard.md |
完整参数等价、性能拒绝与bucket weighting反驳实验 |
| assets/ranked-bucket-weighting.svg |
scale 57→3、finish/整步收益与敏感性边界 |
| experiments/279-ranked-bucket-weighting.md |
显式T128保留、完整参数门与gather-scale交接 |
| assets/ranked-gather-scale-discard.svg |
57 pack删除、1.0140x、额外描述与双门拒绝 |
| experiments/280-ranked-gather-scale-discard.md |
Step 102最佳对照与ranked reducer局部线关闭 |
| assets/current-deepseek-t2048-profile.svg |
当前0.8158x差距、Attention/GEMM占比与资源边界 |
| experiments/281-current-deepseek-t2048-profile.md |
score/context微架构准入与allocator/KV store排除 |
| experiments/282-cached-attention-stage-matrix.md |
24进程三阶段/Fused矩阵与split-sequence准入 |
| stage timing SVG |
从24条raw生成的autoresearch风格分段图 |
| experiments/283-cached-attention-split-search.md |
144进程S1–S32搜索与官方模型门准入 |
| split search SVG |
八个shape的split边界与1.05门 |
| experiments/284-cached-attention-split-model-reject.md |
2.222x速度通过但完整logits拒绝 |
| split model SVG |
三对吞吐、精度与资源结果 |
| experiments/285-materialized-score-attention.md |
位级保序并行QK的24进程算子准入 |
| materialized score SVG |
八格current/materialized Event与score bytes |
| experiments/286-materialized-score-model.md |
DeepSeek位级相同、1.3207x模型保留 |
| materialized model SVG |
三对吞吐、完整精度与资源变化 |
| experiments/287-materialized-score-model-boundary.md |
Qwen/DeepSeek默认minimum=2048的八格证据 |
| materialized boundary SVG |
两模型、两context、两batch性能与精度门 |
| experiments/288-materialized-score-auto-policy.md |
用户默认auto与显式off的四格因果复测 |
| auto policy SVG |
Qwen/DeepSeek T2048默认收益 |
| experiments/289-post-materialized-profile.md |
新默认后的阶段迁移、finalize热点与allocator反例 |
| post-materialized profile SVG |
自动生成的Kernel阶段占比图 |
| experiments/290-finalize-thread-mapping-discard.md |
96进程保序线程映射反例与P×V交接 |
| finalize mapping SVG |
64/128相对256线程的16格速度图 |
| experiments/291-exact-softmax-split-pv.md |
exact softmax下隔离P×V并行度的160进程算子准入 |
| split-PV search SVG |
S1反例与16格S16 winner |
| experiments/292-split-pv-model-reject.md |
1.4834x但完整logits失败,定位到P×V加法树 |
| split-PV model SVG |
三对速度、完整分布与资源反例 |
| experiments/293-exact-gqa-value-reuse-reject.md |
位级GQA复用0/16过门与exact-finalize局部线关闭 |
| GQA value-reuse SVG |
128进程tile矩阵与全局probability代价 |
| experiments/294-serving-batch-scale.md |
T2048 B1/2/4/8吞吐、效率、显存与token边界 |
| serving batch SVG |
micro/PyTorch batch扩展与每请求资源 |
| experiments/295-cross-batch-logit-audit.md |
DeepSeek内部batch漂移、行/argmax排除与精度隔离交接 |
| cross-batch SVG |
step0/1/2完整logits Max/RMS |
| experiments/296-cross-batch-precision-isolation.md |
四精度岛隔离与BF16 FFN block trace准入 |
| precision-isolation SVG |
FP32/FFN/Attention/both完整logits漂移 |
| experiments/297-cached-block-drift.md |
31个边界定位到Block 0首次放大,默认策略冻结 |
| cached block-drift SVG |
FP32 Linear与BF16 FFN-only逐层Max误差 |
| experiments/298-cached-block-zero-detail.md |
BF16 input/gate/down逐点放大与单层FP32反驳实验 |
| cached block-detail SVG |
Block 0内部relative-L2对数图 |
| experiments/299-block-zero-fp32-reject.md |
单层FP32的batch反例、82.6MB代价与algorithm交接 |
| block-0 counterfactual SVG |
FP32/全BF16/Block0-FP32完整logits |
| experiments/300-bf16-decode-algorithm-reject.md |
64候选交集、75892反例与算子row-invariance交接 |
| BF16 decode algorithm SVG |
默认与固定solution的完整logits/吞吐边界 |
| experiments/301-bf16-row-invariance.md |
64/64相同BF16输入跨M exact与gate/up track关闭 |
| BF16 row-invariance SVG |
64个solution的CPU/row双门 |
| experiments/302-prefill-cache-prefix.md |
decode前K/V已漂移与prefill QKV trace交接 |
| prefill cache-prefix SVG |
Block0完整BF16 K/V跨batch误差 |
| experiments/303-prefill-block0-trace.md |
FP32 Q projection首次非零与大M solution交接 |
| prefill block-0 trace SVG |
10个边界的B2/B4/B8完整row误差 |
| experiments/304-fp32-qkv-row-invariance.md |
Q/KV跨M位级solution与完整模型准入 |
| FP32 QKV row-invariance SVG |
Q 12选1、KV 22选5的双门图 |
| experiments/305-fp32-qkv-model-reject.md |
Cache exact但logits/性能拒绝与post-cache trace交接 |
| FP32 QKV model-gate SVG |
raw cache、完整logits和无导出性能 |
| experiments/306-post-cache-block0-trace.md |
exact cache后的Attention context首差与core拆解 |
| post-cache trace SVG |
17个Block0边界的跨/内batch误差 |
| experiments/307-prefill-attention-core-diagnostics.md |
opt-in QK/softmax/P×V诊断边界与默认路径非侵入门 |
| Attention-core diagnostics SVG |
生产/诊断双路径与五组回归证据 |
| experiments/308-prefill-attention-core-matrix.md |
B2 P×V与B4/B8 QK双首差、causal-visible完整值门 |
| Attention-core matrix SVG |
8进程三阶段完整二进制比较 |
| experiments/309-fp32-attention-batch-solutions.md |
QK/P×V exact能力与四batch性能拒绝 |
| Attention solution SVG |
34+2候选的exact/最差speedup矩阵 |
| experiments/310-prefill-attention-model-reject.md |
core exact但完整logits/性能拒绝 |
| Attention model-gate SVG |
32进程完整core/logits/prefill门 |
| experiments/311-batch-selective-attention-reject.md |
性能/RMS通过但Max/B2拒绝与路线关闭 |
| Selective gate SVG |
batch-local index的完整logits/性能矩阵 |
| experiments/312-post-exact-core-o-projection.md |
exact context后的O projection首差 |
| Post-exact-core SVG |
8进程17边界完整trace |
| experiments/313-post-exact-o-ffn-output.md |
O exact后的FFN output首差 |
| Post-exact-O SVG |
8进程O/FFN边界trace |
| experiments/314-prefill-o-model-reject.md |
O完整logits改善但B1性能失败的拒绝证据 |
| O model-gate SVG |
16+16进程数值、prefill和资源门 |
| experiments/315-prefill-exact-stack-reject.md |
真实upstream下exact组合数值拒绝与路线关闭 |
| Exact-stack SVG |
Release 16+16进程完整模型门 |
| FFN detail-trace SVG |
gate/up/SwiGLU/down显式两行数值显微镜 |
| experiments/316-prefill-ffn-gate-up.md |
norm exact、gate/up双投影首差与下一descriptor |
| FFN stage-trace SVG |
8进程7阶段完整值误差图 |
| experiments/317-fp32-ffn-solution-reject.md |
唯一exact index的M8192性能反例 |
| FFN row-invariance SVG |
33候选correctness-before-timing矩阵 |
| experiments/318-prefill-ffn-selective-reject.md |
性能/Max过门但RMS失败的整模反例 |
| FFN model-gate SVG |
32进程真实upstream整模门 |
| experiments/319-prefill-ffn-all-exact-reject.md |
Max改善但RMS恶化与vendor模型线关闭 |
| All-exact FFN SVG |
all-batch 32进程最终反驳 |
| experiments/320-post-exact-gate-up-down.md |
gate/up/SwiGLU exact与down首差 |
| Post-exact gate/up SVG |
8进程7阶段完整值因果图 |
| experiments/321-fp32-ffn-down-reject.md |
down唯一exact候选的0.506×性能反例 |
| FFN down SVG |
K8960/N1536的15候选矩阵 |
| experiments/322-clean-long-context-profile.md |
当前1.1393×PyTorch与42.27% finalize热点 |
| Current clean profile SVG |
1/3-generation当前Kernel分类 |
| experiments/323-finalize-architecture-gap.md |
原生128与旧logical-256 mapping的结构差异 |
| Finalize gap SVG |
当前/旧mapping/native128架构对照 |
| experiments/324-native128-finalize-reject.md |
accuracy通过但T2048约1.003×的反例 |
| Native128 SVG |
16进程Event/wall/精度矩阵 |
| experiments/325-grouped-gate-up-row2.md |
当前decode rows2 grouped GEMM空白 |
| Grouped rows2 SVG |
三轮Event/wall与稳定性 |
| experiments/326-grouped-decode-model-reject.md |
1.00968×未过1.01模型门 |
| experiments/327-clean-deepseek-local-saturation.md |
当前固定workload局部停止门 |
| experiments/328-external-gradient-pool-discard.md |
全梯度exact、地址稳定但默认性能拒绝 |
| External gradient pool SVG |
18进程Event/wall/峰值决策图 |
| experiments/329-pytorch-rocm-custom-ops.md |
ROCm dispatcher正确、elementwise性能拒绝 |
| PyTorch ROCm Custom Ops SVG |
三dtype与前反向代表格 |
| experiments/330-pytorch-custom-op-vector16.md |
broad反例与selective keep |
| Custom Op vector16 SVG |
scalar/broad/selective 16M对比 |
| experiments/331-pytorch-custom-op-swiglu.md |
融合forward成功、training反例 |
| Fused SwiGLU SVG |
三dtype forward/backward边界 |
| experiments/332-pytorch-swiglu-backward-vector-reject.md |
float4解释被推翻并清理 |
| SwiGLU backward SVG |
scalar/vector/native producer对比 |
| experiments/333-pytorch-swiglu-scalar-seed.md |
4-byte seed不再物化完整Tensor |
| Scalar-seed SVG |
F+B时间与peak前后对比 |
| experiments/334-pytorch-swiglu-autograd-attribution.md |
剩余差距定位到Autograd提交 |
| Autograd attribution SVG |
native/custom/manual三路Event |
| experiments/335-pytorch-swiglu-compile-reject.md |
compiled比eager更慢且有冷启动 |
| SwiGLU compile SVG |
四路steady/cold结果 |
| experiments/336-pytorch-swiglu-cpp-autograd.md |
C++ callback关闭主要gap并推荐 |
| C++ Autograd SVG |
三dtype速度/peak准入 |
| experiments/337-pytorch-swiglu-typed-backward.md |
低精度F+B达到scoped parity |
| Typed backward SVG |
FP16/BF16 ATen/native准入 |
| experiments/338-pytorch-typed-softmax-baseline.md |
无FP32临时量但serial性能失败 |
| Typed Softmax SVG |
10格log-scale性能图 |
| experiments/339-pytorch-block-softmax.md |
block归约消除模型宽度串行悬崖 |
| Block Softmax SVG |
serial/block/PyTorch十格对比 |
| experiments/340-pytorch-cached-softmax.md |
bounded LDS cache删除第二次exp |
| Cached Softmax SVG |
width4096 Torch/block/cache Event图 |
| experiments/341-pytorch-wave-softmax-reject.md |
broad wave归约因BF16 wall失败而删除 |
| Wave Softmax reject SVG |
两dtype Event/wall与1.05门 |
| experiments/342-pytorch-fp16-wave-softmax.md |
FP16-only wave谓词通过 |
| FP16 wave Softmax SVG |
selective/fallback Event与wall |
| experiments/343-pytorch-fast-exp-softmax-reject.md |
fast-exp正确但性能不足并删除 |
| Fast-exp Softmax reject SVG |
Event/wall与1.05门 |
| experiments/344-pytorch-softmax-thread-matrix.md |
128/256/512/1024线程矩阵选择1024 |
| Softmax thread matrix SVG |
四档Event/wall与PyTorch线 |
| experiments/345-pytorch-softmax-attribution.md |
raw/C++/Python/PyTorch分层归因 |
| Softmax attribution SVG |
四层Event中位数与边界比值 |
| experiments/346-pytorch-custom-op-softmax.md |
C++ Custom Op与no-grad门 |
| Custom Op Softmax SVG |
十格native比与wide反例 |
| experiments/347-pytorch-custom-op-softmax-out.md |
caller-owned mutation/alias合同 |
| Custom Op Softmax out SVG |
native out十格与零peak |
| experiments/348-pytorch-bf16-wave1024-softmax.md |
BF16 1024-thread wave反驳旧256结论 |
| BF16 wave1024 SVG |
core/Custom out前后Event |
| experiments/349-pytorch-softmax-out-fallthrough-reject.md |
Autograd fallthrough无收益并删除 |
| Softmax out fallthrough SVG |
两dtype相对1.05门 |
| experiments/350-official-pytorch-hidden-alignment.md |
真实Qwen/DeepSeek逐层PyTorch对齐 |
| Official hidden alignment SVG |
27/31阶段relative-L2曲线 |
| experiments/351-official-hf-fixtures.md |
pinned官方权重/tokenizer fixture |
| Official HF fixtures SVG |
权重规模与结构/许可门 |
| experiments/352-int8-weight-contract.md |
一字节Tensor、显式scale与跨框架weight-only合同 |
| INT8 weight contract SVG |
存储缩减、四类正确性门与未接模型边界 |
| experiments/353-int8-weight-matmul-baseline.md |
完整反量化+matmul正确性和allocation基线 |
| INT8 matmul baseline SVG |
从I8权重到完整浮点临时量的公开代价 |
| experiments/354-int8-fused-decode.md |
M=1融合INT8读取、跨框架速度与resident-GEMM反例 |
| INT8 fused decode SVG |
dequant收益、临时内存与DeepSeek反例 |
| experiments/355-model-s-int8-inference.md |
Model-S整模M=1收益与M>1反例 |
| Model-S INT8 SVG |
throughput、常驻与事务准备峰值 |
| experiments/356-official-int8-device-amax-reject.md |
device准备成功与官方Qwen精度拒绝 |
| Official INT8 reject SVG |
准备/显存收益和完整logits反例 |
| experiments/357-official-int8-column-reject.md |
逐输出通道改善与最终官方精度拒绝 |
| INT8 column reject SVG |
完整logits和token停止门 |
| experiments/358-official-int8-scope-matrix.md |
FFN/Attention混合精度隔离 |
| INT8 scope SVG |
固定Max/RMS/token门 |
| experiments/359-official-int8-attention-split-saturation.md |
QKV/O最终拆分与饱和停止 |
| Final INT8 split SVG |
不事后放宽门槛的拒绝证据 |
| experiments/360-explicit-head-qk-norm.md |
hidden与Attention宽度解耦及QK-Norm全图门 |
| Explicit head/QK SVG |
投影shape与53/53独立证据 |
| experiments/361-qwen3-fixture-parser.md |
官方Qwen3 config/header与tied重复边界 |
| Qwen3 fixture SVG |
unique参数与stored payload双口径 |
| experiments/362-qwen3-official-alignment.md |
Qwen3 strict alias与官方完整logits/token |
| Qwen3 official SVG |
bounded load、Max/RMS、token与MI300X资源 |
| experiments/363-qwen3-bf16-inference.md |
Qwen3 BF16共同FP32 oracle、速度与常驻 |
| Qwen3 BF16 SVG |
误差、3.66×端到端与显存 |
| experiments/364-qwen3-fixture-shape-matrix.md |
双计数fixture进入通用矩阵并修复token假绿 |
| Qwen3 fixture matrix SVG |
64/64执行、24 pass与8个精度边界 |
| experiments/365-qwen3-bf16-first-divergence.md |
第一个BF16分叉的共同FP32 oracle归因 |
| Qwen3 first divergence SVG |
低margin、整网BF16 tie与mixed BF16保留 |
| experiments/366-qwen3-bf16-oracle-sweep.md |
全部8行分叉的五case共同oracle |
| Qwen3 BF16 oracle sweep SVG |
mixed/full BF16的4:1 case与T128反例 |
| experiments/367-qwen3-bf16-t128-weight-islands.md |
T128反例的FFN/Attention/Cache隔离 |
| Qwen3 T128 weight islands SVG |
FFN翻转、Attention保留与Cache反驳 |
| experiments/368-qwen3-bf16-ffn-layer-search.md |
28层FFN的分组/single/pair/repeat搜索 |
| Qwen3 FFN layer search SVG |
两个最小组合与近边界反例 |
| experiments/369-qwen3-bf16-ffn-projection-search.md |
两个最小层集合的gate/up/down搜索 |
| Qwen3 FFN projection SVG |
12个partial scope与all-three翻转 |
| experiments/370-qwen3-ffn0-4-fp32-reject.md |
早期五层FP32候选完整矩阵拒绝 |
| Qwen3 early FFN reject SVG |
前缀改善、batch失败与90MiB代价 |
| experiments/371-qwen3-bf16-gate-fp32-reject.md |
全模型gate-FP32简单校准拒绝 |
| Qwen3 gate-FP32 reject SVG |
五case 4/5与T512反例 |
| experiments/372-qwen3-bf16-projection-calibration.md |
gate/up/down对称五case选择 |
| Qwen3 projection calibration SVG |
4/5、5/5、5/5与margin选择 |
| experiments/373-qwen3-down-fp32-reject.md |
down-FP32完整shape/新oracle拒绝 |
| Qwen3 down-FP32 reject SVG |
性能通过、新T128失败与up控制 |
| experiments/374-qwen3-up-fp32-reject.md |
up-FP32八oracle通过、全局性能拒绝 |
| Qwen3 up-FP32 reject SVG |
四个decode通过与T512 prefill反例 |
| experiments/375-qwen3-decode-up-fp32-route.md |
显式phase双表示实现与smoke |
| Qwen3 decode-up FP32 SVG |
prefill mirror、decode主权重与内存门 |
| experiments/376-qwen3-decode-up-fp32-gate.md |
双表示完整shape/oracle/性能决定 |
| Qwen3 phase policy gate SVG |
8/8 argmax、7/8 strict、5/5性能与336MiB代价 |
| experiments/377-hf-batch-invariance-contract.md |
相同输入batch逐行证据合同 |
| HF batch invariance SVG |
micro 2/2、Torch 474/2与FP32 oracle |
| experiments/378-qwen3-decode-up-fp32-long-context.md |
phase策略T1024/T2048完整矩阵 |
| Qwen3 long-context SVG |
10/10 argmax、8/10 strict、batch与显存 |
| experiments/379-qwen3-phase-prompt-patterns.md |
四种prompt seed内容矩阵 |
| Qwen3 prompt pattern SVG |
constant边界与三seed 24/24 |
| experiments/380-qwen3-natural-prompts.md |
四条exact tokenizer prompt |
| Qwen3 natural prompt SVG |
英中代码chat与四份strict oracle |
| experiments/381-qwen3-training-smoke.md |
官方Qwen3 FP32/BF16首个训练step |
| Qwen3 training smoke SVG |
FP32局部对齐与BF16速度/显存反例 |
| experiments/382-qwen3-training-gate-up-audit.md |
Qwen3 gate/up梯度与参数全量审计 |
| Qwen3 gate/up audit SVG |
FP32通过、BF16 Gradient/Parameter失败 |
| experiments/383-qwen3-training-all-parameter-audit.md |
Qwen3全部310个独立梯度与参数审计 |
| Qwen3 complete training audit SVG |
FP32完整一步通过、BF16族别失败归因 |
| experiments/384-qwen3-training-adamw-state-audit.md |
Qwen3全部AdamW moment与step审计 |
| Qwen3 AdamW state SVG |
FP32状态通过、BF16差异传入optimizer |
| experiments/385-qwen3-training-multistep-state-audit.md |
Qwen3三步loss/参数/moment联合轨迹 |
| Qwen3 three-step SVG |
FP32六门通过、BF16三门失败 |
| experiments/386-qwen3-training-checkpoint-resume-audit.md |
Qwen3同源checkpoint中断恢复 |
| Qwen3 checkpoint SVG |
FP32/BF16恢复5/5通过与bitwise边界 |
| experiments/387-qwen3-bf16-moment-storage-audit.md |
Qwen3 BF16 optimizer状态压缩 |
| Qwen3 BF16 moment SVG |
moment内存减半与附加误差边界 |
| scripts/render_progress.py |
无第三方依赖的 SVG 生成器 |
| scripts/validate_log.py |
日志、分数、链接和生成图一致性检查 |