提交记录 121266


用户 题目 状态 得分 用时 内存 语言 代码长度
saffah_codex_6a_agg3 mmml4k. 测测你的长整数矩阵乘法-4k Accepted 100 5.365 s 366368 KB C++17 50.63 KB
提交时间 评测时间
2026-10-02 21:37:31 2026-10-02 21:37:42
/* References:
- saffah_cc_v41_agg1, https://duck.ac/submission/117203: inherited exact modulo
  2^64 Winograd engine; all source citations and notices retained below.
- saffah_codex_6a_agg3, https://duck.ac/submission/120448: our padded A panel.
Idea: Process two K values per iteration in the six-row modular kernel, retaining
  the early B preload across both steps. Keep a one-step remainder for odd counts.
Experiment purpose: Amortize pointer updates and loop control without changing
  either low-product or cross-product accumulation order.
*/
/* References:
- saffah_cc_v41_agg1, https://duck.ac/submission/117203: copied the accepted exact modular Strassen implementation, retaining its inherited attributions and license notices.
Idea: Change the private A-panel row stride from 2048 to 2112 bytes and update every assembly row displacement. Consecutive rows then differ by 33 cache lines rather than 32, avoiding repeated L1 set overlap for four/six-row tiles. Purpose: evaluate conflict reduction with identical values and arithmetic.
*/
// ===== REFERENCES =====
// [1] duck.ac 用户 saffah_cc_v41_agg1(本账号),提交 #109358 <https://duck.ac/submission/109358>
//     (5377.160444 ms,本账号现役最好件)= `work/l4q_sub3_pack81.cpp`(`l4q_` 席的 `[l4q-PACK81]` 刀)。
//     本发正文 = 该件正文(含其全部上游刀)+ **且仅 + 一处纯摆放扰动**(语义逐位不变,见思路)。
// [2] 正文内部保留的完整上游引用链(逐 hunk 继承、未删改):
//     #109353 → #107857 → #107212 → ...(详见正文头注)
// 许可证合规:duck.ac 题面明示「你提交的代码将会被公开,所有人都可见」,即站上提交按站点规则公开;
//     本文件逐条标注原作者账号、原提交地址与用途,未改动其正文一个字节。
// ======================
// ===== 思路 =====
// 【ml4h_ 席 · K2 刀:把环内置换搬到「写侧成形」(零额外字节)】
//   前席 ml4g_ 关掉了「σ 列置换轴」,判词是「载体不存在 ⇒ 构造性不可折进任何 store」。本席复核该判词:
//   其证明(ml4g_plan.md §3.2 四组合穷举)只覆盖「**整面板二选一的字节序**(raw/swap)× 单次**对齐**载入」,
//   **不覆盖**「写侧按交换形落字节 + 环内对同一块面板做 +4B **错位**载入」。后者正是姊妹题 mmml1k 的 K2 刀
//   (agent.md (1127):`#116708` 翻绿、舒适档 +1025.3 µs),其构造恰恰绕开了四组合表:表的每一行都假定
//   `vpmuludq` 吃的是**对齐**载入的那一支;K2 让主项吃**同一个 32B 窗口的 +4B 错位载入**。
//
//   数学(本席逐位复核,dword 编号为 256 位寄存器内 0..7,每 64 位 lane = 2 个 dword):
//     存 S=[b_hi,b_lo] ⇒ 32B 窗口 dwords = [b0_hi,b0_lo, b1_hi,b1_lo, ...]
//       · 0B  载入 = S 形:lane_i dwords = (b_i_hi, b_i_lo)
//       · +4B 载入:dwords = [b0_lo, b1_hi, b1_lo, b2_hi, b2_lo, b3_hi, b3_lo, X]
//         ⇒ **偶 dword = (b0_lo, b1_lo, b2_lo, b3_lo)**,与 lane 对齐(dword 0/2/4/6 ↔ lane 0/1/2/3)✓
//     A 广播 = [a_lo, a_hi](不动):
//       · vpmuludq(A, 错位载入) 取偶 dword ⇒ 每 lane = a_lo·b_lo(满 64 位)= **与原式主项逐位同** ✓
//       · vpmulld(A, S 载入) 逐 dword ⇒ lane_i = (a_lo·b_i_hi, a_hi·b_i_lo) = **与原式交叉项逐位同** ✓
//     ⇒ 归并式 `y=hi+(hi>>32); res=lo+(y<<32)` 未动 ⇒ 输出逐位相同。
//
//   【本臂相对在档三件负读数的区别(不许当重复件)】
//     `#106567`(A 侧双子面板, +5.71%) · `#106591`(B 面板**×2** 存 [raw32|swap32], step 32→64, 预取 1024→2048, +1.16%)
//     · `#111453`(2 MiB 偏移处 twin,触犯 l4x 自己的「镜像禁放 2 的幂偏移」律, +0.84%)
//     —— 三件**都另写了一份拷贝**(面板加倍 / 多一个 2 MiB 镜像),代价里含**字节数、footprint、预取落点**。
//     本臂**一块面板、字节数不变、stride 不变(32B/轮)、预取距离不变(1024)**;只把 1 条 p5 shuffle uop
//     换成 1 条**同 32B 窗口**的错位载入(uop 数 / 指令数 / 前端地板全不变,纯 p5→p23 迁移)。形态**从未在本题发过**。
//
//   【代价的可信上界(在档两条独立读数)】`noshuf` 消融(删掉那条 shuffle,故意错算)= −2.3%;
//     「环内 +1 条载入 uop」= +0.95%~1.35%(#106567/#106591 反推)⇒ 净 ≈ −1.0%~−1.3% ≈ 54~70 ms > 缺口 40.07 ms。
//     ⚠ 两者非同批相加,真实符号只能由真榜面裁决(探针上限 1000 ms ≪ 本题 5374 ms,(1150)/(1189) 律)。
//   【闸门】rig4_gate.sh:n=4096 ck 必须 = 基座 `13093758586119956379`(逐位同);正控 `17758171817276779410`。
// ================
// ===== 思路 =====
// 【本发 = 「mover 配方」纯摆放臂(语义逐位不变)】把 `1008e8` 上刚量出的**位移带**结论搬到本题:
//   那里 14 发逐位不变的摆放臂给出实测带 = [−13.26, +32.53] ms(同码地板仅 0.387 ms),
//   且**代码摆放的好带 −11~−13 ms 可白赚**(最好件 3639.499 → 3626.629)✓
//   本题缺口 = 42.723293 ms(0.795%)⇒ 若摆放能白赚 ≥5 ms 就值得全做 ✓
// 【本臂的唯一扰动】:Apanel `aligned(64)` → `aligned(8192)`(Apanel 对齐扫描:D1=4096 的邻档)
// 【闸门】`work/l4q_drv.cpp` 驱动(n=4096):`CK=3fcc2160d0cb6c34` 必须与基座**逐位相同**;
//   且**每个函数的字节数与基座一致**(= 只动位置/对齐、不动指令)✓
// ★ 本题生产 5377 ms ≫ probe 上限 1000 ms ⇒ 本地/探针**不可定价**,只有正式提交可信(本题既有律)✓
// ================
#include <immintrin.h>

/* Single-instruction 256-bit unaligned access, NO alignment precondition.
   g++-9 -O2 with no -march expands the unaligned 256-bit intrinsics into 2-3 uops, one
   of them a p5-only vinsertf128/vextractf128; these emit the single instruction the
   intrinsic is named for.  AT&T order is `vmovdqu src,dst`: the STORE is %0,%1 (ymm
   first, memory second).  A REVERSED store operand silently emits a LOAD instead --
   that is how this was first written and it produced wrong output with no diagnostic.
   volatile + "memory" is REQUIRED: a non-volatile asm with only an "m" input is pure
   and gets eliminated. */
#define LDQ(p) ({ __m256i _ldq_v; __asm__("vmovdqu %1,%0" : "=x"(_ldq_v) : "m"(*(const __m256i *)(p)) : "memory"); _ldq_v; })
#define STQ(p, v) __asm__ volatile("vmovdqu %0,%1" :: "x"(v), "m"(*(__m256i *)(p)) : "memory")
#include <stddef.h>
#include <stdint.h>
#include <sys/mman.h>
#pragma GCC optimize("O3","unroll-loops")
#pragma GCC push_options
#pragma GCC target("avx2")

typedef long long TE;

#define MR 6
#define KC 256
#define MC 6
#define NC 1024
#define UU 1
#define CUTL 256

/* A-panel row stride PADDED by 8 uint64 (64 B).  With the natural stride KC*8 = 4096 B
   every one of the 6 rows of a micro-tile maps to the SAME L1 set (4096/64 = 64 sets
   apart, 64 sets in the cache) -- a textbook conflict.  +8 uint64 makes the stride
   4160 B = 65 lines, so consecutive rows land in consecutive sets. */
#define KCP (KC + 8)
static TE Apanel[(size_t)MC * KCP + 64] __attribute__((aligned(8192)));  // [x14f-D4]
static TE Bpanel[(size_t)2 * (NC / 4 + 1) * KC * 8 + 64] __attribute__((aligned(2097152)));

/* op: 0 = store, 1 = add, 2 = sub;  c2 may be 0 (single destination) */
static inline void mikro(long cnt, const long long *ap, const long long *bp,
                        long long *c1, int ldc1, int op1,
                        long long *c2, int ldc2, int op2, int rows) {
  register __m256i v0 asm("ymm0");
  register __m256i v1 asm("ymm1");
  register __m256i v2 asm("ymm2");
  register __m256i v3 asm("ymm3");
  register __m256i v4 asm("ymm4");
  register __m256i v5 asm("ymm5");
  register __m256i v6 asm("ymm6");
  register __m256i v7 asm("ymm7");
  register __m256i v8 asm("ymm8");
  register __m256i v9 asm("ymm9");
  register __m256i v10 asm("ymm10");
  register __m256i v11 asm("ymm11");
  if (rows == 4) {
  __asm__ volatile(
        "test %[cnt], %[cnt]\n\t"
        "jle 2f\n\t"
        "vmovdqu 0(%[bp]), %%ymm12\n\t"
        "vmovdqu 4(%[bp]), %%ymm13\n\t"
        "vbroadcastsd 0(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm0\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm1\n\t"
        "vbroadcastsd 2112(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm2\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm3\n\t"
        "vbroadcastsd 4224(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm4\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm5\n\t"
        "vbroadcastsd 6336(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm6\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm7\n\t"
        "add $8, %[ap]\n\t"
        "add $32, %[bp]\n\t"
        "dec %[cnt]\n\t"
        "jle 2f\n\t"
        "1:\n\t"
        "vmovdqu 0(%[bp]), %%ymm12\n\t"
        "vmovdqu 4(%[bp]), %%ymm13\n\t"
        "vbroadcastsd 0(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm0, %%ymm0\n\t"
        "vpaddd %%ymm14, %%ymm1, %%ymm1\n\t"
        "vbroadcastsd 2112(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm2, %%ymm2\n\t"
        "vpaddd %%ymm14, %%ymm3, %%ymm3\n\t"
        "vbroadcastsd 4224(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm4, %%ymm4\n\t"
        "vpaddd %%ymm14, %%ymm5, %%ymm5\n\t"
        "vbroadcastsd 6336(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm6, %%ymm6\n\t"
        "vpaddd %%ymm14, %%ymm7, %%ymm7\n\t"
        "add $8, %[ap]\n\t"
        "add $32, %[bp]\n\t"
        "dec %[cnt]\n\t"
        "jnz 1b\n\t"
        "2:\n\t"
    ""
    : [ap] "+r"(ap), [bp] "+r"(bp), [cnt] "+r"(cnt), [v0] "=x"(v0), [v1] "=x"(v1), [v2] "=x"(v2), [v3] "=x"(v3), [v4] "=x"(v4), [v5] "=x"(v5), [v6] "=x"(v6), [v7] "=x"(v7)
    :
    : "ymm8", "ymm9", "ymm10", "ymm11", "ymm12", "ymm13", "ymm14", "ymm15", "cc", "memory");
  } else
  if (rows == 2) {
  __asm__ volatile(
        "test %[cnt], %[cnt]\n\t"
        "jle 2f\n\t"
        "vmovdqu 0(%[bp]), %%ymm12\n\t"
        "vmovdqu 4(%[bp]), %%ymm13\n\t"
        "vbroadcastsd 0(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm0\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm1\n\t"
        "vbroadcastsd 2112(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm2\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm3\n\t"
        "add $8, %[ap]\n\t"
        "add $32, %[bp]\n\t"
        "dec %[cnt]\n\t"
        "jle 2f\n\t"
        "1:\n\t"
        "vmovdqu 0(%[bp]), %%ymm12\n\t"
        "vmovdqu 4(%[bp]), %%ymm13\n\t"
        "vbroadcastsd 0(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm0, %%ymm0\n\t"
        "vpaddd %%ymm14, %%ymm1, %%ymm1\n\t"
        "vbroadcastsd 2112(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm2, %%ymm2\n\t"
        "vpaddd %%ymm14, %%ymm3, %%ymm3\n\t"
        "add $8, %[ap]\n\t"
        "add $32, %[bp]\n\t"
        "dec %[cnt]\n\t"
        "jnz 1b\n\t"
        "2:\n\t"
    ""
    : [ap] "+r"(ap), [bp] "+r"(bp), [cnt] "+r"(cnt), [v0] "=x"(v0), [v1] "=x"(v1), [v2] "=x"(v2), [v3] "=x"(v3)
    :
    : "ymm4", "ymm5", "ymm6", "ymm7",
      "ymm8", "ymm9", "ymm10", "ymm11", "ymm12", "ymm13", "ymm14", "ymm15", "cc", "memory");
  } else
  __asm__ volatile(
        "test %[cnt], %[cnt]\n\t"
        "jle 2f\n\t"
        "vmovdqu 0(%[bp]), %%ymm12\n\t"
        "vmovdqu 4(%[bp]), %%ymm13\n\t"
        "vbroadcastsd 0(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm0\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm1\n\t"
        "vbroadcastsd 2112(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm2\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm3\n\t"
        "vbroadcastsd 4224(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm4\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm5\n\t"
        "vbroadcastsd 6336(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm6\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm7\n\t"
        "vbroadcastsd 8448(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm8\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm9\n\t"
        "vbroadcastsd 10560(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm10\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm11\n\t"
        "prefetcht0 1024(%[bp])\n\t"
        "vmovdqu 32(%[bp]), %%ymm12\n\t"
        "add $8, %[ap]\n\t"
        "add $32, %[bp]\n\t"
        "dec %[cnt]\n\t"
        "jle 2f\n\t"
        "cmp $2, %[cnt]\n\t"
        "jl 3f\n\t"
        "1:\n\t"
        "vmovdqu 4(%[bp]), %%ymm13\n\t"
        "vbroadcastsd 0(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm0, %%ymm0\n\t"
        "vpaddd %%ymm14, %%ymm1, %%ymm1\n\t"
        "vbroadcastsd 2112(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm2, %%ymm2\n\t"
        "vpaddd %%ymm14, %%ymm3, %%ymm3\n\t"
        "vbroadcastsd 4224(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm4, %%ymm4\n\t"
        "vpaddd %%ymm14, %%ymm5, %%ymm5\n\t"
        "vbroadcastsd 6336(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm6, %%ymm6\n\t"
        "vpaddd %%ymm14, %%ymm7, %%ymm7\n\t"
        "vbroadcastsd 8448(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm8, %%ymm8\n\t"
        "vpaddd %%ymm14, %%ymm9, %%ymm9\n\t"
        "vbroadcastsd 10560(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm10, %%ymm10\n\t"
        "vpaddd %%ymm14, %%ymm11, %%ymm11\n\t"
        "prefetcht0 1024(%[bp])\n\t"
        "vmovdqu 32(%[bp]), %%ymm12\n\t"
        "vmovdqu 36(%[bp]), %%ymm13\n\t"
        "vbroadcastsd 8(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm0, %%ymm0\n\t"
        "vpaddd %%ymm14, %%ymm1, %%ymm1\n\t"
        "vbroadcastsd 2120(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm2, %%ymm2\n\t"
        "vpaddd %%ymm14, %%ymm3, %%ymm3\n\t"
        "vbroadcastsd 4232(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm4, %%ymm4\n\t"
        "vpaddd %%ymm14, %%ymm5, %%ymm5\n\t"
        "vbroadcastsd 6344(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm6, %%ymm6\n\t"
        "vpaddd %%ymm14, %%ymm7, %%ymm7\n\t"
        "vbroadcastsd 8456(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm8, %%ymm8\n\t"
        "vpaddd %%ymm14, %%ymm9, %%ymm9\n\t"
        "vbroadcastsd 10568(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm10, %%ymm10\n\t"
        "vpaddd %%ymm14, %%ymm11, %%ymm11\n\t"
        "prefetcht0 1056(%[bp])\n\t"
        "vmovdqu 64(%[bp]), %%ymm12\n\t"
        "add $16, %[ap]\n\t"
        "add $64, %[bp]\n\t"
        "sub $2, %[cnt]\n\t"
        "cmp $2, %[cnt]\n\t"
        "jge 1b\n\t"
        "3:\n\t"
        "test %[cnt], %[cnt]\n\t"
        "jle 2f\n\t"
        "vmovdqu 4(%[bp]), %%ymm13\n\t"
        "vbroadcastsd 0(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm0, %%ymm0\n\t"
        "vpaddd %%ymm14, %%ymm1, %%ymm1\n\t"
        "vbroadcastsd 2112(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm2, %%ymm2\n\t"
        "vpaddd %%ymm14, %%ymm3, %%ymm3\n\t"
        "vbroadcastsd 4224(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm4, %%ymm4\n\t"
        "vpaddd %%ymm14, %%ymm5, %%ymm5\n\t"
        "vbroadcastsd 6336(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm6, %%ymm6\n\t"
        "vpaddd %%ymm14, %%ymm7, %%ymm7\n\t"
        "vbroadcastsd 8448(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm8, %%ymm8\n\t"
        "vpaddd %%ymm14, %%ymm9, %%ymm9\n\t"
        "vbroadcastsd 10560(%[ap]), %%ymm14\n\t"
        "vpmuludq %%ymm14, %%ymm13, %%ymm15\n\t"
        "vpmulld %%ymm12, %%ymm14, %%ymm14\n\t"
        "vpaddq %%ymm15, %%ymm10, %%ymm10\n\t"
        "vpaddd %%ymm14, %%ymm11, %%ymm11\n\t"
        "prefetcht0 1024(%[bp])\n\t"
        "vmovdqu 32(%[bp]), %%ymm12\n\t"
        "2:\n\t"
    ""
    : [ap] "+r"(ap), [bp] "+r"(bp), [cnt] "+r"(cnt), [v0] "=x"(v0), [v1] "=x"(v1), [v2] "=x"(v2), [v3] "=x"(v3), [v4] "=x"(v4), [v5] "=x"(v5), [v6] "=x"(v6), [v7] "=x"(v7), [v8] "=x"(v8), [v9] "=x"(v9), [v10] "=x"(v10), [v11] "=x"(v11)
    :
    : "ymm12", "ymm13", "ymm14", "ymm15", "cc", "memory");
  if (rows > 0) {
    __m256i lo = v0, hi = v1;
    __m256i y = _mm256_add_epi32(hi, _mm256_srli_epi64(hi, 32));
    __m256i res = _mm256_add_epi64(lo, _mm256_slli_epi64(y, 32));
    long long *cp = c1 + (size_t)0 * ldc1;
    if (op1 == 0) STQ((__m256i *)cp, res);
    else if (op1 == 1) STQ((__m256i *)cp, _mm256_add_epi64(LDQ((const __m256i *)cp), res));
    else STQ((__m256i *)cp, _mm256_sub_epi64(LDQ((const __m256i *)cp), res));
    if (c2) { cp = c2 + (size_t)0 * ldc2;
      if (op2 == 0) STQ((__m256i *)cp, res);
      else if (op2 == 1) STQ((__m256i *)cp, _mm256_add_epi64(LDQ((const __m256i *)cp), res));
      else STQ((__m256i *)cp, _mm256_sub_epi64(LDQ((const __m256i *)cp), res)); } }
  if (rows > 1) {
    __m256i lo = v2, hi = v3;
    __m256i y = _mm256_add_epi32(hi, _mm256_srli_epi64(hi, 32));
    __m256i res = _mm256_add_epi64(lo, _mm256_slli_epi64(y, 32));
    long long *cp = c1 + (size_t)1 * ldc1;
    if (op1 == 0) STQ((__m256i *)cp, res);
    else if (op1 == 1) STQ((__m256i *)cp, _mm256_add_epi64(LDQ((const __m256i *)cp), res));
    else STQ((__m256i *)cp, _mm256_sub_epi64(LDQ((const __m256i *)cp), res));
    if (c2) { cp = c2 + (size_t)1 * ldc2;
      if (op2 == 0) STQ((__m256i *)cp, res);
      else if (op2 == 1) STQ((__m256i *)cp, _mm256_add_epi64(LDQ((const __m256i *)cp), res));
      else STQ((__m256i *)cp, _mm256_sub_epi64(LDQ((const __m256i *)cp), res)); } }
  if (rows > 2) {
    __m256i lo = v4, hi = v5;
    __m256i y = _mm256_add_epi32(hi, _mm256_srli_epi64(hi, 32));
    __m256i res = _mm256_add_epi64(lo, _mm256_slli_epi64(y, 32));
    long long *cp = c1 + (size_t)2 * ldc1;
    if (op1 == 0) STQ((__m256i *)cp, res);
    else if (op1 == 1) STQ((__m256i *)cp, _mm256_add_epi64(LDQ((const __m256i *)cp), res));
    else STQ((__m256i *)cp, _mm256_sub_epi64(LDQ((const __m256i *)cp), res));
    if (c2) { cp = c2 + (size_t)2 * ldc2;
      if (op2 == 0) STQ((__m256i *)cp, res);
      else if (op2 == 1) STQ((__m256i *)cp, _mm256_add_epi64(LDQ((const __m256i *)cp), res));
      else STQ((__m256i *)cp, _mm256_sub_epi64(LDQ((const __m256i *)cp), res)); } }
  if (rows > 3) {
    __m256i lo = v6, hi = v7;
    __m256i y = _mm256_add_epi32(hi, _mm256_srli_epi64(hi, 32));
    __m256i res = _mm256_add_epi64(lo, _mm256_slli_epi64(y, 32));
    long long *cp = c1 + (size_t)3 * ldc1;
    if (op1 == 0) STQ((__m256i *)cp, res);
    else if (op1 == 1) STQ((__m256i *)cp, _mm256_add_epi64(LDQ((const __m256i *)cp), res));
    else STQ((__m256i *)cp, _mm256_sub_epi64(LDQ((const __m256i *)cp), res));
    if (c2) { cp = c2 + (size_t)3 * ldc2;
      if (op2 == 0) STQ((__m256i *)cp, res);
      else if (op2 == 1) STQ((__m256i *)cp, _mm256_add_epi64(LDQ((const __m256i *)cp), res));
      else STQ((__m256i *)cp, _mm256_sub_epi64(LDQ((const __m256i *)cp), res)); } }
  if (rows > 4) {
    __m256i lo = v8, hi = v9;
    __m256i y = _mm256_add_epi32(hi, _mm256_srli_epi64(hi, 32));
    __m256i res = _mm256_add_epi64(lo, _mm256_slli_epi64(y, 32));
    long long *cp = c1 + (size_t)4 * ldc1;
    if (op1 == 0) STQ((__m256i *)cp, res);
    else if (op1 == 1) STQ((__m256i *)cp, _mm256_add_epi64(LDQ((const __m256i *)cp), res));
    else STQ((__m256i *)cp, _mm256_sub_epi64(LDQ((const __m256i *)cp), res));
    if (c2) { cp = c2 + (size_t)4 * ldc2;
      if (op2 == 0) STQ((__m256i *)cp, res);
      else if (op2 == 1) STQ((__m256i *)cp, _mm256_add_epi64(LDQ((const __m256i *)cp), res));
      else STQ((__m256i *)cp, _mm256_sub_epi64(LDQ((const __m256i *)cp), res)); } }
  if (rows > 5) {
    __m256i lo = v10, hi = v11;
    __m256i y = _mm256_add_epi32(hi, _mm256_srli_epi64(hi, 32));
    __m256i res = _mm256_add_epi64(lo, _mm256_slli_epi64(y, 32));
    long long *cp = c1 + (size_t)5 * ldc1;
    if (op1 == 0) STQ((__m256i *)cp, res);
    else if (op1 == 1) STQ((__m256i *)cp, _mm256_add_epi64(LDQ((const __m256i *)cp), res));
    else STQ((__m256i *)cp, _mm256_sub_epi64(LDQ((const __m256i *)cp), res));
    if (c2) { cp = c2 + (size_t)5 * ldc2;
      if (op2 == 0) STQ((__m256i *)cp, res);
      else if (op2 == 1) STQ((__m256i *)cp, _mm256_add_epi64(LDQ((const __m256i *)cp), res));
      else STQ((__m256i *)cp, _mm256_sub_epi64(LDQ((const __m256i *)cp), res)); } }
}

struct Opd {                 /* value(i,j) = sum_t s[t]*p[(r[t]+i)*ld + c[t]+j]  (nt <= 4) */
  const long long *p; int ld; int nt; int r[4], c[4], s[4];
};
static inline Opd oq(const Opd *o, int qi, int qj, int h) {
  Opd d = *o;
  for (int t = 0; t < o->nt; t++) { d.r[t] += qi * h; d.c[t] += qj * h; }
  return d;
}
static inline Opd oadd(const Opd *a, const Opd *b, int sgn) {
  Opd d = *a;
  for (int t = 0; t < b->nt; t++) { d.r[d.nt] = b->r[t]; d.c[d.nt] = b->c[t]; d.s[d.nt] = b->s[t] < 0 ? -sgn : sgn; d.nt++; }
  return d;
}
static inline Opd o1(const long long *p, int ld) {
  Opd d; d.p = p; d.ld = ld; d.nt = 1; d.r[0] = 0; d.c[0] = 0; d.s[0] = 1; return d;
}

/* A panel: rows [ic, ic+mc), k in [pc, pc+kc) of the operand */
static void packA(const Opd *o, int ic, int mc, int pc, int kc) {
  const int nt = o->nt;
  const long long *P = o->p; const int ld = o->ld;
  for (int r = 0; r < MC; r++) {
    long long *p = Apanel + (size_t)r * KCP;
    int k = 0;
    if (r < mc) {
      const long long *s0 = P + (size_t)(o->r[0] + ic + r) * ld + o->c[0] + pc;
      if (nt == 1 || nt == 2) {
        const long long *s1 = (nt == 2) ? P + (size_t)(o->r[1] + ic + r) * ld + o->c[1] + pc : 0;
        int sgn1 = (nt == 2) ? o->s[1] : 1;
        for (; k + 4 <= kc; k += 4) {
          __m256i v = LDQ((const __m256i *)(s0 + k));
          if (nt == 2) {
            __m256i w = LDQ((const __m256i *)(s1 + k));
            v = (sgn1 > 0) ? _mm256_add_epi64(v, w) : _mm256_sub_epi64(v, w);
          }
        STQ((__m256i *)p, v);
        p += 4;
        }
        for (; k < kc; k++) { long long v = s0[k];
          if (nt == 2) v = (sgn1 > 0) ? v + s1[k] : v - s1[k];
          *p++ = (v); }
      } else {
        for (; k + 4 <= kc; k += 4) {
          __m256i v = _mm256_setzero_si256();
          for (int t = 0; t < nt; t++) {
            __m256i w = LDQ((const __m256i *)(P + (size_t)(o->r[t] + ic + r) * ld + o->c[t] + pc + k));
            v = (o->s[t] < 0) ? _mm256_sub_epi64(v, w) : _mm256_add_epi64(v, w);
          }
          STQ((__m256i *)p, v);
          p += 4;
        }
        for (; k < kc; k++) {
          long long v = 0;
          for (int t = 0; t < nt; t++)
            v += o->s[t] < 0 ? -P[(size_t)(o->r[t] + ic + r) * ld + o->c[t] + pc + k]
                             :  P[(size_t)(o->r[t] + ic + r) * ld + o->c[t] + pc + k];
          *p++ = (v);
        }
      }
    }
    p += KC - k;   /* k >= kc is never read: mikro runs kc steps */
  }
}

static void packB(const Opd *o, int jc, int nc, int pc, int kc) {
  const int nt = o->nt;
  const long long *P = o->p; const int ld = o->ld;
  const int jbn = (nc + 3) & ~3;   /* mikro reads only jg < nc, step 4 */
  int jb = 0;
  /* ---- 8-column pass: the two 4-column groups jb and jb+4 share ONE 64-byte
     source line (the row stride is ld*8 bytes, so a 4-column load uses exactly
     half a line).  The 4-column loop walks all kc rows before returning to the
     neighbouring group, i.e. after kc strided accesses, so that line is long
     evicted and gets fetched a second time.  Taking both groups in one pass
     reads a full line per row per visit: source line fetches are halved.
     Panel layout is byte-identical (group jb sits at (jb/4)*KC). ---- */
  for (; jb + 16 <= nc; jb += 16) {
    long long *q0 = Bpanel + (size_t)(jb / 4) * kc * 4;
    long long *q1 = q0 + (size_t)kc * 4;
    long long *q2 = q1 + (size_t)kc * 4;
    long long *q3 = q2 + (size_t)kc * 4;
    if (nt <= 2) {
      const long long *s0 = P + (size_t)o->r[0] * ld + o->c[0] + jc + jb;
      const long long *s1 = (nt == 2) ? P + (size_t)o->r[1] * ld + o->c[1] + jc + jb : 0;
      const int sg1 = (nt == 2) ? o->s[1] : 1;
      for (int k = 0; k < kc; k++) {
        const long long *r0 = s0 + (size_t)(pc + k) * ld;
        __m256i v0 = LDQ((const __m256i *)(r0));
        __m256i v1 = LDQ((const __m256i *)(r0 + 4));
        __m256i v2 = LDQ((const __m256i *)(r0 + 8));
        __m256i v3 = LDQ((const __m256i *)(r0 + 12));
        if (nt == 2) {
          const long long *r1 = s1 + (size_t)(pc + k) * ld;
          __m256i w0 = LDQ((const __m256i *)(r1));
          __m256i w1 = LDQ((const __m256i *)(r1 + 4));
          __m256i w2 = LDQ((const __m256i *)(r1 + 8));
          __m256i w3 = LDQ((const __m256i *)(r1 + 12));
          if (sg1 > 0) { v0 = _mm256_add_epi64(v0, w0); v1 = _mm256_add_epi64(v1, w1);
                       v2 = _mm256_add_epi64(v2, w2); v3 = _mm256_add_epi64(v3, w3); }
          else         { v0 = _mm256_sub_epi64(v0, w0); v1 = _mm256_sub_epi64(v1, w1);
                       v2 = _mm256_sub_epi64(v2, w2); v3 = _mm256_sub_epi64(v3, w3); }
        }
        _mm256_store_si256((__m256i *)(q0 + (size_t)k * 4), _mm256_shuffle_epi32(v0, 0xB1));
        _mm256_store_si256((__m256i *)(q1 + (size_t)k * 4), _mm256_shuffle_epi32(v1, 0xB1));
        _mm256_store_si256((__m256i *)(q2 + (size_t)k * 4), _mm256_shuffle_epi32(v2, 0xB1));
        _mm256_store_si256((__m256i *)(q3 + (size_t)k * 4), _mm256_shuffle_epi32(v3, 0xB1));
      }
    } else {
      for (int k = 0; k < kc; k++) {
        __m256i v0 = _mm256_setzero_si256(), v1 = _mm256_setzero_si256();
        __m256i v2 = _mm256_setzero_si256(), v3 = _mm256_setzero_si256();
        for (int tt = 0; tt < nt; tt++) {
          const long long *r0 = P + (size_t)(o->r[tt] + pc + k) * ld + o->c[tt] + jc + jb;
          __m256i w0 = LDQ((const __m256i *)r0);
          __m256i w1 = LDQ((const __m256i *)(r0 + 4));
          __m256i w2 = LDQ((const __m256i *)(r0 + 8));
          __m256i w3 = LDQ((const __m256i *)(r0 + 12));
          if (o->s[tt] < 0) { v0 = _mm256_sub_epi64(v0, w0); v1 = _mm256_sub_epi64(v1, w1);
                               v2 = _mm256_sub_epi64(v2, w2); v3 = _mm256_sub_epi64(v3, w3); }
          else              { v0 = _mm256_add_epi64(v0, w0); v1 = _mm256_add_epi64(v1, w1);
                               v2 = _mm256_add_epi64(v2, w2); v3 = _mm256_add_epi64(v3, w3); }
        }
        _mm256_store_si256((__m256i *)(q0 + (size_t)k * 4), _mm256_shuffle_epi32(v0, 0xB1));
        _mm256_store_si256((__m256i *)(q1 + (size_t)k * 4), _mm256_shuffle_epi32(v1, 0xB1));
        _mm256_store_si256((__m256i *)(q2 + (size_t)k * 4), _mm256_shuffle_epi32(v2, 0xB1));
        _mm256_store_si256((__m256i *)(q3 + (size_t)k * 4), _mm256_shuffle_epi32(v3, 0xB1));
      }
    }
  }
  for (; jb < jbn; jb += 4) {
    long long *q = Bpanel + (size_t)(jb / 4) * kc * 4;
    int full = (jb + 4 <= nc);
    int lim = nc - jb; if (lim > 4) lim = 4; if (lim < 0) lim = 0;
    const long long *sq = P + (size_t)o->r[0] * ld + o->c[0] + jc + jb;
    const long long *sq1 = (nt >= 2) ? P + (size_t)o->r[1] * ld + o->c[1] + jc + jb : 0;
    if (full && nt <= 2) {
      for (int k = 0; k < kc; k++) {
        __m256i v = LDQ((const __m256i *)(sq + (size_t)(pc + k) * ld));
        if (nt == 2) {
          __m256i w = LDQ((const __m256i *)(sq1 + (size_t)(pc + k) * ld));
          v = (o->s[1] > 0) ? _mm256_add_epi64(v, w) : _mm256_sub_epi64(v, w);
        }
        _mm256_store_si256((__m256i *)(q + (size_t)k * 4), _mm256_shuffle_epi32(v, 0xB1));
      }
    } else if (full) {
      for (int k = 0; k < kc; k++) {
        __m256i v = _mm256_setzero_si256();
        for (int tt = 0; tt < nt; tt++) {
          __m256i w = LDQ((const __m256i *)(P + (size_t)(o->r[tt] + pc + k) * ld + o->c[tt] + jc + jb));
          v = (o->s[tt] < 0) ? _mm256_sub_epi64(v, w) : _mm256_add_epi64(v, w);
        }
        _mm256_store_si256((__m256i *)(q + (size_t)k * 4), _mm256_shuffle_epi32(v, 0xB1));
      }
    } else {
      for (int k = 0; k < KC; k++) {
        long long t[4] = {0, 0, 0, 0};
        if (k < kc) {
          int ncol = full ? 4 : lim;
          for (int c = 0; c < ncol; c++) {
            long long v = 0;
            for (int tt = 0; tt < nt; tt++)
              v += o->s[tt] < 0 ? -P[(size_t)(o->r[tt] + pc + k) * ld + o->c[tt] + jc + jb + c]
                                :  P[(size_t)(o->r[tt] + pc + k) * ld + o->c[tt] + jc + jb + c];
            t[c] = v;
          }
        }
        __m256i v = LDQ((const __m256i *)t);
        _mm256_store_si256((__m256i *)(q + (size_t)k * 4), _mm256_shuffle_epi32(v, 0xB1));
      }
    }
  }
}


static inline int effop(int base, int term) {   /* term: 1 = +M, 2 = -M ; result: 0 store 1 add 2 sub */
  if (base == 0) return term == 1 ? 0 : 2;
  if (base == 1) return term == 2 ? 2 : 1;
  return term == 2 ? 1 : 2;
}

/* C1 op1 (+- second destination C2 op2, either may be absent) = Ao * Bo, block size n */
static __attribute__((always_inline)) inline void leaf(int n, const Opd *Ao, const Opd *Bo,
                 long long *C1, int ldc1, int op1, long long *C2, int ldc2, int op2) {
  int nb4 = n - (n & 3);
  for (int jc = 0; jc < nb4; jc += NC) {
    int nc = (nb4 - jc < NC) ? (nb4 - jc) : NC;
    for (int pc = 0; pc < n; pc += KC) {
      int kc = (n - pc < KC) ? (n - pc) : KC;
      packB(Bo, jc, nc, pc, kc);
      int e1 = (pc == 0) ? op1 : (op1 == 2 ? 2 : 1);
      int e2 = (pc == 0) ? op2 : (op2 == 2 ? 2 : 1);
      for (int ic = 0; ic < n; ic += MC) {
        int mc = (n - ic < MC) ? (n - ic) : MC;
        packA(Ao, ic, mc, pc, kc);
        for (int ir = 0; ir < mc; ir += MR) {
          int rows = (mc - ir < MR) ? (mc - ir) : MR;
          const long long *ap = Apanel + (size_t)ir * KCP * 1;
          for (int jg = 0; jg < nc; jg += 4) {
            const long long *bp = Bpanel + (size_t)(jg / 4) * kc * 4;
            mikro(kc / UU, ap, bp, C1 + (size_t)(ic + ir) * ldc1 + jc + jg, ldc1, e1,
                  C2 ? C2 + (size_t)(ic + ir) * ldc2 + jc + jg : 0, ldc2, e2, rows);
          }
        }
      }
    }
  }
  for (int j = nb4; j < n; j++)
    for (int i = 0; i < n; i++) {
      unsigned long long acc = 0;
      for (int k = 0; k < n; k++) {
        long long av = 0, bv = 0;
        for (int t = 0; t < Ao->nt; t++)
          av += Ao->s[t] < 0 ? -Ao->p[(size_t)(Ao->r[t] + i) * Ao->ld + Ao->c[t] + k]
                             :  Ao->p[(size_t)(Ao->r[t] + i) * Ao->ld + Ao->c[t] + k];
        for (int t = 0; t < Bo->nt; t++)
          bv += Bo->s[t] < 0 ? -Bo->p[(size_t)(Bo->r[t] + k) * Bo->ld + Bo->c[t] + j]
                             :  Bo->p[(size_t)(Bo->r[t] + k) * Bo->ld + Bo->c[t] + j];
        acc += (unsigned long long)av * (unsigned long long)bv;
      }
      long long *cp = C1 + (size_t)i * ldc1 + j;
      if (op1 == 0) *cp = (long long)acc;
      else if (op1 == 1) *cp += (long long)acc;
      else *cp -= (long long)acc;
      if (C2) {
        long long *cq = C2 + (size_t)i * ldc2 + j;
        if (op2 == 0) *cq = (long long)acc;
        else if (op2 == 1) *cq += (long long)acc;
        else *cq -= (long long)acc;
      }
    }
}

/* recursive Strassen: C1 op1 op= Ao*Bo  and  C2 op2 op= Ao*Bo */
/* Scratch: one h*h product block per recursion level, carved from the tail of the
   buffer.  Only the levels that actually recurse consume space, so a walk of the
   recursion computes exactly the bytes matrix_multiply() hands us below. */
static long long g_scratch[6u * 1024u * 1024u] __attribute__((aligned(2097152)));

/* dst op= sign * T   (op: 0 store, 1 add, 2 sub) */
static void cmb(long long *dst, int ldd, const long long *T, int ldt, int h, int sign, int op) {
  __m256i sgn = _mm256_set1_epi64x(sign < 0 ? -1 : 0);
  for (int i = 0; i < h; i++) {
    const long long *t = T + (size_t)i * ldt;
    long long *c = dst + (size_t)i * ldd;
    int j = 0;
    if (op == 0) {
      for (; j + 4 <= h; j += 4) {
        __m256i v = LDQ((const __m256i *)(t + j));
        if (sign < 0) v = _mm256_sub_epi64(_mm256_setzero_si256(), v);
        STQ((__m256i *)(c + j), v);
      }
      for (; j < h; j++) c[j] = sign < 0 ? -t[j] : t[j];
    } else {
      for (; j + 4 <= h; j += 4) {
        __m256i v = LDQ((const __m256i *)(t + j));
        __m256i w = LDQ((const __m256i *)(c + j));
        if ((op == 1) != (sign < 0)) STQ((__m256i *)(c + j), _mm256_add_epi64(w, v));
        else                         STQ((__m256i *)(c + j), _mm256_sub_epi64(w, v));
      }
      for (; j < h; j++) { if ((op == 1) != (sign < 0)) c[j] += t[j]; else c[j] -= t[j]; }
    }
  }
}

/* Reuse one pair of temporary 1024-square operands across depth-first leaves. */
static long long material_A[1024u * 1024u] __attribute__((aligned(2097152)));
static long long material_B[1024u * 1024u] __attribute__((aligned(2097152)));
/* 512 级物化的目的地:必须与 material_A/B 分开 —— 1024 级钩子的递归仍在读 material_A/B。 */
static long long material_C[512u * 512u] __attribute__((aligned(2097152)));
static long long material_D[512u * 512u] __attribute__((aligned(2097152)));
static void materializeN(const Opd *o, long long *dst, const int n) {
  for (int i = 0; i < n; i++) {
    long long *out = dst + (size_t)i * n;
    int j = 0;
    for (; j + 4 <= n; j += 4) {
      __m256i value = _mm256_setzero_si256();
      for (int t = 0; t < o->nt; t++) {
        const long long *src = o->p + (size_t)(o->r[t] + i) * o->ld + o->c[t] + j;
        __m256i part = LDQ((const __m256i *)src);
        value = o->s[t] < 0 ? _mm256_sub_epi64(value, part) : _mm256_add_epi64(value, part);
      }
      STQ((__m256i *)(out + j), value);
    }
    for (; j < n; j++) {
      unsigned long long value = 0;
      for (int t = 0; t < o->nt; t++) {
        unsigned long long part = (unsigned long long)o->p[(size_t)(o->r[t] + i) * o->ld + o->c[t] + j];
        value = o->s[t] < 0 ? value - part : value + part;
      }
      out[j] = (long long)value;
    }
  }
}

/* single-destination recursive Strassen: d op= Ao*Bo, with T a scratch block of h*h */
static void mmxR(int n, const Opd *Ao, const Opd *Bo, long long *d, int ld, int op,
                 long long *T) {
  if (n == 1024 && (Ao->nt > 1 || Bo->nt > 1)) {
    Opd am, bm; const Opd *a = Ao, *b = Bo;
    if (Ao->nt > 1) { materializeN(Ao, material_A, 1024); am = o1(material_A, n); a = &am; }
    if (Bo->nt > 1) { materializeN(Bo, material_B, 1024); bm = o1(material_B, n); b = &bm; }
    mmxR(n, a, b, d, ld, op, T);
    return;
  }
  if (n <= CUTL || (n & 1) || Ao->nt > 2 || Bo->nt > 2) {
    leaf(n, Ao, Bo, d, ld, op, 0, 0, 0); return; }
  /* n == 512 且本次**本来就会递归**(守卫已过 ⇒ nt <= 2、n > CUTL)时,先把惰性操作数
     物化成 512^2 连续矩阵再递归。语义恒等(mod 2^64 下加法可结合),但 h=256 那一层的描述符
     nt 从 {2,4} 掉到 {2} ⇒ **每个 256 叶的 pack 源读项数减半**(pack 流量 ≈ −2 MB/叶)。 */
  if (n == 512 && (Ao->nt > 1 || Bo->nt > 1)) {
    Opd am, bm; const Opd *a = Ao, *b = Bo;
    if (Ao->nt > 1) { materializeN(Ao, material_C, 512); am = o1(material_C, 512); a = &am; }
    if (Bo->nt > 1) { materializeN(Bo, material_D, 512); bm = o1(material_D, 512); b = &bm; }
    mmxR(n, a, b, d, ld, op, T);
    return;
  }
  const int h = n >> 1;
  Opd A11 = oq(Ao, 0, 0, h), A12 = oq(Ao, 0, 1, h), A21 = oq(Ao, 1, 0, h), A22 = oq(Ao, 1, 1, h);
  Opd B11 = oq(Bo, 0, 0, h), B12 = oq(Bo, 0, 1, h), B21 = oq(Bo, 1, 0, h), B22 = oq(Bo, 1, 1, h);
  long long *Q[4];
  Q[0] = d; Q[1] = d + h; Q[2] = d + (size_t)h * ld; Q[3] = Q[2] + h;
  long long *T2 = T + (size_t)h * h;
  int wr[4] = {0, 0, 0, 0};
#define MK(qi, si, qj, sj, Ma, Mb) do { \
    int oa = wr[qi] ? effop(1, (si)) : effop(op, (si)); \
    int ob = wr[qj] ? effop(1, (sj)) : effop(op, (sj)); \
    wr[qi] = 1; wr[qj] = 1; \
    if (oa == 0) { \
      mmxR(h, &(Ma), &(Mb), Q[qi], ld, 0, T); \
      cmb(Q[qj], ld, Q[qi], ld, h, (sj), ob); \
    } else { \
      mmxR(h, &(Ma), &(Mb), T, h, 0, T2); \
      cmb(Q[qi], ld, T, h, h, (si), oa); \
      cmb(Q[qj], ld, T, h, h, (sj), ob); \
    } \
  } while (0) \

#define MK1(qi, si, Ma, Mb) do { \
    int oa = wr[qi] ? effop(1, (si)) : effop(op, (si)); \
    wr[qi] = 1; \
    mmxR(h, &(Ma), &(Mb), Q[qi], ld, oa, T); \
  } while (0)
  { /* M1 = (A11+A22)(B11+B22) -> +C11, +C22 */
    Opd Ma = oadd(&A11, &A22, 1), Mb = oadd(&B11, &B22, 1);
    MK(0, 1, 3, 1, Ma, Mb);
  }
  { /* M2 = (A21+A22)B11 -> +C21, -C22 */
    Opd Ma = oadd(&A21, &A22, 1), Mb = B11;
    MK(2, 1, 3, 2, Ma, Mb);
  }
  { /* M3 = A11(B12-B22) -> +C12, +C22 */
    Opd Ma = A11, Mb = oadd(&B12, &B22, -1);
    MK(1, 1, 3, 1, Ma, Mb);
  }
  { /* M4 = A22(B21-B11) -> +C11, +C21 */
    Opd Ma = A22, Mb = oadd(&B21, &B11, -1);
    MK(0, 1, 2, 1, Ma, Mb);
  }
  { /* M5 = (A11+A12)B22 -> -C11, +C12 */
    Opd Ma = oadd(&A11, &A12, 1), Mb = B22;
    MK(0, 2, 1, 1, Ma, Mb);
  }
  { /* M6 = (A21-A11)(B11+B12) -> +C22 */
    Opd Ma = oadd(&A21, &A11, -1), Mb = oadd(&B11, &B12, 1);
    MK1(3, 1, Ma, Mb);
  }
  { /* M7 = (A12-A22)(B21+B22) -> +C11 */
    Opd Ma = oadd(&A12, &A22, -1), Mb = oadd(&B21, &B22, 1);
    MK1(0, 1, Ma, Mb);
  }
#undef MK
#undef MK1
}

static inline __m256i wg_load(const long long *p) { return LDQ((const __m256i *)p); }
static inline void wg_store(long long *p, __m256i v) { STQ((__m256i *)p, v); }

static long long wg_buf[5 * 2048 * 2048 + 4 * 512] __attribute__((aligned(2097152)));

static void wg_add(int h, long long *dst, const long long *a, int lda,
                   const long long *b, int ldb, int sg) {
  for (int i = 0; i < h; i++) {
    long long *d = dst + (size_t)i*h;
    const long long *x = a + (size_t)i*lda, *y = b + (size_t)i*ldb;
    for (int j = 0; j < h; j += 4) {
      __m256i vx=wg_load(x+j), vy=wg_load(y+j);
      wg_store(d+j, sg > 0 ? _mm256_add_epi64(vx,vy) : _mm256_sub_epi64(vx,vy));
    }
  }
}
/* [SCHAIN] d1 = A21+A22, d2 = A21+A22-A11, d3 = A11-A21, one pass (mod 2^64, exact). */
static void wg_schain3(int h, long long *d1, long long *d2, long long *d3,
                       const long long *a11, int ld11, const long long *a21, int ld21,
                       const long long *a22, int ld22) {
  for (int i = 0; i < h; i++) {
    long long *p1 = d1 + (size_t)i*h, *p2 = d2 + (size_t)i*h, *p3 = d3 + (size_t)i*h;
    const long long *x11 = a11 + (size_t)i*ld11, *x21 = a21 + (size_t)i*ld21, *x22 = a22 + (size_t)i*ld22;
    for (int j = 0; j < h; j += 4) {
      __m256i v11 = wg_load(x11+j), v21 = wg_load(x21+j), v22 = wg_load(x22+j);
      __m256i s1 = _mm256_add_epi64(v21, v22);
      wg_store(p1+j, s1);
      wg_store(p2+j, _mm256_sub_epi64(s1, v11));
      wg_store(p3+j, _mm256_sub_epi64(v11, v21));
    }
  }
}
/* d = a - b (mod 2^64) */
static void wg_sub2(int h, long long *d, const long long *a, int lda, const long long *b, int ldb) {
  for (int i = 0; i < h; i++) {
    long long *dd = d + (size_t)i*h;
    const long long *x = a + (size_t)i*lda, *y = b + (size_t)i*ldb;
    for (int j = 0; j < h; j += 4)
      wg_store(dd+j, _mm256_sub_epi64(wg_load(x+j), wg_load(y+j)));
  }
}
static void wg_mutate(int h, long long *dst, const long long *b, int ldb, int reverse) {
  for (int i = 0; i < h; i++) {
    long long *d = dst + (size_t)i*h; const long long *y=b+(size_t)i*ldb;
    for (int j=0; j<h; j+=4) {
      __m256i vd=wg_load(d+j),vy=wg_load(y+j);
      wg_store(d+j, reverse ? _mm256_sub_epi64(vy,vd) : _mm256_sub_epi64(vd,vy));
    }
  }
}
static void wg_combine(int h, long long *C, int ldc, const long long *M1,
                       const long long *M2, const long long *M3, const long long *M4,
                       const long long *M5, const long long *M6, const long long *M7) {
  for (int i=0; i<h; i++) {
    const long long *a=M1+(size_t)i*ldc,*b=M2+(size_t)i*ldc,*c=M3+(size_t)i*ldc;
    const long long *d=M4+(size_t)i*ldc,*e=M5+(size_t)i*h,*f=M6+(size_t)i*h,*g=M7+(size_t)i*h;
    long long *c11=C+(size_t)i*ldc,*c12=c11+h,*c21=c11+(size_t)h*ldc,*c22=c21+h;
    for (int j=0; j<h; j+=4) {
      __m256i p1=wg_load(a+j),p2=wg_load(b+j),p3=wg_load(c+j),p4=wg_load(d+j);
      __m256i p5=wg_load(e+j),p6=wg_load(f+j),p7=wg_load(g+j);
      __m256i u2=_mm256_add_epi64(p1,p6),u3=_mm256_add_epi64(u2,p7);
      __m256i u4=_mm256_add_epi64(u2,p5);
      wg_store(c11+j,_mm256_add_epi64(p1,p2));
      wg_store(c12+j,_mm256_add_epi64(u4,p3));
      wg_store(c21+j,_mm256_sub_epi64(u3,p4));
      wg_store(c22+j,_mm256_add_epi64(u3,p5));
    }
  }
}

static long long wg_buf_mini[5 * 64 * 64 + 4 * 512] __attribute__((aligned(2097152)));
static void winograd_prod128(int n, const long long *A, int lda, const long long *B,
                             int ldb, long long *C, int ldc) {
  const int h=n/2; const size_t sz=(size_t)h*h;
  long long *M1=C,*M2=C+h,*M3=C+(size_t)h*ldc,*M4=M3+h;
  long long *M5=wg_buf_mini,*M6=M5+sz+512,*M7=M6+sz+512;
  Opd A0=o1(A,lda), B0=o1(B,ldb);
  Opd A11=oq(&A0,0,0,h), A12=oq(&A0,0,1,h), A21=oq(&A0,1,0,h), A22=oq(&A0,1,1,h);
  Opd B11=oq(&B0,0,0,h), B12=oq(&B0,0,1,h), B21=oq(&B0,1,0,h), B22=oq(&B0,1,1,h);
  Opd P1=oadd(&A11,&A22,1), Q1=oadd(&B11,&B22,1);   /* M1=(A11+A22)(B11+B22) */
  Opd P2=oadd(&A21,&A22,1), Q2=B11;                 /* M2=(A21+A22)B11       */
  Opd P3=A11,               Q3=oadd(&B12,&B22,-1);  /* M3=A11(B12-B22)       */
  Opd P4=A22,               Q4=oadd(&B21,&B11,-1);  /* M4=A22(B21-B11)       */
  Opd P5=oadd(&A11,&A12,1), Q5=B22;                 /* M5=(A11+A12)B22       */
  Opd P6=oadd(&A21,&A11,-1),Q6=oadd(&B11,&B12,1);   /* M6=(A21-A11)(B11+B12) */
  Opd P7=oadd(&A12,&A22,-1),Q7=oadd(&B21,&B22,1);   /* M7=(A12-A22)(B21+B22) */
#define PRODO(AO,BO,Z,LZ) do { Opd a_=(AO),b_=(BO); \
    mmxR(h,&a_,&b_,(Z),(LZ),0,g_scratch+((size_t)1<<20)); } while(0)
  PRODO(P6,Q6,M6,h); PRODO(P5,Q5,M5,h); PRODO(P7,Q7,M7,h); PRODO(P2,Q2,M2,ldc); PRODO(P1,Q1,M1,ldc); PRODO(P4,Q4,M4,ldc); PRODO(P3,Q3,M3,ldc);
#undef PRODO
  for (int i=0;i<h;i++) {
    const long long *m1=M1+(size_t)i*ldc,*m2=M2+(size_t)i*ldc,*m3=M3+(size_t)i*ldc,*m4=M4+(size_t)i*ldc;
    const long long *m5=M5+(size_t)i*h,*m6=M6+(size_t)i*h,*m7=M7+(size_t)i*h;
    long long *c11=C+(size_t)i*ldc,*c12=c11+h,*c21=c11+(size_t)h*ldc,*c22=c21+h;
    for (int j=0;j<h;j+=4) {
      __m256i p1=wg_load(m1+j),p2=wg_load(m2+j),p3=wg_load(m3+j),p4=wg_load(m4+j);
      __m256i p5=wg_load(m5+j),p6=wg_load(m6+j),p7=wg_load(m7+j);
      wg_store(c11+j,_mm256_add_epi64(_mm256_sub_epi64(_mm256_add_epi64(p1,p4),p5),p7));
      wg_store(c12+j,_mm256_add_epi64(p3,p5));
      wg_store(c21+j,_mm256_add_epi64(p2,p4));
      wg_store(c22+j,_mm256_add_epi64(_mm256_add_epi64(_mm256_sub_epi64(p1,p2),p3),p6));
    }
  }
}


/* ---- materialised 256-square Winograd product level ----------------------------
   Each 256-square product is split into seven 128-square ones (M1..M4 in the
   destination's own quadrants, M5..M7/P/Q in scratch carved from the head of
   g_scratch).  The seven 128-square products are plain leaf(128) mikro calls.
   g_scratch is dead storage at n=4096: the only other users are mmxR's T argument
   (never read on the leaf path, and 128 <= CUTL always takes it) and
   matrix_multiply's n != 4096 fallback, which the judge's n=4096 never reaches. */
#define WG256_SZ (128*128)
/* [l4q-PACK-81] Minimal-viable measurement (approved scope = ONLY lda==4096, 81 calls) of the "relayout A" lead.
   Rationale (BRIEF 2.19.1176): the shape arm contrasted stride 4096 vs 256 on ALL blocks, but the
   live engine already runs 56.24% of winograd_prod256's time at stride 256 (via the existing
   materializeN/material_C machinery); only 3.50% is still at 4096.  This wrapper densifies A for
   EXACTLY those calls: winograd_prod256(n) only ever reads its own 2h x 2h (= n x n) operand block,
   so copying that block into a dense n-stride scratch is value-identical (hence BIT-EXACT) and the
   four quadrants then form correctly with lda = n.  B is deliberately left alone (single variable). */
static void winograd_prod256_inner(int n, const long long *A, int lda, const long long *B,
                             int ldb, long long *C, int ldc);
static long long l4q_apack[256 * 256] __attribute__((aligned(4096)));
static void winograd_prod256(int n, const long long *A, int lda, const long long *B,
                             int ldb, long long *C, int ldc) {
  if (lda != 4096) {   /* [l4q-PACK-81] EXACT approved scope: only the 81 calls with lda==4096 */
    winograd_prod256_inner(n, A, lda, B, ldb, C, ldc);
    return;
  }
  for (int i = 0; i < n; i++) {
    const long long *src = A + (size_t)i * lda; long long *dst = l4q_apack + (size_t)i * n;
    for (int j = 0; j < n; j++) dst[j] = src[j];
  }
  winograd_prod256_inner(n, l4q_apack, n, B, ldb, C, ldc);
}
static void winograd_prod256_inner(int n, const long long *A, int lda, const long long *B,
                             int ldb, long long *C, int ldc) {
  const int h=n/2; const size_t sz=(size_t)h*h;
  long long *M1=C,*M2=C+h,*M3=C+(size_t)h*ldc,*M4=M3+h;
  long long *M5=g_scratch,*M6=M5+sz+512,*M7=M6+sz+512,*P=M7+sz+512,*Q=P+sz+512;
  const long long *A11=A,*A12=A+h,*A21=A+(size_t)h*lda,*A22=A21+h;
  const long long *B11=B,*B12=B+h,*B21=B+(size_t)h*ldb,*B22=B21+h;
#define PROD4(X,Y,Z,LX,LY,LZ) do { Opd ao=o1((X),(LX)),bo=o1((Y),(LY)); \
    winograd_prod128(h,(X),(LX),(Y),(LY),(Z),(LZ)); } while(0)
  PROD4(A11,B11,M1,lda,ldb,ldc);
  PROD4(A12,B21,M2,lda,ldb,ldc);
  wg_add(h,P,A21,lda,A22,lda,+1);
  wg_add(h,Q,B12,ldb,B11,ldb,-1);
  PROD4(P,Q,M5,h,h,h);
  wg_mutate(h,P,A11,lda,0);
  wg_mutate(h,Q,B22,ldb,1);
  PROD4(P,Q,M6,h,h,h);
  wg_mutate(h,P,A12,lda,1);
  PROD4(P,B22,M3,h,ldb,ldc);
  wg_mutate(h,Q,B21,ldb,0);
  PROD4(A22,Q,M4,lda,h,ldc);
  wg_add(h,P,A11,lda,A21,lda,-1);
  wg_add(h,Q,B22,ldb,B12,ldb,-1);
  PROD4(P,Q,M7,h,h,h);
#undef PROD4
  wg_combine(h,C,ldc,M1,M2,M3,M4,M5,M6,M7);
}

static long long wg_buf2[5 * 1024 * 1024 + 4 * 512] __attribute__((aligned(2097152)));
static long long wg_buf_s2[2 * 2048 * 2048 + 2 * 512] __attribute__((aligned(2097152)));
static long long wg_buf2_s2[2 * 1024 * 1024 + 2 * 512] __attribute__((aligned(2097152)));
static long long wg_buf1[5 * 512 * 512 + 4 * 256] __attribute__((aligned(2097152)));
static long long wg_buf0[5 * 256 * 256 + 4 * 512] __attribute__((aligned(2097152)));
static void winograd_leaf512(int n, const long long *A, int lda, const long long *B, int ldb,
                           long long *C, int ldc) {
  const int h=n/2; const size_t sz=(size_t)h*h;
  long long *M1=C,*M2=C+h,*M3=C+(size_t)h*ldc,*M4=M3+h;
  long long *M5=wg_buf0,*M6=M5+sz+512,*M7=M6+sz+512,*P=M7+sz+512,*Q=P+sz+512;
  const long long *A11=A,*A12=A+h,*A21=A+(size_t)h*lda,*A22=A21+h;
  const long long *B11=B,*B12=B+h,*B21=B+(size_t)h*ldb,*B22=B21+h;
#define PROD3(X,Y,Z,LX,LY,LZ) do { winograd_prod256(h,(X),(LX),(Y),(LY),(Z),(LZ)); } while(0)
  PROD3(A11,B11,M1,lda,ldb,ldc);
  PROD3(A12,B21,M2,lda,ldb,ldc);
  wg_add(h,P,A21,lda,A22,lda,+1);
  wg_add(h,Q,B12,ldb,B11,ldb,-1);
  PROD3(P,Q,M5,h,h,h);
  wg_mutate(h,P,A11,lda,0);
  wg_mutate(h,Q,B22,ldb,1);
  PROD3(P,Q,M6,h,h,h);
  wg_mutate(h,P,A12,lda,1);
  PROD3(P,B22,M3,h,ldb,ldc);
  wg_mutate(h,Q,B21,ldb,0);
  PROD3(A22,Q,M4,lda,h,ldc);
  wg_add(h,P,A11,lda,A21,lda,-1);
  wg_add(h,Q,B22,ldb,B12,ldb,-1);
  PROD3(P,Q,M7,h,h,h);
#undef PROD3
  wg_combine(h,C,ldc,M1,M2,M3,M4,M5,M6,M7);
}

static void winograd_grandchild(int n, const long long *A, int lda, const long long *B, int ldb,
                           long long *C, int ldc) {
  const int h=n/2; const size_t sz=(size_t)h*h;
  long long *M1=C,*M2=C+h,*M3=C+(size_t)h*ldc,*M4=M3+h;
  long long *M5=wg_buf1,*M6=M5+sz+256,*M7=M6+sz+256,*P=M7+sz+256,*Q=P+sz+256;
  const long long *A11=A,*A12=A+h,*A21=A+(size_t)h*lda,*A22=A21+h;
  const long long *B11=B,*B12=B+h,*B21=B+(size_t)h*ldb,*B22=B21+h;
#define PROD3(X,Y,Z,LX,LY,LZ) do { winograd_leaf512(h,(X),(LX),(Y),(LY),(Z),(LZ)); } while(0)
  PROD3(A11,B11,M1,lda,ldb,ldc);
  PROD3(A12,B21,M2,lda,ldb,ldc);
  wg_add(h,P,A21,lda,A22,lda,+1);
  wg_add(h,Q,B12,ldb,B11,ldb,-1);
  PROD3(P,Q,M5,h,h,h);
  wg_mutate(h,P,A11,lda,0);
  wg_mutate(h,Q,B22,ldb,1);
  PROD3(P,Q,M6,h,h,h);
  wg_mutate(h,P,A12,lda,1);
  PROD3(P,B22,M3,h,ldb,ldc);
  wg_mutate(h,Q,B21,ldb,0);
  PROD3(A22,Q,M4,lda,h,ldc);
  wg_add(h,P,A11,lda,A21,lda,-1);
  wg_add(h,Q,B22,ldb,B12,ldb,-1);
  PROD3(P,Q,M7,h,h,h);
#undef PROD3
  wg_combine(h,C,ldc,M1,M2,M3,M4,M5,M6,M7);
}

static void winograd_child(int n, const long long *A, int lda, const long long *B, int ldb,
                           long long *C, int ldc) {
  const int h=n/2; const size_t sz=(size_t)h*h;
  long long *M1=C,*M2=C+h,*M3=C+(size_t)h*ldc,*M4=M3+h;
  long long *M5=wg_buf2,*M6=M5+sz+512,*M7=M6+sz+512,*P=M7+sz+512,*Q=P+sz+512;
  long long *P2=wg_buf2_s2,*P3=P2+sz+512;
  const long long *A11=A,*A12=A+h,*A21=A+(size_t)h*lda,*A22=A21+h;
  const long long *B11=B,*B12=B+h,*B21=B+(size_t)h*ldb,*B22=B21+h;
#define PROD2(X,Y,Z,LX,LY,LZ) do { winograd_grandchild(h,(X),(LX),(Y),(LY),(Z),(LZ)); } while(0)
  PROD2(A11,B11,M1,lda,ldb,ldc);
  PROD2(A12,B21,M2,lda,ldb,ldc);
  wg_schain3(h,P,P2,P3,A11,lda,A21,lda,A22,lda);
  wg_add(h,Q,B12,ldb,B11,ldb,-1);
  PROD2(P,Q,M5,h,h,h);
  wg_mutate(h,Q,B22,ldb,1);
  PROD2(P2,Q,M6,h,h,h);
  wg_sub2(h,P,A12,lda,P2,h);   /* P2 is a contiguous h x h block */
  PROD2(P,B22,M3,h,ldb,ldc);
  wg_mutate(h,Q,B21,ldb,0);
  PROD2(A22,Q,M4,lda,h,ldc);
  wg_add(h,Q,B22,ldb,B12,ldb,-1);
  PROD2(P3,Q,M7,h,h,h);
#undef PROD2
  wg_combine(h,C,ldc,M1,M2,M3,M4,M5,M6,M7);
}

static void winograd_top(int n, const long long *A, const long long *B, long long *C) {
  const int h=n/2; const size_t sz=(size_t)h*h;
  long long *M1=C,*M2=C+h,*M3=C+(size_t)h*n,*M4=M3+h;
  long long *M5=wg_buf,*M6=M5+sz+512,*M7=M6+sz+512,*P=M7+sz+512,*Q=P+sz+512;
  const long long *A11=A,*A12=A+h,*A21=A+(size_t)h*n,*A22=A21+h;
  const long long *B11=B,*B12=B+h,*B21=B+(size_t)h*n,*B22=B21+h;
#define PROD(X,Y,Z,LX,LY,LZ) do { winograd_child(h,(X),(LX),(Y),(LY),(Z),(LZ)); } while(0)
  PROD(A11,B11,M1,n,n,n);
  PROD(A12,B21,M2,n,n,n);
  wg_add(h,P,A21,n,A22,n,+1);             // S1
  wg_add(h,Q,B12,n,B11,n,-1);             // T1
  PROD(P,Q,M5,h,h,h);
  wg_mutate(h,P,A11,n,0);                 // S2 = S1 - A11
  wg_mutate(h,Q,B22,n,1);                 // T2 = B22 - T1
  PROD(P,Q,M6,h,h,h);
  wg_mutate(h,P,A12,n,1);                 // S4 = A12 - S2
  PROD(P,B22,M3,h,n,n);
  wg_mutate(h,Q,B21,n,0);                 // T4 = T2 - B21
  PROD(A22,Q,M4,n,h,n);
  wg_add(h,P,A11,n,A21,n,-1);             // S3
  wg_add(h,Q,B22,n,B12,n,-1);             // T3
  PROD(P,Q,M7,h,h,h);
#undef PROD
  wg_combine(h,C,n,M1,M2,M3,M4,M5,M6,M7);
}


static inline void advise_huge(void *p,size_t bytes){
  uintptr_t a=(uintptr_t)p,e=a+bytes;
  uintptr_t h0=(a+2097151u)&~(uintptr_t)2097151u;
  uintptr_t h1=e&~(uintptr_t)2097151u;
  if(h1>h0) madvise((void*)h0,(size_t)(h1-h0),MADV_HUGEPAGE);
}
__attribute__((constructor)) static void setup_huge_scratch(){
  advise_huge(wg_buf,sizeof(wg_buf));
  advise_huge(wg_buf2,sizeof(wg_buf2));
  advise_huge(wg_buf1,sizeof(wg_buf1));
  advise_huge(wg_buf0,sizeof(wg_buf0));
  advise_huge(g_scratch,sizeof(g_scratch));
  advise_huge(material_A,sizeof(material_A));
  advise_huge(material_B,sizeof(material_B));
  advise_huge(material_C,sizeof(material_C));
  advise_huge(material_D,sizeof(material_D));
  advise_huge(Bpanel,sizeof(Bpanel));
}
static_assert(sizeof(long long)==8,"l4z3a4");
void matrix_multiply(int n, const long long *A, const long long *B, long long *C) {
  Opd Ao = o1(A, n), Bo = o1(B, n);
  if (n <= CUTL || (n & 1)) { leaf(n, &Ao, &Bo, C, n, 0, 0, 0, 0); return; }
  if (n == 4096) winograd_top(n, A, B, C);
  else mmxR(n, &Ao, &Bo, C, n, 0, g_scratch);
}
#pragma GCC pop_options

__attribute__((weak)) int main() { return 0; }

CompilationN/AN/ACompile OKScore: N/A

Testcase #15.365 s357 MB + 800 KBAcceptedScore: 100


Judge Duck Online | 评测鸭在线
Server Time: 2026-10-02 22:30:50 | Loaded in 1 ms | Server Status
个人娱乐项目,仅供学习交流使用 | 捐赠