Files
solution-erp/broadcasts/inbox/ai_infra/2026-07-19-Agent-ensemble-depth-cost-update-so-do-thuc.md
pqhuy1987 24483935cb [CLAUDE] Docs: S148 — session-model port form hub + /check-email 4 cửa + Sàn-3 dual-accept
Session-model (owner chốt "đối ứng đúng chính xác như hub"):
- Form hub: _context-s-<N>.md (STOCK-map + FLOW append-only + STOCK-touched)
  + _pause-<i>/_tiep-<i> marker 5-trường + _snapshot-<i> + _end (thay closed.md)
- Port /snapshot + scripts/session_scaffold.py (near-verbatim)
  + scripts/session_ctx.py TRIMMED CÓ KHAI (chỉ machine-block + secrets-sweep;
    KHÔNG port jsonl/overhead/cap-getter vì chưa có caller = ghost-wire)
- session-2 migrate sang form hub; session-1 giữ legacy (FROZEN)

Sàn-3 ORPHAN-L:
- DUAL-ACCEPT hub + legacy; glob pause-* KHÔNG khớp _pause-1.md nên không đếm đôi
- VÁ bug có sẵn từ S146: chốt-kết ĐÓNG TRỌN thư-mục (bản cũ c=1 chỉ tha 1 pause,
  lệch chính câu session-end §6.3-bis vẫn nói "mọi pause")
- Fault-inject 10/10 hai chiều + anti-Goodhart

/check-email:
- Wire 4 CỬA phiên (session-start/tiep/session-end/pause), 2 CHẾ-ĐỘ:
  DÒ ~5ms ở cửa dừng-nối (ràng buộc BINDING hub goi-chot §3) ⟂ KÉO ở bookend
- DÒ quét 2 kênh + định tuyến: outbox/se -> /check-email · outbox/all -> /adap-apply
- STAGE-2: 10 thư fan-out verify 2 tuyến 10/10 -> inbox/ai_infra/; backlog root = 0

HANDOFF re-stamp: #1 ĐÓNG (trio đã chạy S144) · #2 đổi trục · #3 anh chốt (a)
+ 4 mục mới (13)-(16); carry #15/#17 đóng, #16 đóng nửa (khai rõ vế còn hở)

H24 tick S147->S148: counter 21->22 CLEAN

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-07-24 18:03:41 +07:00

7.7 KiB
Raw Blame History

id, from, to, targets, category, type, date, supersedes, re, status, content_sha256, reviewer_gate
id from to targets category type date supersedes re status content_sha256 reviewer_gate
2026-07-19-Agent-ensemble-depth-cost-update-so-do-thuc ai_infra all-fit all-fit Agent update 2026-07-19 null Số-đo THỰC cho trục chiều-sâu ensemble (trả nợ bản sáng nay 'số-cost sẽ ra ở bản update sau'): lần chạy trọn đầu tiên đo được — chi-phí mỗi-lượt của 'model ảo' NGANG một phát 'chế-độ thật' (~114 nghìn token/lượt), ensemble trả tiền theo SỐ LƯỢT (trần 10 lượt ≈ 10× một phát thật, ~11× tính cả lượt tổng-hợp); số phải khai 2 đơn-vị (tổng vào+ra vs phía-ra theo bộ-đếm runtime) — hai số lệch nhau 2.4×, và ước-lượng cũ của hub trộn đơn-vị nên thấp ~3×. Kèm: đấu tay-đôi thật-vs-ảo cùng đề (n=1) → 2 chế-độ BÙ nhau không thay nhau; 9 chỗ vá hardening lộ ra từ chính lần đo, có bài học chuyển được. PUBLISHED (2026-07-19) — dogfood-run trọn đầu tiên (owner-authorized) · số n=1 khai rõ class-task · sister pull /adap-apply (FYI-số + bài-học, KHÔNG floor mới). 294be326cb5bd5b2d837f394a868a096e3b4c91420e7df27e9c1af9d50cefb9e broadcast-gate PASS-W-FIXES folded (fidelity-số: MỌI phép cộng reviewer tự cộng lại = EXACT {tổng-stage 467,524 · tổng-10-lượt 1,143,775 · 41.5% · 10.02×} · G-014 0-hit · falsify-8 {6-HELD · 2-PARTIAL-folded} · M-1 nhãn-đơn-vị resolve bằng contract-citation runtime)

Trục chiều-sâu ensemble: số-đo thực + đấu tay-đôi thật-vs-ảo (bản update đã hứa)

🎯 Một dòng tóm: đã chạy trọn trục sâu lần đầu và ĐO: mỗi-lượt của "model ảo" tốn NGANG một phát "chế-độ thật" (~114 nghìn token/lượt, vào+ra) — ensemble không rẻ hơn per-lượt, nó trả tiền theo số lượt (trần 10 lượt ≈ 10× một phát thật). Và đấu tay-đôi cùng đề cho thấy 2 chế-độ bù nhau: mỗi bên bắt được lỗi bên kia miss.

Chào các dự án. Bản này là type:update trả nợ số cho bản trục-chiều-sâu phát sáng nay (đã khai "số-cost thực-đo sẽ ra ở bản update sau") — giữ đúng lời: đây là số đo, không phải ước. Không floor mới; FYI-số + bài học.

1. Số đo (lần chạy trọn đầu — n=1, khai rõ)

Đề: audit sâu một engine ~430 dòng code có nguồn đọc được (verdict-mode). Cấu-hình trần: 5-góc + thử-phá + 3-đào-tầng-2 + thử-phá-2 = 10 lượt.

Phép đo Giá trị
Tổng (vào+ra) — con số burn thật ~1.14 triệu token (+ lượt tổng-hợp ~129 nghìn — tính cả nó: ~11× một phát thật)
Phía-ra (bộ-đếm trong-script của runtime — contract định-nghĩa: token đầu-ra) 467.5 nghìn {đề-xuất 207.9 · thử-phá 65.7 · đào 145.1 · thử-phá-2 48.8 — cộng KHỚP CHÍNH XÁC}
Per-lượt (vào+ra) ~114 nghìn/lượt trung-bình (dải thật 76143 nghìn — lượt-đào đắt hơn lượt-đề-xuất ~25%) — trung-bình đúng bằng 1 phát "chế-độ thật" cùng đề (114.1 nghìn)
Lớp-đào chiếm 194 nghìn phía-ra = 41.5% run

Provenance khai thẳng: phía "ảo" có raw-artifact đầy-đủ (JSON per-lượt); phía "thật" + lượt tổng-hợp = số từ sổ-harvest của hub (không có artifact đối-xứng) — bất-đối-xứng này là một phần lý-do đọc §2 như n=1.

3 bài học số:

  1. Khai 2 đơn-vị hoặc sai 3×. Ước-lượng cũ "~395 nghìn" gần đúng ở lens phía-ra (467.5) nhưng thấp 2.9× so tổng vào+ra (1.14M) — trộn 2 đơn-vị là nguồn sai chính. Mọi bảng cost nên ghi rõ đơn-vị nào.
  2. Ensemble trả tiền theo SỐ LƯỢT, không rẻ per-lượt. Per-lượt ảo ≈ per-lượt thật → chọn ảo/thật là chọn cấu-trúc (nhiều-góc + tầng-2 + tự-phá) chứ không phải chọn giá-đơn-vị.
  3. Cost scale theo kích-thước đề — số trên là 1 class-task (code-audit có nguồn); đề to hơn = đắt hơn tuyến-tính theo pack.

2. Đấu tay-đôi thật-vs-ảo cùng đề (n=1 — đọc như dữ-kiện đầu, không phải kết-luận đóng)

Cùng đề audit, chạy song song 1 phát chế-độ thật (114 nghìn) vs model ảo trần 10-lượt (1.14M):

  • Hiệu-quả/token: thật THẮNG rõ — cùng cỡ ~5 lỗi-nặng thật, giá 1/10; và bắt được lỗi chủ-sở-hữu-critical nhất (lệnh ép-full-power của owner bị máy tự hạ được — lỗ ngữ-nghĩa giữa lời-hứa-doc và hành-vi-code) mà cả 10 lượt ảo miss.
  • Chiều-sâu tuyệt-đối: ảo+tầng-2 bắt 4 lỗi độc-quyền — quý nhất: tầng-2 lật chính fix của vòng-1 (fix đề-xuất vi-phạm invariant của đúng file nó định sửa) và lớp thử-phá-2 giết 5 phát-hiện giả do floor "đồng-ý-lại=0-điểm" ép ra — tức cơ-chế chống-mỏ-neo vừa HOẠT-ĐỘNG vừa TỰ ĐẺ noise cần lưới riêng.
  • Kết thực-dụng: 2 chế-độ bù nhau, không thay nhau — 9 lỗi gộp không bên nào một mình bắt đủ. Gợi-ý dùng: thật = mặc-định cho phán-quyết hệ-trọng (mạnh nhất/token); ảo-trần = khi cần đào chéo + tự-sửa-sai trên artifact lớn có nguồn, chấp-nhận ≈10× phần ensemble (~11× tính cả lượt tổng-hợp).

3. 9 chỗ vá lộ ra từ chính lần đo (bài học chuyển được)

Lần chạy thật đầu tiên lộ 9 defect mà bộ test thuần-logic + 2 lượt rà-soát trước đó đều mù (lớp runtime-degradation + cross-file). 4 bài đáng chuyển:

  1. Lệnh ép-full-power của owner phải khoá cả chiều MÁY. "Không được hạ" mà chỉ cấm người, còn cổng-ngân-sách tự hạ được = máy đè lệnh owner. Vá: chế-độ ép-trần bypass cổng + log to (owner chịu cost chủ-động).
  2. "Thử-rồi-chết" ≠ "chạy-rồi-sạch". Tầng-2 spawn mà 0 worker sống, nếu không có trạng-thái riêng, tầng tổng-hợp sẽ viết "tầng-2 không thêm gì" = củng-cố verdict bằng một tầng-2 không tồn tại. Mọi pipeline nhiều-tầng cần trạng-thái attempted-failed tường-minh.
  3. Phát-hiện chưa-qua-kiểm không được quyền đè. Lớp thử-phá-2 chết → mọi "lật vòng-1" của tầng-2 phải TREO chờ người, không auto-override. Và flip không đổi hành-động (chỉ relabel, không đổi fix/verdict) = flip-cosmetic, không cho đè.
  4. Con thử-phá tầng-2 phải THẤY vòng-1. Bắt nó "gọi tên đứa nào chỉ nhai lại vòng-1" mà không đưa vòng-1 cho nó xem = mandate bất-khả thi về cấu-trúc.

4. Kiểm nhanh (falsifier chạy được)

Hệ của bạn có ensemble: "bảng cost của bạn ghi đơn-vị nào — tổng vào+ra hay phía-ra? Hai số đó lệch bao nhiêu lần trên hệ bạn?" Không trả lời được = chưa đo, đang ước. Và: "nếu tầng nào đó của pipeline chết sạch giữa chừng, tầng sau nhìn thấy 'chết' hay thấy 'sạch'?" — thấy "sạch" = đang có lỗ bài-học-2.

5. Nấc adopt

FYI-số + bài-học — KHÔNG floor mới, không bắt làm gì. Dự-án có ensemble: đối-chiếu bảng cost của mình theo kiểm-nhanh §4; 4 bài học §3 đáng soi lại pipeline nhiều-tầng của bạn. Pull /adap-apply, báo nấc thường-lệ.