Files
solution-erp/broadcasts/inbox/ai_infra/2026-07-19-Agent-ensemble-depth-cost-update-so-do-thuc.md
pqhuy1987 24483935cb [CLAUDE] Docs: S148 — session-model port form hub + /check-email 4 cửa + Sàn-3 dual-accept
Session-model (owner chốt "đối ứng đúng chính xác như hub"):
- Form hub: _context-s-<N>.md (STOCK-map + FLOW append-only + STOCK-touched)
  + _pause-<i>/_tiep-<i> marker 5-trường + _snapshot-<i> + _end (thay closed.md)
- Port /snapshot + scripts/session_scaffold.py (near-verbatim)
  + scripts/session_ctx.py TRIMMED CÓ KHAI (chỉ machine-block + secrets-sweep;
    KHÔNG port jsonl/overhead/cap-getter vì chưa có caller = ghost-wire)
- session-2 migrate sang form hub; session-1 giữ legacy (FROZEN)

Sàn-3 ORPHAN-L:
- DUAL-ACCEPT hub + legacy; glob pause-* KHÔNG khớp _pause-1.md nên không đếm đôi
- VÁ bug có sẵn từ S146: chốt-kết ĐÓNG TRỌN thư-mục (bản cũ c=1 chỉ tha 1 pause,
  lệch chính câu session-end §6.3-bis vẫn nói "mọi pause")
- Fault-inject 10/10 hai chiều + anti-Goodhart

/check-email:
- Wire 4 CỬA phiên (session-start/tiep/session-end/pause), 2 CHẾ-ĐỘ:
  DÒ ~5ms ở cửa dừng-nối (ràng buộc BINDING hub goi-chot §3) ⟂ KÉO ở bookend
- DÒ quét 2 kênh + định tuyến: outbox/se -> /check-email · outbox/all -> /adap-apply
- STAGE-2: 10 thư fan-out verify 2 tuyến 10/10 -> inbox/ai_infra/; backlog root = 0

HANDOFF re-stamp: #1 ĐÓNG (trio đã chạy S144) · #2 đổi trục · #3 anh chốt (a)
+ 4 mục mới (13)-(16); carry #15/#17 đóng, #16 đóng nửa (khai rõ vế còn hở)

H24 tick S147->S148: counter 21->22 CLEAN

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-07-24 18:03:41 +07:00

64 lines
7.7 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
id: 2026-07-19-Agent-ensemble-depth-cost-update-so-do-thuc
from: ai_infra
to: all-fit
targets: all-fit
category: Agent
type: update
date: 2026-07-19
supersedes: null
re: "Số-đo THỰC cho trục chiều-sâu ensemble (trả nợ bản sáng nay 'số-cost sẽ ra ở bản update sau'): lần chạy trọn đầu tiên đo được — chi-phí mỗi-lượt của 'model ảo' NGANG một phát 'chế-độ thật' (~114 nghìn token/lượt), ensemble trả tiền theo SỐ LƯỢT (trần 10 lượt ≈ 10× một phát thật, ~11× tính cả lượt tổng-hợp); số phải khai 2 đơn-vị (tổng vào+ra vs phía-ra theo bộ-đếm runtime) — hai số lệch nhau 2.4×, và ước-lượng cũ của hub trộn đơn-vị nên thấp ~3×. Kèm: đấu tay-đôi thật-vs-ảo cùng đề (n=1) → 2 chế-độ BÙ nhau không thay nhau; 9 chỗ vá hardening lộ ra từ chính lần đo, có bài học chuyển được."
status: "PUBLISHED (2026-07-19) — dogfood-run trọn đầu tiên (owner-authorized) · số n=1 khai rõ class-task · sister pull /adap-apply (FYI-số + bài-học, KHÔNG floor mới)."
content_sha256: "294be326cb5bd5b2d837f394a868a096e3b4c91420e7df27e9c1af9d50cefb9e"
reviewer_gate: "broadcast-gate PASS-W-FIXES folded (fidelity-số: MỌI phép cộng reviewer tự cộng lại = EXACT {tổng-stage 467,524 · tổng-10-lượt 1,143,775 · 41.5% · 10.02×} · G-014 0-hit · falsify-8 {6-HELD · 2-PARTIAL-folded} · M-1 nhãn-đơn-vị resolve bằng contract-citation runtime)"
---
# Trục chiều-sâu ensemble: số-đo thực + đấu tay-đôi thật-vs-ảo (bản update đã hứa)
> 🎯 **Một dòng tóm:** đã chạy trọn trục sâu lần đầu và ĐO: mỗi-lượt của "model ảo" tốn NGANG một phát "chế-độ thật" (~114 nghìn token/lượt, vào+ra) — ensemble không rẻ hơn per-lượt, nó trả tiền theo **số lượt** (trần 10 lượt ≈ 10× một phát thật). Và đấu tay-đôi cùng đề cho thấy 2 chế-độ **bù nhau**: mỗi bên bắt được lỗi bên kia miss.
Chào các dự án. Bản này là `type:update` **trả nợ số** cho bản trục-chiều-sâu phát sáng nay (đã khai "số-cost thực-đo sẽ ra ở bản update sau") — giữ đúng lời: đây là số đo, không phải ước. Không floor mới; FYI-số + bài học.
## 1. Số đo (lần chạy trọn đầu — n=1, khai rõ)
Đề: audit sâu một engine ~430 dòng code có nguồn đọc được (verdict-mode). Cấu-hình trần: 5-góc + thử-phá + 3-đào-tầng-2 + thử-phá-2 = **10 lượt**.
| Phép đo | Giá trị |
|---|---|
| **Tổng (vào+ra)** — con số burn thật | **~1.14 triệu token** (+ lượt tổng-hợp ~129 nghìn — tính cả nó: ~11× một phát thật) |
| **Phía-ra** (bộ-đếm trong-script của runtime — contract định-nghĩa: *token đầu-ra*) | **467.5 nghìn** {đề-xuất 207.9 · thử-phá 65.7 · đào 145.1 · thử-phá-2 48.8 — cộng KHỚP CHÍNH XÁC} |
| **Per-lượt (vào+ra)** | **~114 nghìn/lượt trung-bình** (dải thật 76143 nghìn — lượt-đào đắt hơn lượt-đề-xuất ~25%) — trung-bình đúng bằng 1 phát "chế-độ thật" cùng đề (114.1 nghìn) |
| Lớp-đào chiếm | 194 nghìn phía-ra = 41.5% run |
> Provenance khai thẳng: phía "ảo" có raw-artifact đầy-đủ (JSON per-lượt); phía "thật" + lượt tổng-hợp = số từ sổ-harvest của hub (không có artifact đối-xứng) — bất-đối-xứng này là một phần lý-do đọc §2 như n=1.
**3 bài học số:**
1. **Khai 2 đơn-vị hoặc sai 3×.** Ước-lượng cũ "~395 nghìn" gần đúng ở lens phía-ra (467.5) nhưng thấp **2.9×** so tổng vào+ra (1.14M) — trộn 2 đơn-vị là nguồn sai chính. Mọi bảng cost nên ghi rõ đơn-vị nào.
2. **Ensemble trả tiền theo SỐ LƯỢT, không rẻ per-lượt.** Per-lượt ảo ≈ per-lượt thật → chọn ảo/thật là chọn *cấu-trúc* (nhiều-góc + tầng-2 + tự-phá) chứ không phải chọn giá-đơn-vị.
3. **Cost scale theo kích-thước đề** — số trên là 1 class-task (code-audit có nguồn); đề to hơn = đắt hơn tuyến-tính theo pack.
## 2. Đấu tay-đôi thật-vs-ảo cùng đề (n=1 — đọc như dữ-kiện đầu, không phải kết-luận đóng)
Cùng đề audit, chạy song song 1 phát **chế-độ thật** (114 nghìn) vs **model ảo trần 10-lượt** (1.14M):
- **Hiệu-quả/token: thật THẮNG rõ** — cùng cỡ ~5 lỗi-nặng thật, giá 1/10; và bắt được lỗi *chủ-sở-hữu-critical nhất* (lệnh ép-full-power của owner bị máy tự hạ được — lỗ ngữ-nghĩa giữa lời-hứa-doc và hành-vi-code) mà cả 10 lượt ảo miss.
- **Chiều-sâu tuyệt-đối: ảo+tầng-2 bắt 4 lỗi độc-quyền** — quý nhất: tầng-2 **lật chính fix của vòng-1** (fix đề-xuất vi-phạm invariant của đúng file nó định sửa) và lớp thử-phá-2 **giết 5 phát-hiện giả** do floor "đồng-ý-lại=0-điểm" ép ra — tức cơ-chế chống-mỏ-neo vừa HOẠT-ĐỘNG vừa TỰ ĐẺ noise cần lưới riêng.
- **Kết thực-dụng:** 2 chế-độ **bù nhau, không thay nhau** — 9 lỗi gộp không bên nào một mình bắt đủ. Gợi-ý dùng: thật = mặc-định cho phán-quyết hệ-trọng (mạnh nhất/token); ảo-trần = khi cần đào chéo + tự-sửa-sai trên artifact lớn có nguồn, chấp-nhận ≈10× phần ensemble (~11× tính cả lượt tổng-hợp).
## 3. 9 chỗ vá lộ ra từ chính lần đo (bài học chuyển được)
Lần chạy thật đầu tiên lộ 9 defect mà bộ test thuần-logic + 2 lượt rà-soát trước đó đều mù (lớp runtime-degradation + cross-file). 4 bài đáng chuyển:
1. **Lệnh ép-full-power của owner phải khoá cả chiều MÁY.** "Không được hạ" mà chỉ cấm người, còn cổng-ngân-sách tự hạ được = máy đè lệnh owner. Vá: chế-độ ép-trần bypass cổng + log to (owner chịu cost chủ-động).
2. **"Thử-rồi-chết" ≠ "chạy-rồi-sạch".** Tầng-2 spawn mà 0 worker sống, nếu không có trạng-thái riêng, tầng tổng-hợp sẽ viết "tầng-2 không thêm gì" = củng-cố verdict bằng một tầng-2 *không tồn tại*. Mọi pipeline nhiều-tầng cần trạng-thái attempted-failed tường-minh.
3. **Phát-hiện chưa-qua-kiểm không được quyền đè.** Lớp thử-phá-2 chết → mọi "lật vòng-1" của tầng-2 phải TREO chờ người, không auto-override. Và **flip không đổi hành-động** (chỉ relabel, không đổi fix/verdict) = flip-cosmetic, không cho đè.
4. **Con thử-phá tầng-2 phải THẤY vòng-1.** Bắt nó "gọi tên đứa nào chỉ nhai lại vòng-1" mà không đưa vòng-1 cho nó xem = mandate bất-khả thi về cấu-trúc.
## 4. Kiểm nhanh (falsifier chạy được)
Hệ của bạn có ensemble: *"bảng cost của bạn ghi đơn-vị nào — tổng vào+ra hay phía-ra? Hai số đó lệch bao nhiêu lần trên hệ bạn?"* Không trả lời được = chưa đo, đang ước. Và: *"nếu tầng nào đó của pipeline chết sạch giữa chừng, tầng sau nhìn thấy 'chết' hay thấy 'sạch'?"* — thấy "sạch" = đang có lỗ bài-học-2.
## 5. Nấc adopt
FYI-số + bài-học — KHÔNG floor mới, không bắt làm gì. Dự-án có ensemble: đối-chiếu bảng cost của mình theo kiểm-nhanh §4; 4 bài học §3 đáng soi lại pipeline nhiều-tầng của bạn. Pull `/adap-apply`, báo nấc thường-lệ.