All checks were successful
Deploy SOLUTION_ERP / build-deploy (push) Successful in 5m25s
Ap spec-apply-hub-s145-v2 (5 axis, governance-only: 0 prod-code, 0 migration). Workflow S145 chet giua chung -> /tiep §4 relaunch-cat-gon wf_3d803740-41d 3/3 DONE. Owner-decision @S146: - session_ctx_kb = 64 TUONG-MINH (giu nguyen caveat ghost-wire: 0 reader) - session-model: scaffold IDEMPOTENT (tach cap-SO vs tao-THU-MUC) · closed.md WIRE (session-end §6.3-bis) · V2 AUTO (go cong NGUOI, GIU cong NHIP 6/15/3) Landed: C7 §N.8 predicate 4-ve · hook wal-flush.ps1 4 path (+.claude/sessions/) · San-3 tin-hieu ⑤ + ORPHAN-L · D2 KIEM end-only · §L.c completeness-gate co RANG. LIVE-VERIFY hook 4-path PASS repo THAT (da7ee8a). Session-model chay TRON VONG dau tien: pause-S146 -> resume-S146 -> ORPHAN-L can so. H24 force-fire (P=8 pause >= 1, luat auto moi): 2 vai + h24-audit -> 7 FLAG, va het: - sweep-consent sot 6 site (h24-audit.md:4 = frontmatter description) - closed.md wired-but-declared-unwired (ghost-wire CHIEU NGUOC) - owner-decision [7] BI GHI DE do tai-dung slot-index -> mat uy-quyen push 3/3 vai lane-H24 garble #53: ghi-dia-SOM cuu tron, ghi-MUON mat trang. So: orphan run-folder 3->0 · carry 14->20 (co tag [carry:*]) · +E-013 +E-014 error-ledger · +memory feedback_absence_looks_like_clean · .gitignore +lock file. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
64 lines
7.7 KiB
Markdown
64 lines
7.7 KiB
Markdown
---
|
||
id: 2026-07-19-Agent-ensemble-depth-cost-update-so-do-thuc
|
||
from: ai_infra
|
||
to: all-fit
|
||
targets: all-fit
|
||
category: Agent
|
||
type: update
|
||
date: 2026-07-19
|
||
supersedes: null
|
||
re: "Số-đo THỰC cho trục chiều-sâu ensemble (trả nợ bản sáng nay 'số-cost sẽ ra ở bản update sau'): lần chạy trọn đầu tiên đo được — chi-phí mỗi-lượt của 'model ảo' NGANG một phát 'chế-độ thật' (~114 nghìn token/lượt), ensemble trả tiền theo SỐ LƯỢT (trần 10 lượt ≈ 10× một phát thật, ~11× tính cả lượt tổng-hợp); số phải khai 2 đơn-vị (tổng vào+ra vs phía-ra theo bộ-đếm runtime) — hai số lệch nhau 2.4×, và ước-lượng cũ của hub trộn đơn-vị nên thấp ~3×. Kèm: đấu tay-đôi thật-vs-ảo cùng đề (n=1) → 2 chế-độ BÙ nhau không thay nhau; 9 chỗ vá hardening lộ ra từ chính lần đo, có bài học chuyển được."
|
||
status: "PUBLISHED (2026-07-19) — dogfood-run trọn đầu tiên (owner-authorized) · số n=1 khai rõ class-task · sister pull /adap-apply (FYI-số + bài-học, KHÔNG floor mới)."
|
||
content_sha256: "294be326cb5bd5b2d837f394a868a096e3b4c91420e7df27e9c1af9d50cefb9e"
|
||
reviewer_gate: "broadcast-gate PASS-W-FIXES folded (fidelity-số: MỌI phép cộng reviewer tự cộng lại = EXACT {tổng-stage 467,524 · tổng-10-lượt 1,143,775 · 41.5% · 10.02×} · G-014 0-hit · falsify-8 {6-HELD · 2-PARTIAL-folded} · M-1 nhãn-đơn-vị resolve bằng contract-citation runtime)"
|
||
---
|
||
|
||
# Trục chiều-sâu ensemble: số-đo thực + đấu tay-đôi thật-vs-ảo (bản update đã hứa)
|
||
|
||
> 🎯 **Một dòng tóm:** đã chạy trọn trục sâu lần đầu và ĐO: mỗi-lượt của "model ảo" tốn NGANG một phát "chế-độ thật" (~114 nghìn token/lượt, vào+ra) — ensemble không rẻ hơn per-lượt, nó trả tiền theo **số lượt** (trần 10 lượt ≈ 10× một phát thật). Và đấu tay-đôi cùng đề cho thấy 2 chế-độ **bù nhau**: mỗi bên bắt được lỗi bên kia miss.
|
||
|
||
Chào các dự án. Bản này là `type:update` **trả nợ số** cho bản trục-chiều-sâu phát sáng nay (đã khai "số-cost thực-đo sẽ ra ở bản update sau") — giữ đúng lời: đây là số đo, không phải ước. Không floor mới; FYI-số + bài học.
|
||
|
||
## 1. Số đo (lần chạy trọn đầu — n=1, khai rõ)
|
||
|
||
Đề: audit sâu một engine ~430 dòng code có nguồn đọc được (verdict-mode). Cấu-hình trần: 5-góc + thử-phá + 3-đào-tầng-2 + thử-phá-2 = **10 lượt**.
|
||
|
||
| Phép đo | Giá trị |
|
||
|---|---|
|
||
| **Tổng (vào+ra)** — con số burn thật | **~1.14 triệu token** (+ lượt tổng-hợp ~129 nghìn — tính cả nó: ~11× một phát thật) |
|
||
| **Phía-ra** (bộ-đếm trong-script của runtime — contract định-nghĩa: *token đầu-ra*) | **467.5 nghìn** {đề-xuất 207.9 · thử-phá 65.7 · đào 145.1 · thử-phá-2 48.8 — cộng KHỚP CHÍNH XÁC} |
|
||
| **Per-lượt (vào+ra)** | **~114 nghìn/lượt trung-bình** (dải thật 76–143 nghìn — lượt-đào đắt hơn lượt-đề-xuất ~25%) — trung-bình đúng bằng 1 phát "chế-độ thật" cùng đề (114.1 nghìn) |
|
||
| Lớp-đào chiếm | 194 nghìn phía-ra = 41.5% run |
|
||
|
||
> Provenance khai thẳng: phía "ảo" có raw-artifact đầy-đủ (JSON per-lượt); phía "thật" + lượt tổng-hợp = số từ sổ-harvest của hub (không có artifact đối-xứng) — bất-đối-xứng này là một phần lý-do đọc §2 như n=1.
|
||
|
||
**3 bài học số:**
|
||
1. **Khai 2 đơn-vị hoặc sai 3×.** Ước-lượng cũ "~395 nghìn" gần đúng ở lens phía-ra (467.5) nhưng thấp **2.9×** so tổng vào+ra (1.14M) — trộn 2 đơn-vị là nguồn sai chính. Mọi bảng cost nên ghi rõ đơn-vị nào.
|
||
2. **Ensemble trả tiền theo SỐ LƯỢT, không rẻ per-lượt.** Per-lượt ảo ≈ per-lượt thật → chọn ảo/thật là chọn *cấu-trúc* (nhiều-góc + tầng-2 + tự-phá) chứ không phải chọn giá-đơn-vị.
|
||
3. **Cost scale theo kích-thước đề** — số trên là 1 class-task (code-audit có nguồn); đề to hơn = đắt hơn tuyến-tính theo pack.
|
||
|
||
## 2. Đấu tay-đôi thật-vs-ảo cùng đề (n=1 — đọc như dữ-kiện đầu, không phải kết-luận đóng)
|
||
|
||
Cùng đề audit, chạy song song 1 phát **chế-độ thật** (114 nghìn) vs **model ảo trần 10-lượt** (1.14M):
|
||
|
||
- **Hiệu-quả/token: thật THẮNG rõ** — cùng cỡ ~5 lỗi-nặng thật, giá 1/10; và bắt được lỗi *chủ-sở-hữu-critical nhất* (lệnh ép-full-power của owner bị máy tự hạ được — lỗ ngữ-nghĩa giữa lời-hứa-doc và hành-vi-code) mà cả 10 lượt ảo miss.
|
||
- **Chiều-sâu tuyệt-đối: ảo+tầng-2 bắt 4 lỗi độc-quyền** — quý nhất: tầng-2 **lật chính fix của vòng-1** (fix đề-xuất vi-phạm invariant của đúng file nó định sửa) và lớp thử-phá-2 **giết 5 phát-hiện giả** do floor "đồng-ý-lại=0-điểm" ép ra — tức cơ-chế chống-mỏ-neo vừa HOẠT-ĐỘNG vừa TỰ ĐẺ noise cần lưới riêng.
|
||
- **Kết thực-dụng:** 2 chế-độ **bù nhau, không thay nhau** — 9 lỗi gộp không bên nào một mình bắt đủ. Gợi-ý dùng: thật = mặc-định cho phán-quyết hệ-trọng (mạnh nhất/token); ảo-trần = khi cần đào chéo + tự-sửa-sai trên artifact lớn có nguồn, chấp-nhận ≈10× phần ensemble (~11× tính cả lượt tổng-hợp).
|
||
|
||
## 3. 9 chỗ vá lộ ra từ chính lần đo (bài học chuyển được)
|
||
|
||
Lần chạy thật đầu tiên lộ 9 defect mà bộ test thuần-logic + 2 lượt rà-soát trước đó đều mù (lớp runtime-degradation + cross-file). 4 bài đáng chuyển:
|
||
|
||
1. **Lệnh ép-full-power của owner phải khoá cả chiều MÁY.** "Không được hạ" mà chỉ cấm người, còn cổng-ngân-sách tự hạ được = máy đè lệnh owner. Vá: chế-độ ép-trần bypass cổng + log to (owner chịu cost chủ-động).
|
||
2. **"Thử-rồi-chết" ≠ "chạy-rồi-sạch".** Tầng-2 spawn mà 0 worker sống, nếu không có trạng-thái riêng, tầng tổng-hợp sẽ viết "tầng-2 không thêm gì" = củng-cố verdict bằng một tầng-2 *không tồn tại*. Mọi pipeline nhiều-tầng cần trạng-thái attempted-failed tường-minh.
|
||
3. **Phát-hiện chưa-qua-kiểm không được quyền đè.** Lớp thử-phá-2 chết → mọi "lật vòng-1" của tầng-2 phải TREO chờ người, không auto-override. Và **flip không đổi hành-động** (chỉ relabel, không đổi fix/verdict) = flip-cosmetic, không cho đè.
|
||
4. **Con thử-phá tầng-2 phải THẤY vòng-1.** Bắt nó "gọi tên đứa nào chỉ nhai lại vòng-1" mà không đưa vòng-1 cho nó xem = mandate bất-khả thi về cấu-trúc.
|
||
|
||
## 4. Kiểm nhanh (falsifier chạy được)
|
||
|
||
Hệ của bạn có ensemble: *"bảng cost của bạn ghi đơn-vị nào — tổng vào+ra hay phía-ra? Hai số đó lệch bao nhiêu lần trên hệ bạn?"* Không trả lời được = chưa đo, đang ước. Và: *"nếu tầng nào đó của pipeline chết sạch giữa chừng, tầng sau nhìn thấy 'chết' hay thấy 'sạch'?"* — thấy "sạch" = đang có lỗ bài-học-2.
|
||
|
||
## 5. Nấc adopt
|
||
|
||
FYI-số + bài-học — KHÔNG floor mới, không bắt làm gì. Dự-án có ensemble: đối-chiếu bảng cost của mình theo kiểm-nhanh §4; 4 bài học §3 đáng soi lại pipeline nhiều-tầng của bạn. Pull `/adap-apply`, báo nấc thường-lệ.
|