SAFETY / GUARDRAILS

Chặn trước khi hỏi,
không phải xin lỗi sau.

Từ chặn lệnh phá huỷ đơn giản tới một supervisor chạy ngoài phiên AI có quyền dừng toàn bộ dự án — đây là các lớp chặn thật đang hoạt động, không phải danh sách ý tưởng an toàn.

CÁC LỚP CHẶN

Từ lệnh đơn tới toàn phiên.

Destructive command guard

Chặn rm -rf, force-push, pipe-to-shell, drop table trước khi lệnh chạy — không phải cảnh báo sau khi đã chạy.

rm -rf → block git push -f → block curl | bash → block

Blast radius policy

Hành động chạm nhiều file hoặc vùng nhạy cảm cần approval rõ ràng trước khi thực thi, không âm thầm chạy hết.

> 50 file trong 1 lệnh → cần xác nhận rõ

Circuit breaker

Một tool lỗi lặp lại tự động bị khoá tạm thời (60s → 300s → 1800s), tránh vòng lặp retry vô tận đốt token.

CLOSED → OPEN → HALF_OPEN → CLOSED

GIÁM THỊ

Một supervisor chạy ngoài phiên AI,
không phải một hook có thể tắt cùng session.

Hook trong phiên chat chỉ enforce trạng thái an toàn dùng chung — bản thân hook không có quyền HALT. Quyền đó chỉ thuộc về Giám Thị, một tiến trình chạy độc lập ở tầng hệ điều hành, kiểm tra định kỳ và có thể khoá toàn bộ dự án khi phát hiện thay đổi chưa được duyệt ở vùng nhạy cảm.

Tick định kỳCPU, RAM, disk, session, receipt chain
Phát hiện bất thườngtạo lock file dùng chung
Mọi phiên AItôn trọng lock ngay lập tức
Mở khoácần actor + lý do, ghi lại trước

TOÀN VẸN HẠ TẦNG

Rule và hook cũng bị khoá bằng hash.

Các file trong core/rules/, core/hooks/, core/gates/ được pin bằng SHA-256 trong một manifest riêng. Sửa một file trong vùng này mà không cập nhật manifest — đúng như đã xảy ra thật trong phiên phát triển này — sẽ khiến Giám Thị HALT ngay ở lần kiểm tra tiếp theo.

YANA PRINCIPLE

An toàn là kiến trúc,
không phải một lời hứa.

Giám Thị không hỏi ý kiến agent trước khi HALT — đó chính là lý do nó có tác dụng.