Destructive command guard
Chặn rm -rf, force-push, pipe-to-shell, drop table trước khi lệnh chạy — không phải cảnh báo sau khi đã chạy.
rm -rf → block
git push -f → block
curl | bash → blockSAFETY / GUARDRAILS
Từ chặn lệnh phá huỷ đơn giản tới một supervisor chạy ngoài phiên AI có quyền dừng toàn bộ dự án — đây là các lớp chặn thật đang hoạt động, không phải danh sách ý tưởng an toàn.
CÁC LỚP CHẶN
Chặn rm -rf, force-push, pipe-to-shell, drop table trước khi lệnh chạy — không phải cảnh báo sau khi đã chạy.
rm -rf → block
git push -f → block
curl | bash → blockHành động chạm nhiều file hoặc vùng nhạy cảm cần approval rõ ràng trước khi thực thi, không âm thầm chạy hết.
> 50 file trong 1 lệnh
→ cần xác nhận rõMột tool lỗi lặp lại tự động bị khoá tạm thời (60s → 300s → 1800s), tránh vòng lặp retry vô tận đốt token.
CLOSED → OPEN → HALF_OPEN → CLOSEDGIÁM THỊ
Hook trong phiên chat chỉ enforce trạng thái an toàn dùng chung — bản thân hook không có quyền HALT. Quyền đó chỉ thuộc về Giám Thị, một tiến trình chạy độc lập ở tầng hệ điều hành, kiểm tra định kỳ và có thể khoá toàn bộ dự án khi phát hiện thay đổi chưa được duyệt ở vùng nhạy cảm.
TOÀN VẸN HẠ TẦNG
Các file trong core/rules/, core/hooks/, core/gates/ được pin bằng SHA-256 trong một manifest riêng. Sửa một file trong vùng này mà không cập nhật manifest — đúng như đã xảy ra thật trong phiên phát triển này — sẽ khiến Giám Thị HALT ngay ở lần kiểm tra tiếp theo.
YANA PRINCIPLE
Giám Thị không hỏi ý kiến agent trước khi HALT — đó chính là lý do nó có tác dụng.