Thuật ngữ

Hối tiếc phản thực tế

Counterfactual Regret

Ngữ cảnh: Thuật ngữ: Hối tiếc phản thực tế Trong thuật toán giảm thiểu hối tiếc phản thực tế của lý thuyết trò chơi, nó đo lường giá trị hối tiếc do không chọn các hành động khác trong một tập thông tin nhất định, được sử dụng để dần dần tiến tới cân bằng Nash.

Ngữ cảnh: Bài viết thuật ngữ: Hối tiếc phản thực tế ## Tổng quan Hối tiếc phản thực tế (CFR) là một khái niệm quan trọng trong lĩnh vực lý thuyết trò chơi và trí tuệ nhân tạo. Nó được đề xuất bởi Martin Zinkevich và cộng sự vào năm 2008 để giải quyết các vấn đề tối ưu hóa chiến lược trong các trò chơi thông tin không hoàn hảo. Trong các trò chơi như Texas Hold'em, CFR là thành phần cốt lõi của thuật toán giảm thiểu hối tiếc và đã được sử dụng rộng rãi để xây dựng các AI cao cấp, chẳng hạn như Libratus và Pluribus. ## Nguyên lý Hối tiếc phản thực tế đo lường sự khác biệt về lợi ích mà người chơi sẽ nhận được nếu họ chọn một hành động khác thay vì hành động thực tế, dựa trên một tập thông tin cụ thể (tất cả thông tin người chơi hiện biết). Cụ thể, đối với mỗi tập thông tin và mỗi hành động có thể, thuật toán tính "giá trị hối tiếc phản thực tế" cho hành động đó: giả sử người chơi tuân theo chiến lược hiện tại tại tất cả các điểm quyết định khác và chỉ thay đổi hành động tại nút này, giá trị hối tiếc bằng lợi ích kỳ vọng của hành động mới trừ đi lợi ích kỳ vọng của chiến lược hiện tại. Sau mỗi vòng chơi, thuật toán cập nhật giá trị hối tiếc cho các hành động trong mỗi tập thông tin dựa trên kết quả thực tế. Khi số lần lặp tăng lên, các hối tiếc tích lũy và được sử dụng để điều chỉnh chiến lược: các hành động có hối tiếc thấp hơn (tức là ít hối tiếc hơn) được gán xác suất cao hơn. Cuối cùng, khi hối tiếc trung bình trên tất cả các tập thông tin tiến gần đến 0, chiến lược hội tụ đến cân bằng Nash. ## Ứng dụng trong Texas Hold'em CFR đặc biệt phù hợp với các trò chơi như Texas Hold'em, có thông tin ẩn, tính ngẫu nhiên và ra quyết định nhiều vòng. Vì cây trò chơi đầy đủ quá lớn, các ứng dụng thực tế thường sử dụng kỹ thuật trừu tượng hóa (như phân cụm trạng thái và trừu tượng hóa hành động) để giảm độ phức tạp. Thông qua hàng nghìn tỷ mô phỏng tự đấu, CFR có thể tạo ra các chiến lược gần tối ưu và đã đánh bại những người chơi hàng đầu trong Texas Hold'em không giới hạn heads-up. ## Mối quan hệ với các thuật ngữ liên quan - Giảm thiểu hối tiếc (RM): CFR là mở rộng của RM cho các kịch bản nhiều người chơi, thông tin không hoàn hảo, chia sẻ cùng ý tưởng cốt lõi.

  • Cân bằng Nash: Mục tiêu của CFR là tìm cân bằng Nash chiến lược hỗn hợp, nơi không người chơi nào có thể lợi dụng bằng cách đơn phương thay đổi chiến lược của họ.
  • Lặp chiến lược: CFR cập nhật chiến lược thông qua lặp đi lặp lại, khác với lặp giá trị truyền thống hoặc phương pháp gradient chính sách.

Thuật ngữ liên quan