Giải Tin học 12 - Định hướng khoa học máy tính trang 136

Lời giải chi tiết SGK Lớp 12 · Môn Tin Học · Trang 136–137

Đây là phần mở đầu của Bài 25: Làm quen với Học máy (Chủ đề 7).

Tóm tắt lý thuyết

Mấy ý chính trong hai trang này:

  • Bộ lọc thư điện tử là tập hợp các quy tắc dùng để phát hiện và đánh dấu thư rác trước khi đưa vào hộp thư người dùng. Ví dụ quy tắc đơn giản: thư chứa cụm từ "miễn phí", "giảm giá", "rẻ bất ngờ"... hoặc đến từ địa chỉ trong "danh sách đen" thì bị coi là thư rác.
  • Làm bộ lọc thủ công rất tốn công và kém hiệu quả, vì thư rác mới xuất hiện ngày càng nhiều. Vì vậy người ta dùng Học máy để máy tính tự xây dựng bộ lọc.
  • Học máy (Machine Learning) là một lĩnh vực của AI, tập trung phát triển các thuật toán và mô hình cho phép máy tính tự học và cải thiện từ dữ liệu để đưa ra dự đoán hoặc quyết định mà không cần lập trình rõ ràng.
  • Hai điểm mấu chốt:
  1. Máy tính tự học từ dữ liệu (ví dụ: cho hàng nghìn ảnh con ngựa để máy tự rút ra đặc trưng).
  2. Không cần lập trình rõ ràng (không phải viết sẵn từng quy tắc cụ thể).
  • Quy trình Học máy gồm 5 bước (Hình 25.2):
BướcTênNội dung
1Thu thập dữ liệuLấy dữ liệu từ cơ sở dữ liệu, tệp tin, ghi chép trực tiếp...
2Chuẩn bị dữ liệu"Làm sạch dữ liệu": loại nhiễu, bổ sung giá trị thiếu, chuyển định dạng, giảm kích thước. Đây là bước tốn nhiều công sức nhất.
3Huấn luyện mô hìnhDùng dữ liệu huấn luyện (70–80%) chạy thuật toán để máy học cách phân biệt các lớp dữ liệu.
4Đánh giá mô hìnhDùng dữ liệu kiểm thử để đánh giá hiệu suất của mô hình.
5Sử dụng mô hìnhÁp dụng mô hình đã huấn luyện vào thực tế.
  • Một số thuật toán Học máy phổ biến: hồi quy tuyến tính, cây quyết định, mạng nơron...

Câu hỏi 1: Phần Khởi động (Hình 25.1)

Đề: Khi truy cập tài khoản thư điện tử, ngoài các thư trong Hộp thư đến (Inbox), em có thể thấy nhiều thư được tự động phân loại vào Hộp thư rác (Spam). Hãy quan sát Hình 25.1 và cho biết việc phân loại này được thực hiện như thế nào?

Trả lời:

Việc phân loại thư được thực hiện qua một bộ lọc thư. Khi có thư mới gửi đến, tất cả thư đều đi qua bộ lọc này trước. Bộ lọc sẽ kiểm tra nội dung, tiêu đề, địa chỉ người gửi... rồi:

  • Nếu nhận thấy thư là thư rác → chuyển vào Hộp thư rác (Spam).
  • Nếu thư hợp lệ → chuyển vào Hộp thư đến (Inbox).

Như trong Hình 25.1: dòng thư đi vào "Bộ lọc thư", sau đó được tách thành hai nhánh đi xuống hai hộp khác nhau (Hộp thư rác và Hộp thư đến).

Câu hỏi 2: Hoạt động 1 – Tìm hiểu bộ lọc thư điện tử

Đề: Bộ lọc thư điện tử thường là tập hợp các quy tắc được thiết kế để phát hiện và đánh dấu thư rác. Có quy tắc đơn giản là nội dung hoặc tiêu đề thư chứa cụm từ đáng ngờ như "miễn phí", "giảm giá", "rẻ bất ngờ"... hay địa chỉ người gửi thuộc một "danh sách đen". Theo em, có thể xây dựng các bộ lọc thư này bằng cách nào?

Trả lời:

hai cách chính để xây dựng bộ lọc thư:

  1. Cách thủ công (lập trình rõ ràng): Con người tự viết sẵn các quy tắc cụ thể, ví dụ "nếu thư chứa từ miễn phí hoặc giảm giá thì đánh dấu là thư rác", hoặc lập một danh sách đen các địa chỉ gửi thư rác.
  • Nhược điểm: Thư rác liên tục thay đổi và xuất hiện dạng mới, nên phải cập nhật quy tắc liên tục → tốn nhiều công sức và kém hiệu quả.
  1. Cách dùng Học máy (cách được khuyến khích): Không viết sẵn quy tắc, mà cung cấp cho máy tính một tập dữ liệu mẫu gồm rất nhiều ví dụ về thư rác và thư hợp lệ. Máy tính sẽ tự học ra các đặc điểm, quy luật phân biệt hai loại thư, rồi dùng những gì học được để phân loại các thư mới gửi đến.
  • Ưu điểm: Máy tự cập nhật, thích nghi được với các dạng thư rác mới mà không cần con người viết lại quy tắc.

Vì sao chọn cách Học máy? Vì nó giải quyết đúng điểm yếu của cách thủ công: thư rác đa dạng và biến đổi không ngừng. Học máy giúp máy tính tự rút ra quy luật từ dữ liệu, vừa đỡ công sức cho con người, vừa cho kết quả phân loại chính xác và linh hoạt hơn.

Nếu em gửi đúng ảnh trang 136 – 137, cô sẽ giải tiếp phần còn lại của bài nhé.

Chế độ đọc sách →