Giải Tin học 12 - Định hướng khoa học máy tính trang 138

Lời giải chi tiết SGK Lớp 12 · Môn Tin Học · Trang 138–139

Nguon: Tin Hoc 12 KHMT (trang 138 – 139)

⚠️ Lưu ý: Hình ảnh em gửi thực chất là nội dung trang 136 – 137 (Bài 25: Làm quen với Học máy). Thầy sẽ giải đầy đủ tất cả câu hỏi và hoạt động xuất hiện trong hai trang này nhé.

🔍 Kiến thức cần nhớ

Học máy (Machine Learning) là một lĩnh vực của Trí tuệ nhân tạo (AI), nghiên cứu và phát triển các thuật toán, mô hình giúp máy tính tự động học từ dữ liệu để đưa ra dự đoán hoặc quyết định mà không cần lập trình cụ thể.

Quy trình xây dựng mô hình Học máy gồm các bước chính:

  • Huấn luyện mô hình: dùng dữ liệu huấn luyện để mô hình "học".
  • Đánh giá mô hình: dùng dữ liệu kiểm tra để đánh giá, từ đó cải thiện (bổ sung dữ liệu, điều chỉnh tham số...). Hai bước này lặp lại đến khi đạt mô hình mong muốn.
  • Sử dụng mô hình: áp dụng để dự đoán/phân cụm trên dữ liệu mới.

Phân loại dữ liệu đầu vào:

Loại dữ liệuĐặc điểm
Dữ liệu có nhãnMỗi mẫu được gắn một nhãn/giá trị đích cụ thể
Dữ liệu không có nhãnKhông gắn nhãn/giá trị đích

Hai phương pháp Học máy cơ bản:

  • Học có giám sát: dùng dữ liệu có nhãn → giải bài toán phân loại (ví dụ: nhận biết con ngựa / không phải ngựa). Ứng dụng: lọc thư rác, nhận dạng hình ảnh, chữ viết tay, tiếng nói...
  • Học không giám sát: dùng dữ liệu không có nhãn → giải bài toán phân cụm (gom nhóm theo sự tương đồng). Ứng dụng: phân khúc khách hàng, phát hiện gian lận giao dịch, xác định chủ đề bài báo...
💡 Mẹo nhớ: "Có nhãn → có giám sát → phân loại; Không nhãn → không giám sát → phân cụm."

⚙️ Bài tập

Câu 1

Đề bài: Chọn phương án trả lời đúng. Học máy là:

A. Chương trình máy tính có khả năng đưa ra quyết định hay dự đoán dựa trên dữ liệu.

B. Khả năng máy tính phân tích dữ liệu thu nhận được để đưa ra dự đoán hoặc quyết định dựa trên các quy tắc được xác định rõ ràng.

C. Việc sử dụng các phương pháp và kĩ thuật cho phép máy tính học từ dữ liệu để đưa ra dự đoán hoặc quyết định mà không cần lập trình cụ thể.

D. Chương trình máy tính có khả năng tự cải thiện hiệu suất thực hiện nhiệm vụ thông qua việc cập nhật các dữ liệu mới sau khi hoàn thành nhiệm vụ đó nhiều lần.

Cách 1 — Đối chiếu với định nghĩa chuẩn

Định nghĩa trong sách: Học máy là lĩnh vực cho phép máy tính tự động học từ dữ liệu và tạo ra mô hình dự đoán/quyết định mà không cần lập trình cụ thể.

Phân tích từng phương án:

  • A. Sai vì thiếu yếu tố cốt lõi "học từ dữ liệu". Đây chỉ mới mô tả khả năng dự đoán nói chung.
  • B. Sai vì cụm "dựa trên các quy tắc được xác định rõ ràng" mâu thuẫn với bản chất Học máy. Nếu các quy tắc đã được định nghĩa rõ ràng thì đó là lập trình thông thường, không phải Học máy.
  • C. Đúng. Nêu đủ hai đặc trưng: "học từ dữ liệu" và "không cần lập trình cụ thể".
  • D. Sai vì chỉ mô tả một khía cạnh (tự cải thiện qua lặp lại), không phải định nghĩa đầy đủ về Học máy.

Đáp án: C.

Cách 2 — Lọc nhanh bằng từ khóa

Chỉ cần tìm phương án chứa đồng thời hai "từ khóa vàng":

  1. "học từ dữ liệu"
  2. "không cần lập trình cụ thể"

Quét nhanh: chỉ có phương án C thỏa cả hai → chọn ngay C.

⚠️ Lưu ý thi: Phương án B là "bẫy" phổ biến nhất. Hễ thấy cụm "quy tắc được xác định/lập trình rõ ràng" thì loại ngay, vì nó ngược với tinh thần Học máy.

Câu 2

Đề bài: Tại sao cần chia dữ liệu học máy thành hai phần: dữ liệu huấn luyện và dữ liệu kiểm tra?

Cách 1 — Giải thích theo vai trò từng phần dữ liệu

Cần chia dữ liệu thành hai phần riêng biệt vì mỗi phần đảm nhận một vai trò khác nhau, phục vụ cho hai bước khác nhau của quy trình:

  1. Dữ liệu huấn luyện dùng cho bước huấn luyện: mô hình "học" mối quan hệ giữa đầu vào và đầu ra từ phần dữ liệu này.
  1. Dữ liệu kiểm tra dùng cho bước đánh giá: đây là phần dữ liệu mô hình chưa từng nhìn thấy trong lúc huấn luyện. Dùng nó để đo xem mô hình hoạt động chính xác đến đâu trên dữ liệu mới.
  1. Mục đích cốt lõi: đánh giá khách quan khả năng tổng quát hóa của mô hình – tức khả năng dự đoán đúng trên dữ liệu mới ngoài thực tế.

Nếu dùng chính dữ liệu huấn luyện để kiểm tra, kết quả sẽ "đẹp giả tạo" vì mô hình đã thấy các dữ liệu đó rồi, nên không phản ánh đúng năng lực thật.

Cách 2 — Liên hệ thực tế (cách hiểu nhanh, dễ nhớ)

Hãy tưởng tượng việc học của một học sinh:

  • Dữ liệu huấn luyện = các bài tập thầy cô đã chữa trên lớp để học sinh học cách làm.
  • Dữ liệu kiểm tra = đề thi gồm những bài chưa từng được chữa.

Nếu đề thi chỉ gồm đúng các bài đã chữa, học sinh có thể học thuộc lòng đáp án mà không thực sự hiểu bài → điểm cao nhưng không phản ánh năng lực thật. Trong Học máy, hiện tượng "học vẹt" này gọi là quá khớp (overfitting).

Vì vậy phải tách riêng dữ liệu kiểm tra để có thước đo trung thực về chất lượng mô hình.

💡 Mẹo nhớ: Huấn luyện = "học bài"; Kiểm tra = "thi với đề lạ". Đề thi phải khác bài đã học thì điểm mới đáng tin.
⚠️ Lưu ý thi: Khi giải thích, nhớ nêu được hai ý then chốt: (1) dữ liệu kiểm tra là dữ liệu chưa từng dùng để huấn luyện, (2) mục đích là đánh giá khách quan khả năng tổng quát hóa, tránh hiện tượng quá khớp.

Hoạt động 2 — Tìm hiểu vai trò của Học máy

Đề bài: Hãy kể tên một vài công việc mà ngày nay không thể thiếu vai trò của Học máy.

Gợi ý trả lời:

Nhiều công việc, dịch vụ hiện đại gần như không thể vận hành hiệu quả nếu thiếu Học máy, ví dụ:

  • Lọc thư rác (spam) trong hộp thư điện tử Gmail, Outlook.
  • Nhận dạng khuôn mặt, vân tay để mở khóa điện thoại, xác thực ngân hàng.
  • Nhận dạng giọng nói trong trợ lý ảo (Siri, Google Assistant), chuyển giọng nói thành văn bản.
  • Hệ thống gợi ý (recommendation): gợi ý sản phẩm trên Shopee, Amazon; gợi ý phim trên Netflix; gợi ý video trên YouTube, TikTok.
  • Dịch máy tự động (Google Translate).
  • Phát hiện gian lận trong giao dịch thẻ tín dụng, ngân hàng.
  • Xe tự lái – nhận diện biển báo, người đi bộ, làn đường.
  • Chẩn đoán y tế hỗ trợ – phân tích ảnh X-quang, MRI để phát hiện bệnh.
  • Phân loại, kiểm duyệt nội dung trên mạng xã hội.

Điểm chung: tất cả đều cần máy tính tự học từ lượng dữ liệu khổng lồ rồi đưa ra dự đoán/quyết định mà con người không thể viết hết quy tắc thủ công.


🎯 Ghi nhớ: - Học máy = máy tính tự học từ dữ liệu, không cần lập trình cụ thể (Câu 1 → đáp án C). - Tách dữ liệu huấn luyện (để học) và dữ liệu kiểm tra (để đánh giá khách quan, chống quá khớp). - Dữ liệu có nhãn → học có giám sát → phân loại; dữ liệu không nhãn → học không giám sát → phân cụm.
Chế độ đọc sách →