Giải Tin học 12 - Định hướng khoa học máy tính trang 150

Lời giải chi tiết SGK Lớp 12 · Môn Tin Học · Trang 150–151

Tóm tắt lý thuyết (Trang 148)

Phần này nói về tính ưu việt của máy tính và thuật toán hiệu quả khi xử lí dữ liệu lớn trong Dự án hệ gene người (HPG – Human Genome Project), thể hiện ở các khía cạnh:

Khía cạnhÝ nghĩa
Tốc độ và hiệu quảĐẩy nhanh quá trình phân tích dữ liệu di truyền khổng lồ
Độ chính xácTự động hóa giúp giảm sai sót của con người
Xử lí dữ liệuHạ tầng tính toán cho phép quản lí, lưu trữ bộ dữ liệu gene lớn
Tích hợp dữ liệuGộp dữ liệu từ nhiều nhóm, đảm bảo tính nhất quán
Giải thích dữ liệuThuật toán phức tạp giúp xác định gene, đặc tính, vùng chức năng
Phân tích thời gian thựcRa quyết định nhanh, quan trọng với tiến độ dự án
Xử lí song songXử lí đồng thời nhiều luồng, tăng tốc đáng kể
Khả năng mở rộngHạ tầng thiết kế để xử lí quy mô và độ phức tạp lớn

Điểm cốt lõi (ghi nhớ trong khung): Tính ưu việt của máy tính và thuật toán hiệu quả thể hiện qua khả năng lưu trữ, xử lí, phân tích, khai phá dữ liệu một cách nhanh chóng, nhất quán và hiệu quả.


Phần Câu hỏi (Trang 148)

Câu 1. Để giải quyết những nhiệm vụ trong Dự án hệ gene người cần phải xử lí và lưu trữ khối lượng dữ liệu có quy mô lớn như thế nào?

Trả lời: Quy mô cực kỳ lớn. Bộ gene người gồm khoảng 3 tỉ cặp base (nucleotide). Để giải mã, người ta phải đọc rất nhiều đoạn nucleotide ngắn rồi ghép lại, tạo ra lượng dữ liệu thô lên tới hàng terabyte (TB). Việc lưu trữ, sắp xếp và phân tích khối dữ liệu này đòi hỏi hạ tầng tính toán mạnh và thuật toán hiệu quả, vượt xa khả năng xử lí thủ công.

Câu 2. Có thể thực hiện việc phân tích dữ liệu liên quan tới Dự án hệ gene người trên máy tính cá nhân thông thường hay không?

Trả lời: Không. Máy tính cá nhân thông thường có dung lượng lưu trữ và năng lực tính toán hạn chế, không đủ để xử lí khối dữ liệu hàng TB và các thuật toán phức tạp. Công việc này cần đến siêu máy tính, hệ thống tính toán song song hoặc hạ tầng điện toán đám mây với khả năng xử lí phân tán quy mô lớn.


LUYỆN TẬP (Trang 148)

Câu 1. Nêu ngắn gọn vai trò của máy tính trong sự phát triển của Khoa học dữ liệu.

Trả lời: Máy tính đóng vai trò nền tảng, cụ thể:

  • Lưu trữ được khối lượng dữ liệu khổng lồ mà phương pháp thủ công không làm được.
  • Xử lí và tính toán nhanh nhờ tốc độ cao và khả năng xử lí song song.
  • Phân tích, khai phá dữ liệu bằng các thuật toán hiệu quả để tìm ra quy luật, tri thức mới.
  • Tự động hóa quy trình, giảm sai sót, tăng độ chính xác và tính nhất quán.

Nói gọn: máy tính giúp Khoa học dữ liệu xử lí được những bài toán dữ liệu lớn mà trước đây bất khả thi.

Câu 2. Trong trường hợp xấu nhất, để sắp xếp các đoạn nucleotide ngắn thành hệ gene người hoàn chỉnh, ước tính cần bao nhiêu phép thử?

Trả lời: Bài toán ghép $n$ đoạn lại theo đúng thứ tự, trong trường hợp xấu nhất phải thử mọi cách sắp xếp (hoán vị) các đoạn. Số hoán vị của $n$ đối tượng là:

$$n! = n \times (n-1) \times (n-2) \times \dots \times 2 \times 1$$

Vì số đoạn nucleotide rất lớn nên $n!$ là một con số khổng lồ, tăng theo giai thừa — không thể xử lí trong thời gian hợp lí nếu thử hết. Đây chính là lý do phải dùng máy tính kết hợp thuật toán hiệu quả thay vì duyệt vét cạn.

Ý nghĩa cô muốn nhấn mạnh: con số quá lớn ($n!$) cho thấy không thể làm thủ công, qua đó làm nổi bật vai trò của thuật toán thông minh.

VẬN DỤNG (Trang 148)

Đề: Sử dụng công cụ tìm kiếm trên Internet để biết một số bài toán liên quan tới dữ liệu lớn cần tới tính ưu việt của máy tính và các thuật toán hiệu quả để giải quyết.

Gợi ý một số bài toán dữ liệu lớn em có thể tìm hiểu thêm:

  • Dự báo thời tiết và khí hậu: xử lí dữ liệu vệ tinh, cảm biến trên toàn cầu theo thời gian thực.
  • Phân tích mạng xã hội: xử lí hàng tỉ lượt tương tác để gợi ý nội dung, phát hiện tin giả.
  • Hệ thống gợi ý (Netflix, YouTube, Shopee): phân tích hành vi người dùng quy mô lớn.
  • Phân tích y sinh – gene học: ngoài HPG còn có nghiên cứu thuốc, phát hiện bệnh di truyền.
  • Giao thông thông minh: xử lí dữ liệu GPS, camera để điều phối luồng xe.

Cách làm: gõ từ khóa như "ứng dụng big data", "bài toán dữ liệu lớn", "thuật toán xử lí dữ liệu lớn" vào công cụ tìm kiếm, sau đó ghi lại ví dụ và lý do tại sao chúng cần đến máy tính mạnh.


Bài 28: Thực hành trải nghiệm trích rút thông tin và tri thức (Trang 149)

Đây là trang mở đầu bài học nên chủ yếu giới thiệu mục tiêu và dữ liệu, chưa có bài tập tính toán.

Sau bài học em sẽ:

  • Sử dụng bảng tính điện tử để thực hành một số bước xử lí và phân tích dữ liệu đơn giản.
  • Nêu được trải nghiệm bản thân trong việc trích rút thông tin và tri thức hữu ích từ dữ liệu.

Câu hỏi khởi động (phần thảo luận):

Nếu file Excel có 2 cột Số tuổiThu nhập, muốn tổng hợp thu nhập theo độ tuổi thì cần bổ sung thêm cột nào? Dữ liệu cột đó lấy từ đâu và bằng cách nào?

Trả lời: Cần bổ sung thêm cột Nhóm Tuổi (ví dụ: dưới 18, 18–30, 31–50, trên 50). Dữ liệu cột này không lấy từ bên ngoài mà được tính/suy ra từ chính cột Số tuổi đã có, bằng cách phân loại (chia khoảng) giá trị Số tuổi vào từng nhóm. Sau khi có cột Nhóm Tuổi, ta mới có thể nhóm và tổng hợp thu nhập theo từng độ tuổi.

Nhiệm vụ chung: Phân tích mối quan hệ giữa các nhóm khách hàng với xếp hạng khả năng tín dụng, dựa trên dữ liệu trích từ cộng đồng Kaggle (Hình 28.1), gồm các cột: Mã định danh, Số tuổi, Thu nhập năm (USD), Khả năng tín dụng.

Nhiệm vụ 1 – Chuẩn bị dữ liệu với Power Query:

  • Mục tiêu: bổ sung thêm cột phân loại từ dữ liệu đã có (cột Nhóm TuổiMức thu nhập).
  • a) Tải dữ liệu vào Power Query:
  • Bước 1: Tải dữ liệu từ trang hanhtrangso.nxbgd.vn và lưu với tên VD_KHDL.
  • Bước 2: Mở tệp VD_KHDL trong Excel.
Phần này là hướng dẫn thực hành thao tác, em làm theo trên máy chứ không có đáp án tính toán. Nội dung các bước tiếp theo (lập nhóm tuổi, mức thu nhập) sẽ nằm ở các trang sau.

Nếu em gửi đúng ảnh hai trang 150 – 151, cô sẽ giải tiếp phần thực hành Power Query và các bài tập của Bài 28 cho em nhé.

Chế độ đọc sách →