Bài 5.1 (trang 76). Hãy cho biết mỗi dữ liệu sau thuộc loại nào? a) Tên của các hành tinh trong hệ Mặt Trời; b) Đánh giá của học sinh về mức độ phù hợp của đề thi học kì với các lựa chọn từ Rất khó đến Rất dễ; c) Họ và tên của các học sinh trong đội tuyển học sinh giỏi của trường tham dự kì thi học sinh giỏi cấp thành phố; d) Số năm học ngoại ngữ của các bạn trong lớp.
Kiến thức cần nhớ
Tên riêng (người, địa danh, hành tinh, …) là dữ liệu không là số, không sắp được thứ tự.
Thang đánh giá có các mức từ thấp đến cao là dữ liệu không là số nhưng sắp được thứ tự.
🧠 Phân tích tư duy
Bốn ý đều yêu cầu xác định loại dữ liệu theo đúng sơ đồ đã học ở Bài 17 (số liệu / không là số liệu không sắp thứ tự / không là số liệu sắp được thứ tự). Dấu hiệu: ý (a) và (c) đều là TÊN RIÊNG (tên hành tinh, họ và tên học sinh) nên không có thứ tự hơn — kém tự nhiên; ý (b) là thang đánh giá có mức độ (Rất khó → Rất dễ) nên sắp được thứ tự; ý (d) là con số (số năm) nên chắc chắn là số liệu.
1Cách 1. Đối chiếu từng ý với sơ đồ phân loại
Định hướng. Xét lần lượt bốn ý, kiểm tra giá trị có là số không; nếu không là số thì kiểm tra thêm có sắp được theo mức hơn — kém hay không.
a) Tên hành tinh: Sao Thuỷ, Sao Kim, Trái Đất, … — không phải số, các tên không hơn kém nhau theo một trật tự tự nhiên. Suy ra Ý (a) không là dữ liệu số, không sắp được thứ tự. b) Đánh giá đề thi: Rất khó, Khó, Phù hợp, Dễ, Rất dễ — không phải số, nhưng sắp được theo mức từ khó nhất đến dễ nhất. Suy ra Ý (b) không là dữ liệu số, sắp được thứ tự. c) Họ và tên học sinh: là các tên riêng, không hơn kém nhau. Suy ra Ý (c) không là dữ liệu số, không sắp được thứ tự. d) Số năm học ngoại ngữ: là các con số (ví dụ 3 năm, 5 năm, …). Suy ra Ý (d) là dữ liệu số (số liệu).
Vậy ý (a) và ý (c) không là dữ liệu số, không sắp được thứ tự; ý (b) không là dữ liệu số nhưng sắp được thứ tự; ý (d) là dữ liệu số (số liệu).
2Cách 2. Nhóm các ý có cùng bản chất trước khi kết luận
Định hướng. Thay vì xét lần lượt, nhóm ngay các ý có cùng kiểu dữ liệu: ý nào là tên riêng, ý nào là thang mức độ, ý nào là con số.
Nhóm "tên riêng": ý (a) tên hành tinh, ý (c) họ tên học sinh — đều là các tên không hơn kém nhau, suy ra không là số liệu, không sắp được thứ tự. Nhóm "thang mức độ": ý (b) với năm mức từ Rất khó đến Rất dễ, suy ra không là số liệu, sắp được thứ tự. Nhóm "con số": ý (d) số năm học ngoại ngữ, suy ra là số liệu.
Vậy kết luận giống Cách 1, chỉ khác ở cách trình bày theo nhóm thay vì xét tuần tự từng ý.
Nhận xét. Nhóm các ý cùng bản chất trước giúp làm nhanh hơn khi đề có nhiều ý.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (xét tuần tự từng ý) khi mới học, vì chắc chắn không bỏ sót; khi đã quen thì dùng Cách 2 (nhóm theo bản chất) sẽ nhanh hơn.
Đáp số.a) Không là số liệu, không sắp được thứ tự. b) Không là số liệu, sắp được thứ tự. c) Không là số liệu, không sắp được thứ tự. d) Là số liệu.
Sai lầm thường gặp.Cho rằng ý (a) sắp được thứ tự vì có thể xếp các hành tinh theo khoảng cách tới Mặt Trời — sai, vì dữ liệu ĐỀ CHO chỉ là TÊN các hành tinh, không phải khoảng cách; bản thân tên gọi không mang sẵn một thứ tự.
🚀 Mở rộng.Nếu đổi ý (a) thành "khoảng cách từ mỗi hành tinh đến Mặt Trời (đơn vị triệu km)" thì dữ liệu thu được sẽ là dãy số liệu, khác hẳn với dãy tên hành tinh ban đầu.
Bài 2 · Bài 5.2★Trang 76— Xác định phương pháp thu thập dữ liệu
Bài 5.2 (trang 76). Xác định phương pháp thu thập dữ liệu (Quan sát, Làm thí nghiệm, Lập bảng hỏi, Phỏng vấn) trong mỗi trường hợp sau: a) Muốn biết cường độ dòng điện của một số đoạn mạch nối tiếp; b) Muốn thống kê thời gian tự học ở nhà mỗi ngày của các bạn trong lớp; c) Muốn biết tỉ lệ học sinh nhặt rác bỏ vào thùng khi nhìn thấy rác trên sân trường.
Kiến thức cần nhớ
Làm thí nghiệm: dùng khi cần đo bằng dụng cụ (ampe kế, cân, thước, …).
Quan sát: dùng khi có thể nhìn thấy trực tiếp hành vi/sự việc tại chỗ.
Lập bảng hỏi/Phỏng vấn: dùng khi dữ liệu chỉ có được bằng cách hỏi đối tượng (thông tin cá nhân, thói quen, ý kiến).
🧠 Phân tích tư duy
Đề cho sẵn bốn phương pháp (Quan sát, Làm thí nghiệm, Lập bảng hỏi, Phỏng vấn) — dấu hiệu để chọn đúng phương pháp là xét xem dữ liệu cần lấy có đo được trực tiếp bằng dụng cụ không (thí nghiệm), có quan sát được ngay tại chỗ không (quan sát), hay phải hỏi người khác mới biết được (bảng hỏi/phỏng vấn). Ba tình huống của đề được chọn lệch nhau rõ để mỗi ý chỉ khớp đúng một phương pháp.
1Cách 1. Đối chiếu từng tình huống với đặc điểm bốn phương pháp
Định hướng. Xét từng ý, hỏi: dữ liệu này đo được bằng dụng cụ không? quan sát được tại chỗ không? hay phải hỏi người khác?
a) Cường độ dòng điện của đoạn mạch: đo trực tiếp bằng ampe kế trong mạch điện thực tế, suy ra phương pháp Làm thí nghiệm. b) Thời gian tự học ở nhà mỗi ngày: diễn ra tại nhà, người ngoài không quan sát được, chỉ có thể hỏi từng bạn, suy ra phương pháp Lập bảng hỏi (hoặc Phỏng vấn). c) Tỉ lệ học sinh nhặt rác bỏ vào thùng khi thấy rác trên sân trường: có thể đứng tại sân trường theo dõi hành vi của các bạn mà không cần hỏi, suy ra phương pháp Quan sát.
Vậy a) Làm thí nghiệm; b) Lập bảng hỏi (hoặc Phỏng vấn); c) Quan sát.
2Cách 2. Loại trừ dần theo đặc điểm dữ liệu
Định hướng. Trước hết loại ngay những phương pháp rõ ràng không phù hợp với từng tình huống, phương pháp còn lại chính là đáp án.
a) Không thể "hỏi" ra cường độ dòng điện (đây là đại lượng vật lí đo bằng dụng cụ, không phải ý kiến), suy ra loại Lập bảng hỏi, Phỏng vấn, Quan sát; chỉ còn Làm thí nghiệm. b) Không thể "làm thí nghiệm" hay "quan sát" thời gian tự học ở nhà (việc riêng tư, không diễn ra trước mặt người khảo sát), suy ra chỉ còn Lập bảng hỏi/Phỏng vấn. c) Không cần "làm thí nghiệm" hay "hỏi" để biết ai nhặt rác — nhìn thấy ngay tại sân trường, suy ra chỉ còn Quan sát.
Vậy kết luận giống Cách 1: a) Làm thí nghiệm; b) Lập bảng hỏi/Phỏng vấn; c) Quan sát.
Nhận xét. Loại trừ dần đặc biệt hữu ích khi đề cho sẵn danh sách phương pháp để chọn.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (đối chiếu đặc điểm) vì hiểu rõ bản chất từng phương pháp; Cách 2 (loại trừ) nhanh hơn khi đề đã liệt kê sẵn các phương án như bài này.
Đáp số.a) Làm thí nghiệm. b) Lập bảng hỏi (hoặc Phỏng vấn). c) Quan sát.
Sai lầm thường gặp.Chọn Phỏng vấn cho ý (c) vì nghĩ phải "hỏi xem bạn có nhặt rác không" — sai, vì hành vi nhặt rác có thể QUAN SÁT trực tiếp ngay tại sân trường, không cần hỏi (hỏi còn có thể khiến câu trả lời không trung thực, ai cũng sẽ nói "có nhặt").
🚀 Mở rộng.Nếu đổi ý (c) thành "muốn biết học sinh có đồng ý với quy định phân loại rác không", lúc này không quan sát được, phải chuyển sang Lập bảng hỏi hoặc Phỏng vấn.
Bài 5.3 (trang 76). Hãy viết câu hỏi để khảo sát về mức độ thường xuyên tập thể dục buổi sáng của các bạn trong lớp.
Kiến thức cần nhớ
Câu hỏi đếm số lần/số buổi cho dữ liệu là số.
Câu hỏi theo thang mức độ có sẵn cho dữ liệu không là số nhưng sắp được thứ tự.
🧠 Phân tích tư duy
Đề chỉ yêu cầu một nội dung khảo sát (mức độ thường xuyên tập thể dục buổi sáng), nhưng cách đặt câu hỏi có thể cho ra hai LOẠI dữ liệu khác nhau — giống bài học ở Luyện tập 1: hỏi trực tiếp số buổi/tuần sẽ ra số liệu, còn hỏi theo mức độ có sẵn sẽ ra dữ liệu không là số nhưng sắp được thứ tự. Đề không bắt buộc chọn kiểu câu hỏi nào, nên trình bày cả hai để thấy rõ sự khác biệt.
1Cách 1. Đặt câu hỏi đếm trực tiếp số buổi
Định hướng. Hỏi thẳng số buổi tập thể dục buổi sáng trong một khoảng thời gian cố định (một tuần) để thu về con số cụ thể.
Câu hỏi: "Trong một tuần, bạn tập thể dục buổi sáng mấy buổi?" Phỏng vấn 5 bạn, thu được: An — 5 buổi; Bình — 3 buổi; Chi — 0 buổi; Dũng — 7 buổi; Em — 2 buổi.
Vậy câu hỏi này cho dãy dữ liệu là số (số liệu).
2Cách 2. Đặt câu hỏi theo thang mức độ có sẵn
Định hướng. Thay vì hỏi số buổi cụ thể, cho sẵn các mức độ để người trả lời tự chọn — phù hợp khi chỉ cần biết mức độ chung, không cần con số chính xác.
Câu hỏi: "Bạn tập thể dục buổi sáng ở mức độ nào? Rất thường xuyên / Thường xuyên / Thỉnh thoảng / Không bao giờ." Phỏng vấn cùng 5 bạn, thu được: An — Rất thường xuyên; Bình — Thường xuyên; Chi — Không bao giờ; Dũng — Rất thường xuyên; Em — Thỉnh thoảng.
Vậy câu hỏi này cho dãy dữ liệu không là số nhưng sắp được thứ tự — khác loại dữ liệu so với Cách 1.
Nhận xét. Cùng một nội dung khảo sát, cách đặt câu hỏi khác nhau tạo ra hai loại dữ liệu khác nhau.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 khi cần số liệu chính xác để tính trung bình; dùng Cách 2 khi chỉ cần đánh giá nhanh xu hướng chung, dễ trả lời hơn.
Đáp số.Câu hỏi đếm số buổi cụ thể cho dữ liệu là số (số liệu); câu hỏi theo mức độ (Rất thường xuyên, …, Không bao giờ) cho dữ liệu không là số nhưng sắp được thứ tự.
Sai lầm thường gặp.Đặt câu hỏi mơ hồ kiểu "Bạn có tập thể dục buổi sáng không?" — chỉ trả lời được Có/Không, không đo được MỨC ĐỘ thường xuyên như đề yêu cầu.
🚀 Mở rộng.Có thể kết hợp cả hai kiểu câu hỏi trong cùng một phiếu khảo sát để vừa có số liệu chính xác, vừa có đánh giá mức độ chung.
Bài 4 · Bài 5.4★Trang 76— Phân loại dữ liệu từ phiếu hỏi trắc nghiệm
Bài 5.4 (trang 76). Bình muốn biết về thói quen đọc sách ở thư viện của các bạn trong lớp nên đã phát phiếu hỏi sau cho các bạn. PHIẾU HỎI 1. Bạn hay đọc sách nào nhất khi đến thư viện? A. Sách tham khảo B. Truyện thiếu nhi C. Sách khoa học D. Sách văn học. 2. Bạn lên thư viện đọc sách mấy ngày trong tuần? A. 1 B. 2 C. 3 D. 4 E. 5 (Khoanh tròn vào lựa chọn tương ứng). Em hãy cho biết dữ liệu Bình thu được ở mỗi câu hỏi thuộc loại nào?
Kiến thức cần nhớ
Kí hiệu lựa chọn (A, B, C, …) chỉ là cách trình bày; phải xét GIÁ TRỊ THẬT đứng sau kí hiệu đó để xác định loại dữ liệu.
🧠 Phân tích tư duy
Bẫy của đề: cả hai câu đều cho các lựa chọn kí hiệu bằng chữ cái (A, B, C, …), nhưng phải phân biệt GIÁ TRỊ THẬT của dữ liệu đằng sau mỗi kí hiệu. Câu 1, giá trị thật là TÊN LOẠI SÁCH (chữ); câu 2, giá trị thật là SỐ NGÀY (số), dù cũng được trình bày dưới dạng các lựa chọn A, B, C, D, E.
1Cách 1. Xét giá trị thật đứng sau mỗi kí hiệu lựa chọn
Định hướng. Với mỗi câu hỏi, bỏ qua kí hiệu A, B, C, …, chỉ nhìn vào nội dung thật của từng lựa chọn để xác định loại dữ liệu.
Câu 1: các lựa chọn A, B, C, D tương ứng với Sách tham khảo, Truyện thiếu nhi, Sách khoa học, Sách văn học — đây là TÊN các loại sách, không phải số, và các loại sách không hơn kém nhau theo một thứ tự tự nhiên. Suy ra Dữ liệu câu 1 không là số liệu, không sắp được thứ tự. Câu 2: các lựa chọn A, B, C, D, E tương ứng với 1, 2, 3, 4, 5 (ngày) — đây chính là các CON SỐ. Suy ra Dữ liệu câu 2 là số liệu.
Vậy dữ liệu thu được ở câu 1 không là số liệu, không sắp được thứ tự; dữ liệu thu được ở câu 2 là số liệu.
2Cách 2. So sánh hai câu để thấy sự khác biệt bản chất
Định hướng. Đối chiếu trực tiếp hai câu hỏi để thấy vì sao cùng là "khoanh chữ cái" nhưng lại cho hai loại dữ liệu khác nhau.
Câu 1 hỏi về loại sách yêu thích — câu trả lời là một cái TÊN, không đo đếm được, không có "nhiều — ít" giữa các loại sách. Câu 2 hỏi về số ngày lên thư viện trong tuần — câu trả lời là một LƯỢNG có thể đếm (1 đến 5 ngày), các lựa chọn A–E chỉ là cách viết gọn cho các con số 1–5. Do đó câu 1 và câu 2 tuy cùng hình thức trắc nghiệm nhưng bản chất dữ liệu hoàn toàn khác nhau.
Vậy kết luận giống Cách 1: câu 1 cho dữ liệu không là số liệu, không sắp thứ tự; câu 2 cho dữ liệu là số liệu.
Nhận xét. Hình thức trắc nghiệm (khoanh A, B, C, …) không quyết định loại dữ liệu — phải xét nội dung thật đằng sau mỗi lựa chọn.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (xét giá trị thật sau mỗi kí hiệu) vì áp dụng được ngay cho mọi phiếu trắc nghiệm tương tự, không chỉ riêng bài này.
Đáp số.Dữ liệu thu được ở câu 1 (loại sách) không là số liệu, không sắp được thứ tự. Dữ liệu thu được ở câu 2 (số ngày lên thư viện) là số liệu.
Sai lầm thường gặp.Cho rằng cả hai câu đều "không là số liệu" vì đều là các lựa chọn A, B, C, … — sai, vì câu 2 tuy trình bày bằng chữ cái nhưng GIÁ TRỊ THẬT đứng sau mỗi chữ cái (1, 2, 3, 4, 5 ngày) chính là các con số, nên vẫn là số liệu.
🚀 Mở rộng.Nếu phiếu hỏi thêm câu 3: "Bạn thấy sách ở thư viện có đa dạng không? Rất đa dạng / Đa dạng / Bình thường / Không đa dạng" thì đây sẽ là ví dụ thứ ba: dữ liệu không là số liệu nhưng sắp được thứ tự.
Bài 5 · Bài 5.5★Trang 77— Thu thập, lập bảng thống kê và phân loại dữ liệu
Bài 5.5 (trang 77). Hãy phỏng vấn các bạn trong tổ để biết các bạn tự đánh giá thế nào về ý thức tự giác của mình trong việc làm bài tập ở nhà với các mức độ từ Rất tự giác đến Không tự giác. Lập bảng thống kê cho dãy dữ liệu thu được. Dãy dữ liệu này thuộc loại nào?
Kiến thức cần nhớ
Thang đánh giá ý thức/mức độ luôn cho dữ liệu không là số nhưng sắp được thứ tự.
🧠 Phân tích tư duy
Bài gộp cả ba bước đã học: phỏng vấn thu thập dữ liệu, lập bảng thống kê, rồi phân loại dữ liệu. Dấu hiệu phân loại: đề cho sẵn các mức đánh giá "từ Rất tự giác đến Không tự giác" — đây là một thang có thứ tự, nên trước tiên cần liệt kê đủ các mức trung gian rồi mới phỏng vấn.
1Cách 1. Phỏng vấn trực tiếp, ghi ngay vào bảng
Định hướng. Lập sẵn thang bốn mức (Rất tự giác, Tự giác, Chưa tự giác, Không tự giác), hỏi lần lượt từng bạn trong tổ rồi ghi ngay câu trả lời.
Giả sử tổ có 5 bạn: An, Bình, Chi, Dũng, Em. Hỏi lần lượt và ghi kết quả: Bảng thống kê: Tên | Mức tự giác An | Rất tự giác Bình | Tự giác Chi | Chưa tự giác Dũng | Rất tự giác Em | Không tự giác Các giá trị Rất tự giác, Tự giác, Chưa tự giác, Không tự giác đều là chữ, không phải số, nhưng sắp được theo thứ tự từ tự giác nhất đến kém tự giác nhất.
Vậy dãy dữ liệu thu được không là dãy số liệu, nhưng có thể sắp xếp được theo thứ tự.
2Cách 2. Phát phiếu hỏi rồi tổng hợp vào bảng
Định hướng. Thay vì hỏi miệng, phát phiếu có sẵn bốn mức để từng bạn tự khoanh, sau đó thu phiếu và lập bảng — phù hợp khi tổ đông bạn.
Phát phiếu: "Bạn tự đánh giá ý thức tự giác làm bài tập ở nhà của mình ở mức nào? ☐ Rất tự giác ☐ Tự giác ☐ Chưa tự giác ☐ Không tự giác." Thu lại 5 phiếu, lập bảng thống kê giống Cách 1. Kết quả tổng hợp giống Cách 1, nhưng việc thu thập không cần hỏi miệng từng bạn.
Vậy kết luận giống Cách 1: dãy dữ liệu không là số liệu nhưng sắp được theo thứ tự.
Nhận xét. Phiếu hỏi tiện hơn phỏng vấn miệng khi tổ đông hoặc cần giữ kín danh tính người trả lời (tự đánh giá ý thức là nội dung tế nhị).
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 2 (phát phiếu) cho nội dung tự đánh giá ý thức, vì các bạn thường trả lời thật hơn khi không phải nói trực tiếp trước mặt người phỏng vấn.
Đáp số.Dãy dữ liệu về mức độ tự giác không là dãy số liệu, nhưng có thể sắp xếp được theo thứ tự (Rất tự giác, Tự giác, Chưa tự giác, Không tự giác); số liệu cụ thể phụ thuộc kết quả phỏng vấn thật của tổ.
Sai lầm thường gặp.Cho rằng dãy dữ liệu này là dãy số liệu vì có thể gán điểm 4, 3, 2, 1 cho bốn mức — sai, dữ liệu THU ĐƯỢC là các CHỮ (Rất tự giác, …), việc gán điểm là quy ước thêm vào sau, không phải bản chất dữ liệu ban đầu.
🚀 Mở rộng.Nếu đổi câu hỏi thành "Trung bình mỗi tuần bạn tự giác làm bài tập mấy buổi?" thì dữ liệu thu được sẽ là dãy số liệu.
Bài 6 · Bài 5.6★★Trang 77— Nhận biết tính đại diện của dữ liệu
Bài 5.6 (trang 77). Để ước lượng chiều cao trung bình của học sinh khối 7, một nhóm nghiên cứu đã chọn ngẫu nhiên từ mỗi lớp ra 10 học sinh và đo chiều cao. Số liệu thu được có đảm bảo tính đại diện không?
Kiến thức cần nhớ
Chọn ngẫu nhiên một số lượng bằng nhau từ MỖI lớp trong khối đảm bảo mẫu phủ đều toàn khối.
🧠 Phân tích tư duy
Đối tượng cần ước lượng là toàn bộ học sinh khối 7 (gồm nhiều lớp). Dấu hiệu để đánh giá: mẫu khảo sát có chọn từ MỖI lớp hay chỉ từ một vài lớp, và trong mỗi lớp có chọn NGẪU NHIÊN hay chọn theo một tiêu chí đặc thù nào không — đây đúng là cách chọn của Tròn ở HĐ4, đã được xác định là đảm bảo tính đại diện.
1Cách 1. Kiểm tra độ phủ của mẫu trên toàn bộ đối tượng
Định hướng. Xác định đối tượng cần ước lượng (toàn khối 7), rồi xem mẫu đã chọn có phủ đều mọi lớp và không thiên về nhóm học sinh nào trong mỗi lớp hay không.
Đối tượng cần ước lượng: toàn bộ học sinh khối 7, gồm nhiều lớp khác nhau. Mẫu chọn: MỖI lớp đều được chọn ra 10 học sinh, và việc chọn là NGẪU NHIÊN (không ưu tiên bạn cao hay thấp, giỏi hay yếu). Suy ra Mẫu có mặt học sinh từ mọi lớp, mỗi lớp đóng góp số lượng bằng nhau, không thiên lệch về lớp nào hay nhóm chiều cao nào.
Vậy số liệu thu được đảm bảo tính đại diện cho chiều cao của học sinh khối 7.
2Cách 2. Đối chiếu với cách chọn mẫu của Tròn ở HĐ4
Định hướng. Nhận ra cách chọn mẫu của bài này giống hệt cách của Tròn ở HĐ4 (chọn ngẫu nhiên 10 bạn mỗi lớp để khảo sát mức độ lên thư viện).
Ở HĐ4: Tròn chọn ngẫu nhiên 10 bạn mỗi lớp để khảo sát, suy ra đã được xác định là đảm bảo tính đại diện cho toàn trường. Ở bài này: nhóm nghiên cứu cũng chọn ngẫu nhiên 10 học sinh mỗi lớp trong khối 7 để đo chiều cao, suy ra cùng kiểu chọn mẫu như cách của Tròn.
Vậy kết luận giống Cách 1: số liệu thu được đảm bảo tính đại diện, vì cách chọn mẫu hoàn toàn tương tự cách hợp lí đã học ở HĐ4.
Nhận xét. Chọn số lượng bằng nhau và ngẫu nhiên từ mỗi lớp là một cách chọn mẫu phân tầng, cho kết quả đại diện tốt hơn chọn ngẫu nhiên tự do trên toàn khối nếu các lớp có sĩ số chênh lệch.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (kiểm tra độ phủ trực tiếp) vì áp dụng ngay được cho mọi bài về tính đại diện, không cần nhớ lại HĐ4.
Đáp số.Số liệu thu được đảm bảo tính đại diện, vì mẫu được chọn ngẫu nhiên với số lượng bằng nhau (10 học sinh) từ MỖI lớp trong khối 7, phủ đều toàn bộ đối tượng cần ước lượng.
Sai lầm thường gặp.Cho rằng mẫu 10 học sinh mỗi lớp là "quá ít, không đủ đại diện" — nhầm lẫn giữa SỐ LƯỢNG mẫu với CÁCH CHỌN mẫu; điều quyết định tính đại diện là mẫu có ngẫu nhiên và phủ đều các lớp hay không, chứ không phải số lượng nhiều hay ít.
🚀 Mở rộng.Nếu nhóm nghiên cứu chỉ chọn 10 học sinh từ một lớp duy nhất (không phải mỗi lớp), số liệu sẽ không còn đảm bảo tính đại diện cho cả khối, vì bỏ sót các lớp khác.
Bài 7 · Bài 5.7★★Trang 77— Nhận biết tính đại diện của dữ liệu
Bài 5.7 (trang 77). Để xác định xem loại bánh nào được ưa thích, một cửa hàng bán bánh đã đánh số khách hàng và xác định loại bánh mà các vị khách thứ 5; 10; 15; …; 500 đã mua khi đến cửa hàng. Trong số 100 người này, có 35 người mua bánh kem. Cửa hàng đã kết luận rằng có khoảng 35% khách hàng mua bánh kem. Kết luận này có hợp lí không?
Kiến thức cần nhớ
Chọn mẫu cách đều nhau trên toàn bộ danh sách đã đánh số là một cách chọn mẫu đảm bảo tính đại diện, tương tự chọn ngẫu nhiên.
🧠 Phân tích tư duy
Mẫu khảo sát là các khách hàng thứ 5; 10; 15; …; 500 — đây là kiểu chọn CÁCH ĐỀU (cứ 5 khách thì lấy 1) trên toàn bộ danh sách khách hàng đã đánh số, giống hệt cách 2 của hãng hàng không ở Ví dụ 2 và câu a) của Bài 5.4 (SGK). Cần kiểm tra xem cách chọn cách đều này có phủ đều toàn bộ khách hàng của cửa hàng hay không, trước khi kết luận về tỉ lệ 35%.
1Cách 1. Kiểm tra độ phủ của mẫu cách đều trên toàn bộ khách hàng
Định hướng. Xác định đối tượng cần đánh giá (toàn bộ khách hàng mua bánh trong khoảng thời gian khảo sát), rồi xem mẫu chọn cách đều có phủ đúng đối tượng đó không.
Đối tượng cần đánh giá: toàn bộ khách hàng đến mua bánh tại cửa hàng trong khoảng thời gian khảo sát (500 khách đầu tiên được đánh số). Mẫu chọn: các khách thứ 5; 10; 15; …; 500 — cứ 5 khách liên tiếp thì lấy đúng 1 khách, trải đều suốt cả 500 khách, tổng cộng 100 khách. Suy ra Mẫu không bỏ sót giai đoạn nào trong 500 khách, không thiên về nhóm khách đến sớm hay đến muộn.
Vậy mẫu 100 khách hàng này đảm bảo tính đại diện cho 500 khách hàng đã khảo sát; kết luận "35% khách hàng mua bánh kem" là hợp lí (trong phạm vi 500 khách đã đánh số).
2Cách 2. Đối chiếu với cách chọn mẫu đã học (Ví dụ 2, Bài 5.4a)
Định hướng. Nhận ra cách chọn khách thứ 5; 10; …; 500 có cùng cấu trúc với cách chọn hành khách 5; 10; …; 100 ở Ví dụ 2 và cách chọn hộ gia đình 1; 11; …; 4991 ở Bài 5.4a (SGK) — cả hai đều đã được xác định là đảm bảo tính đại diện.
Ở Ví dụ 2 (Cách 2): đánh số 100 hành khách rồi lấy khách số 5; 10; …; 100 (cách đều 5), suy ra đại diện. Ở Bài 5.4a (SGK): đánh số 5000 hộ rồi lấy hộ số 1; 11; …; 4991 (cách đều 10), suy ra đại diện. Bài này: đánh số 500 khách rồi lấy khách số 5; 10; …; 500 (cách đều 5), suy ra cùng kiểu chọn mẫu cách đều như hai ví dụ trên.
Vậy kết luận giống Cách 1: kết luận 35% là hợp lí, vì mẫu 100 khách được chọn cách đều, đại diện cho 500 khách đã khảo sát.
Nhận xét. Chọn cách đều trên một danh sách đã đánh số ngẫu nhiên/tuần tự là kĩ thuật chọn mẫu phổ biến trong thống kê, cho kết quả đại diện tương đương chọn ngẫu nhiên hoàn toàn.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (kiểm tra độ phủ trực tiếp) vì áp dụng ngay được, không cần nhớ lại các ví dụ đã học; Cách 2 hữu ích để kiểm tra chéo.
Đáp số.Kết luận "35% khách hàng mua bánh kem" là hợp lí, vì mẫu 100 khách hàng được chọn cách đều nhau (thứ 5; 10; …; 500) trên toàn bộ 500 khách đã đánh số, đảm bảo tính đại diện cho nhóm khách hàng này.
Sai lầm thường gặp.Cho rằng kết luận không hợp lí vì "chỉ khảo sát 100 trong rất nhiều khách hàng của cửa hàng" — nhầm lẫn giữa SỐ LƯỢNG mẫu với CÁCH CHỌN mẫu; 100 khách chọn cách đều từ 500 khách đã đánh số vẫn đại diện tốt cho chính 500 khách đó, dù cửa hàng có thể còn nhiều khách khác ngoài 500 người này.
🚀 Mở rộng.Nếu cửa hàng muốn kết luận cho tất cả khách hàng (không chỉ 500 người đã đánh số, kể cả các đợt khảo sát khác thời điểm khác), cần mở rộng và lặp lại cách chọn mẫu cách đều này ở nhiều thời điểm khác nhau trong ngày/tuần.
Bài 8 · Bài 5.8★★Trang 77— Nhận biết tính đại diện của dữ liệu
Bài 5.8 (trang 77). Để xác định xem người dân thường thích làm gì trong thời gian rảnh rỗi, một nhóm nghiên cứu đã phỏng vấn 200 phụ nữ thấy có 162 người nói rằng họ thích đi mua sắm. Nhóm nghiên cứu kết luận rằng đa phần người dân thích đi mua sắm trong thời gian rảnh rỗi. Kết luận này có hợp lí không? Vì sao?
Kiến thức cần nhớ
Kết luận chỉ hợp lí khi đối tượng khảo sát trùng khớp với đối tượng được nói đến trong kết luận.
🧠 Phân tích tư duy
Kết luận nói về "người dân" nói chung (gồm cả nam lẫn nữ), nhưng mẫu khảo sát chỉ gồm 200 phụ nữ — bẫy giống hệt cấu trúc Bài 5.5 (SGK): đối tượng khảo sát (chỉ nữ) hẹp hơn đối tượng trong kết luận (mọi người dân). Sở thích giải trí giữa nam và nữ có thể khác nhau đáng kể, nên không thể suy rộng.
1Cách 1. So sánh đối tượng khảo sát với đối tượng trong kết luận
Định hướng. Đọc kĩ đối tượng ĐÃ khảo sát (200 phụ nữ) và đối tượng trong CÂU KẾT LUẬN ("người dân", tức cả nam lẫn nữ), rồi so sánh.
Đối tượng đã khảo sát: 200 phụ nữ. Đối tượng trong kết luận: "người dân" nói chung, không giới hạn giới tính, tức bao gồm cả nam giới. Mà sở thích về hoạt động rảnh rỗi (mua sắm, thể thao, đọc sách, …) thường khác nhau đáng kể giữa nam và nữ. Suy ra Kết quả 162/200 phụ nữ thích mua sắm không thể suy rộng ra cho cả nam giới.
Vậy kết luận của nhóm nghiên cứu là không hợp lí, vì đối tượng khảo sát (chỉ phụ nữ) không đại diện cho đối tượng nêu trong kết luận (mọi người dân, cả nam lẫn nữ).
2Cách 2. Đối chiếu với Bài 5.5 (SGK) đã gặp
Định hướng. Nhận ra cấu trúc bài này giống hệt Bài 5.5 SGK: khảo sát trên một nhóm hẹp theo giới tính rồi đưa ra kết luận cho một nhóm rộng hơn.
Ở Bài 5.5 SGK: Bình phỏng vấn 50 bạn nam, kết luận "đa phần các học sinh thích bóng đá" cho cả nam lẫn nữ — không hợp lí vì đối tượng khảo sát hẹp hơn đối tượng trong kết luận. Ở bài này: nhóm nghiên cứu phỏng vấn 200 phụ nữ, kết luận "đa phần người dân thích mua sắm" cho cả nam lẫn nữ — cùng kiểu suy rộng từ nhóm hẹp (chỉ một giới) ra nhóm rộng hơn (cả hai giới).
Vậy kết luận giống Cách 1: kết luận của nhóm nghiên cứu không hợp lí, vì lí do hoàn toàn tương tự Bài 5.5 SGK.
Nhận xét. Đây là lỗi rất phổ biến: khảo sát trên một giới tính rồi kết luận chung cho cả hai giới, trong khi sở thích giữa nam và nữ thường không giống nhau.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (so sánh trực tiếp hai đối tượng) vì là cách lập luận tổng quát nhất, áp dụng ngay cho mọi bài tương tự mà không cần nhớ lại bài đã gặp.
Đáp số.Kết luận không hợp lí, vì nhóm nghiên cứu chỉ khảo sát 200 phụ nữ nhưng lại kết luận cho "người dân" nói chung (bao gồm cả nam giới) — đối tượng khảo sát không đại diện cho đối tượng nêu trong kết luận.
Sai lầm thường gặp.Cho rằng kết luận vẫn đúng vì "162 trên 200 người đã là đa số rồi" — nhầm lẫn giữa việc tính đúng TỈ LỆ trong mẫu đã khảo sát (162/200 = 81%, đúng là đa số trong nhóm phụ nữ được hỏi) với việc suy rộng tỉ lệ đó cho một đối tượng khác (cả nam lẫn nữ) mà chưa được khảo sát.
🚀 Mở rộng.Nếu nhóm nghiên cứu sửa lại kết luận thành "Đa phần phụ nữ được khảo sát thích đi mua sắm trong thời gian rảnh rỗi" (đúng đối tượng đã khảo sát) thì kết luận đó mới hợp lí.