Bài 1 · Hoạt động 1★Trang 89— Thu thập dữ liệu bằng phỏng vấn
Hoạt động 1 (trang 89). Em hãy giúp đài truyền hình thu thập dữ liệu bằng cách phỏng vấn các bạn trong tổ, sử dụng ba câu hỏi sau: (1) Trung bình mỗi ngày bạn dành bao nhiêu giờ để xem ti vi? (2) Các chương trình ti vi bạn xem là gì? (3) Bạn có cho rằng các chương trình ti vi hiện nay rất hấp dẫn không? Chọn một trong các ý kiến sau: Rất đồng ý, Đồng ý, Không đồng ý, Rất không đồng ý.
Kiến thức cần nhớ
Phỏng vấn trực tiếp là một phương pháp thu thập dữ liệu.
Mỗi câu hỏi có thể cho ra một kiểu dữ liệu riêng: số liệu, tên gọi, hoặc mức độ.
🧠 Phân tích tư duy
Đề cho ba câu hỏi thuộc ba kiểu khác nhau — một câu hỏi ra số (giờ xem ti vi), một câu hỏi ra tên chương trình (không phải số), một câu hỏi chọn mức độ trong danh sách có sẵn — đây chính là dấu hiệu để sau này (ở HĐ3) nhận ra ba loại dữ liệu khác nhau. Cách làm an toàn nhất là phỏng vấn trực tiếp từng bạn và ghi ngay câu trả lời vào một bảng có sẵn ba cột, tránh quên hoặc ghi nhầm người.
1Cách 1. Phỏng vấn trực tiếp, ghi ngay vào bảng ba cột
Định hướng. Lập sẵn một bảng ba cột (một cột cho mỗi câu hỏi), hỏi lần lượt từng bạn trong tổ rồi điền ngay câu trả lời vào đúng cột.
Giả sử tổ có 5 bạn: An, Bình, Chi, Dũng, Em. Hỏi lần lượt từng bạn cả ba câu hỏi rồi ghi kết quả: An: 1 giờ — Hoạt hình — Đồng ý. Bình: 2 giờ — Thể thao — Rất đồng ý. Chi: 0,5 giờ — Ca nhạc — Không đồng ý. Dũng: 1,5 giờ — Thể thao — Đồng ý. Em: 1 giờ — Phim truyện — Rất không đồng ý.
Vậy ta thu được ba dãy dữ liệu: giờ xem ti vi của 5 bạn, tên chương trình 5 bạn xem, mức độ đồng ý của 5 bạn về sự hấp dẫn của chương trình.
2Cách 2. Phát phiếu hỏi viết sẵn rồi thu lại
Định hướng. Thay vì hỏi miệng, in sẵn phiếu có ba câu hỏi (câu 3 kèm bốn ô lựa chọn) để các bạn tự điền, sau đó thu phiếu và tổng hợp — phù hợp khi số bạn cần hỏi đông.
Phát cho mỗi bạn trong tổ một phiếu như sau: 1. Trung bình mỗi ngày bạn dành bao nhiêu giờ để xem ti vi? … giờ. 2. Các chương trình ti vi bạn xem là gì? …………… 3. Bạn có cho rằng các chương trình ti vi hiện nay rất hấp dẫn không? ☐ Rất đồng ý ☐ Đồng ý ☐ Không đồng ý ☐ Rất không đồng ý. Thu lại 5 phiếu đã điền rồi chép câu trả lời vào bảng thống kê chung.
Vậy kết quả tổng hợp giống Cách 1, nhưng việc thu thập nhanh hơn khi hỏi nhiều bạn cùng lúc.
Nhận xét. Phiếu hỏi tránh được việc quên câu trả lời khi phỏng vấn miệng nhiều người liên tiếp.
⭐ Cách nên dùng khi đi thi.Đi thực hành nên dùng Cách 1 (phỏng vấn trực tiếp) với tổ ít bạn vì nhanh gọn, không tốn công in phiếu; Cách 2 chỉ nên dùng khi khảo sát số đông.
Đáp số.Kết quả phụ thuộc câu trả lời thật của các bạn trong tổ; bảng minh họa mẫu ở Cách 1.
Sai lầm thường gặp.Nhầm câu hỏi (2) là dữ liệu số vì có thể đếm được số chương trình — sai, vì câu trả lời là TÊN chương trình (chữ), không phải một con số đo lường.
🚀 Mở rộng.Nếu tổ đông hơn (chẳng hạn 10 bạn), nên dùng Cách 2 (phiếu hỏi) để tiết kiệm thời gian thu thập.
Bài 2 · Hoạt động 2★Trang 89— Lập bảng thống kê từ dữ liệu đã thu thập
Hoạt động 2 (trang 89). Lập bảng thống kê cho ba dãy dữ liệu thu được.
Kiến thức cần nhớ
Bảng thống kê: mỗi hàng là một đối tượng (một bạn), mỗi cột là một câu hỏi/tiêu chí.
🧠 Phân tích tư duy
Đề yêu cầu trình bày lại ba dãy dữ liệu ở HĐ1 dưới dạng bảng — dấu hiệu nhận ra ngay là mỗi bạn ứng với một hàng, mỗi câu hỏi ứng với một cột, vì đó là cách sắp xếp giúp so sánh dữ liệu giữa các bạn dễ nhất. Chọn gộp một bảng hay tách nhiều bảng là an toàn như nhau, chỉ khác ở mức độ tiện khi cần đọc theo hàng hay theo cột.
1Cách 1. Bảng dọc — mỗi hàng một bạn
Định hướng. Xếp tên các bạn thành cột đầu tiên, ba câu hỏi thành ba cột tiếp theo.
Bảng thống kê (dùng số liệu minh họa ở Hoạt động 1): Tên | Giờ xem ti vi | Chương trình | Mức độ đồng ý An | 1 | Hoạt hình | Đồng ý Bình | 2 | Thể thao | Rất đồng ý Chi | 0,5 | Ca nhạc | Không đồng ý Dũng | 1,5 | Thể thao | Đồng ý Em | 1 | Phim truyện | Rất không đồng ý
Vậy ba dãy dữ liệu được trình bày gọn trong một bảng bốn cột, năm hàng.
2Cách 2. Ba bảng riêng — mỗi bảng một câu hỏi
Định hướng. Vì có đúng ba câu hỏi độc lập nhau, có thể lập ba bảng nhỏ, mỗi bảng gồm hai cột (tên bạn, câu trả lời).
Bảng 1 (giờ xem ti vi): An–1; Bình–2; Chi–0,5; Dũng–1,5; Em–1. Bảng 2 (chương trình xem): An–Hoạt hình; Bình–Thể thao; Chi–Ca nhạc; Dũng–Thể thao; Em–Phim truyện. Bảng 3 (mức độ đồng ý): An–Đồng ý; Bình–Rất đồng ý; Chi–Không đồng ý; Dũng–Đồng ý; Em–Rất không đồng ý.
Vậy dữ liệu vẫn đầy đủ như Cách 1, chỉ khác cách trình bày.
Nhận xét. Cách 1 gọn hơn khi cần so sánh một bạn theo cả ba tiêu chí; Cách 2 tiện hơn khi chỉ cần xét riêng một câu hỏi.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (một bảng bốn cột) vì HĐ3 ngay sau đó cần so sánh ba dãy dữ liệu cùng lúc theo từng bạn — bảng gộp giúp nhìn thấy cả ba loại dữ liệu trong một lần đọc.
Đáp số.Bảng thống kê bốn cột (Tên — Giờ xem ti vi — Chương trình — Mức độ đồng ý) như ở Cách 1, số liệu cụ thể phụ thuộc kết quả phỏng vấn thật.
Sai lầm thường gặp.Gộp nhầm hai câu hỏi khác kiểu dữ liệu vào chung một cột (ví dụ viết chung "2 giờ, Thể thao" vào một ô) khiến bảng khó đọc và khó phân loại ở bước sau.
🚀 Mở rộng.Khi số câu hỏi nhiều hơn ba, bảng gộp theo Cách 1 vẫn áp dụng được, chỉ cần thêm cột tương ứng mỗi câu hỏi mới.
Bài 3 · Hoạt động 3★Trang 89— Phân loại dữ liệu: số liệu — không là số liệu — có thể sắp thứ tự
Hoạt động 3 (trang 89). Trong ba dãy dữ liệu thu được, dãy nào là dãy số liệu? Dãy nào không là dãy số liệu? Dãy nào có thể sắp xếp được theo thứ tự tăng, giảm?
Kiến thức cần nhớ
Dữ liệu là số còn gọi là dữ liệu định lượng (số liệu).
Dữ liệu không là số còn gọi là dữ liệu định tính, có hai loại: không sắp được thứ tự và sắp được thứ tự.
🧠 Phân tích tư duy
Dấu hiệu nhận dạng: nhìn vào từng dãy trong bảng ở HĐ2 rồi kiểm tra xem giá trị có phải là con số hay không; nếu không phải số thì kiểm tra thêm xem các giá trị có xếp được theo một trật tự tự nhiên (hơn — kém) hay không. Bẫy của đề là dãy "chương trình ti vi" và dãy "mức độ đồng ý" đều không là số nhưng chỉ một trong hai dãy sắp được thứ tự.
1Cách 1. Đối chiếu từng giá trị với sơ đồ phân loại
Định hướng. Xét lần lượt ba dãy, mỗi dãy trả lời hai câu hỏi: giá trị có là số không? nếu không là số thì có xếp được hơn — kém không?
Dãy (1) — giờ xem ti vi: 1; 2; 0,5; 1,5; 1 — toàn số. Suy ra Dãy (1) là dãy số liệu, đương nhiên sắp được theo thứ tự tăng, giảm. Dãy (2) — tên chương trình: Hoạt hình, Thể thao, Ca nhạc, Thể thao, Phim truyện — không phải số, các tên không hơn kém nhau. Suy ra Dãy (2) không là dãy số liệu, không sắp được thứ tự. Dãy (3) — mức độ đồng ý: Đồng ý, Rất đồng ý, Không đồng ý, Đồng ý, Rất không đồng ý — không phải số, nhưng có mức cao → thấp: Rất đồng ý > Đồng ý > Không đồng ý > Rất không đồng ý. Suy ra Dãy (3) không là dãy số liệu, nhưng sắp được theo thứ tự.
Vậy dãy (1) là dãy số liệu; dãy (2) và dãy (3) không là dãy số liệu; trong đó dãy (1) và dãy (3) sắp xếp được theo thứ tự, còn dãy (2) thì không.
2Cách 2. Loại trừ dần theo từng tiêu chí
Định hướng. Trước hết gạch ra ngay dãy nào gồm toàn chữ số — đó là dãy số liệu duy nhất; với hai dãy còn lại, thử tưởng tượng xếp chúng thành một hàng theo mức độ hơn kém để phân biệt.
Ba dãy: (1) 1; 2; 0,5; 1,5; 1 — (2) Hoạt hình; Thể thao; Ca nhạc; Thể thao; Phim truyện — (3) Đồng ý; Rất đồng ý; Không đồng ý; Đồng ý; Rất không đồng ý. Chỉ dãy (1) gồm toàn con số, suy ra dãy (1) là dãy số liệu duy nhất. Thử xếp dãy (2): không có tiêu chí nào để nói "Thể thao" hơn hay kém "Ca nhạc", suy ra không sắp được. Thử xếp dãy (3): xếp được thành 4 mức từ cao xuống thấp Rất đồng ý — Đồng ý — Không đồng ý — Rất không đồng ý, suy ra sắp được.
Vậy kết luận giống Cách 1: chỉ dãy (1) là số liệu; dãy (2) không sắp được thứ tự; dãy (3) không là số liệu nhưng sắp được thứ tự.
Nhận xét. Việc thử xếp thứ tự là cách kiểm tra nhanh và trực quan để phân biệt hai loại dữ liệu không là số.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 vì đi thẳng theo đúng ba nhánh của sơ đồ phân loại trong SGK, ít bỏ sót và trình bày mạch lạc; Cách 2 chỉ nên dùng để kiểm tra chéo lại kết quả.
Đáp số.Dãy (1) là dãy số liệu. Dãy (2) và (3) không là dãy số liệu. Dãy (1) và (3) sắp xếp được theo thứ tự; dãy (2) không sắp xếp được.
Sai lầm thường gặp.Cho rằng dãy (3) là dãy số liệu vì có thể "chấm điểm" các mức 1, 2, 3, 4 — sai, vì đề bài cho dữ liệu là các CHỮ (Rất đồng ý, Đồng ý, …), không phải các con số; việc gán điểm là một quy ước thêm vào, không phải bản chất dữ liệu thu được.
🚀 Mở rộng.Nếu đổi câu hỏi 3 thành "Chọn điểm từ 1 đến 10 cho mức độ hấp dẫn" thì dãy dữ liệu thu được sẽ là dãy số liệu, không còn thuộc loại dữ liệu không là số nữa.
Bài 4 · Câu hỏi★Trang 89— Lấy ví dụ về dữ liệu không là số, có thể sắp xếp thứ tự
Câu hỏi (trang 89). Em hãy lấy một ví dụ về dữ liệu không là số, có thể sắp xếp theo thứ tự.
Kiến thức cần nhớ
Dữ liệu không là số nhưng sắp được thứ tự thường xuất hiện ở các thang xếp loại, xếp hạng có sẵn.
🧠 Phân tích tư duy
Đề yêu cầu một dãy dữ liệu thoả đồng thời hai điều kiện: giá trị không phải con số, nhưng các giá trị đó có một trật tự tự nhiên hơn — kém (giống dãy "mức độ đồng ý" vừa xét ở HĐ3). Dấu hiệu để tìm nhanh một ví dụ: nghĩ tới các thang xếp hạng, xếp loại quen thuộc trong đời sống (học lực, huy chương, xếp hạng cuộc thi…), vì bản thân các thang đó luôn có sẵn một chiều hơn — kém.
1Cách 1. Lấy ví dụ từ thang xếp loại học lực
Định hướng. Nghĩ tới một thang xếp loại quen thuộc mà thầy cô hay dùng để đánh giá học sinh, vì bản thân thang đó đã có sẵn một chiều hơn — kém.
Xét dãy dữ liệu: xếp loại học lực của 5 bạn trong lớp: Giỏi, Khá, Trung bình, Giỏi, Yếu. Các giá trị Giỏi, Khá, Trung bình, Yếu đều là chữ, không phải con số. Nhưng bốn mức này sắp được theo một thứ tự rõ ràng: Giỏi hơn Khá, Khá hơn Trung bình, Trung bình hơn Yếu.
Vậy dãy xếp loại học lực là một ví dụ về dữ liệu không là số, có thể sắp xếp theo thứ tự.
2Cách 2. Lấy ví dụ từ thang xếp hạng huy chương
Định hướng. Chọn một thang xếp hạng khác không liên quan tới học tập, để thấy quy tắc nhận dạng áp dụng được cho nhiều tình huống, không riêng gì bảng điểm.
Xét dãy dữ liệu: huy chương đạt được của 5 vận động viên trong một cuộc thi: Vàng, Bạc, Đồng, Vàng, Bạc. Các giá trị Vàng, Bạc, Đồng đều là chữ, không phải con số. Nhưng ba mức này sắp được theo thứ tự: Vàng hơn Bạc, Bạc hơn Đồng.
Vậy dãy huy chương cũng là một ví dụ về dữ liệu không là số, có thể sắp xếp theo thứ tự — cùng loại với dãy học lực ở Cách 1.
Nhận xét. Mọi thang xếp hạng có sẵn thứ bậc (học lực, huy chương, mức độ hài lòng, xếp hạng tín nhiệm…) đều cho loại dữ liệu này.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (xếp loại học lực) vì đây là thang quen thuộc nhất với học sinh, dễ giải thích ngay được thứ tự hơn — kém.
Đáp số.Ví dụ: dãy xếp loại học lực của một số bạn (Giỏi, Khá, Trung bình, Giỏi, Yếu) — không là số nhưng sắp được thứ tự Giỏi > Khá > Trung bình > Yếu.
Sai lầm thường gặp.Lấy ví dụ một dãy toàn TÊN RIÊNG (như tên các bạn, tên các tỉnh) — đây là dữ liệu không là số nhưng KHÔNG sắp được thứ tự, không thoả đúng yêu cầu đề (phải sắp được thứ tự).
🚀 Mở rộng.Có thể liên hệ xa hơn: hạng huy chương (Vàng, Bạc, Đồng) hay mức xếp hạng tín nhiệm doanh nghiệp (AAA, AA, A, …) cũng đều là dữ liệu không là số nhưng sắp được thứ tự.
Bài 5 · Ví dụ 1★Trang 89— Phân loại dữ liệu: số liệu — không là số liệu — có thể sắp thứ tự
Ví dụ 1 (trang 89). Bình đã phỏng vấn các bạn trong lớp và thu được các dãy dữ liệu sau. (1) Cân nặng (đơn vị kilôgam) của năm bạn trong lớp: 43; 41; 48; 45; 52. (2) Tên một số tỉnh: Ninh Bình, Hưng Yên, Bắc Ninh. (3) Đánh giá của bốn bạn học sinh về chất lượng bài giảng môn Toán: Tốt, Xuất sắc, Khá Tốt, Trung bình. Em hãy xác định mỗi dãy dữ liệu đó thuộc loại nào.
Kiến thức cần nhớ
Dữ liệu là số (kèm đơn vị đo) luôn là dãy số liệu.
Dữ liệu là các mức đánh giá chất lượng thường sắp được theo thứ tự từ cao đến thấp.
🧠 Phân tích tư duy
Cấu trúc giống hệt HĐ3 vừa xét: ba dãy dữ liệu cần phân loại theo đúng ba nhánh của sơ đồ (dữ liệu là số / không là số nhưng sắp được thứ tự / không là số và không sắp được thứ tự). Dấu hiệu: dãy (1) toàn con số kèm đơn vị kilôgam nên chắc chắn là số liệu; dãy (2) là tên riêng (tên tỉnh) không có thứ tự hơn kém; dãy (3) là các mức đánh giá chất lượng nên cần sắp xếp bốn mức đó theo đúng chiều tốt → kém trước khi kết luận.
1Cách 1. Đối chiếu từng dãy với sơ đồ phân loại
Định hướng. Xét lần lượt ba dãy, kiểm tra giá trị có là số không; nếu không là số thì kiểm tra thêm có sắp được theo mức hơn — kém hay không.
Dãy (1) — cân nặng: 43; 41; 48; 45; 52 (kg) — toàn số. Suy ra Dãy (1) là dãy số liệu. Dãy (2) — tên tỉnh: Ninh Bình, Hưng Yên, Bắc Ninh — không phải số, các tên tỉnh không hơn kém nhau. Suy ra Dãy (2) không là dãy số liệu, không sắp được thứ tự. Dãy (3) — đánh giá bài giảng: Tốt, Xuất sắc, Khá Tốt, Trung bình — không phải số, nhưng sắp được theo mức từ cao xuống thấp: Xuất sắc hơn Tốt, Tốt hơn Khá Tốt, Khá Tốt hơn Trung bình.
Vậy dãy (1) là dãy số liệu; dãy (2) không là dãy số liệu và không sắp được thứ tự; dãy (3) không là dãy số liệu nhưng sắp được thứ tự.
2Cách 2. So sánh với sơ đồ phân loại đã áp dụng ở HĐ3
Định hướng. Nhận ra cấu trúc bài này giống hệt HĐ3: một dãy số, một dãy tên riêng, một dãy mức đánh giá — chỉ cần áp lại đúng ba bước đã làm ở đó.
Ở HĐ3: dãy giờ xem ti vi (số) là số liệu; dãy tên chương trình (tên riêng) không sắp được thứ tự; dãy mức độ đồng ý (bốn mức) sắp được thứ tự. Ở Ví dụ 1: dãy (1) là số (giống dãy giờ xem ti vi), suy ra số liệu. Dãy (2) là tên riêng — tên tỉnh (giống dãy tên chương trình), suy ra không sắp được thứ tự. Dãy (3) là mức đánh giá (giống dãy mức độ đồng ý), suy ra sắp được thứ tự.
Vậy kết luận giống Cách 1: dãy (1) là số liệu; dãy (2) không là số liệu, không sắp thứ tự; dãy (3) không là số liệu nhưng sắp được thứ tự.
Nhận xét. Nhận ra cấu trúc quen thuộc giúp trả lời nhanh mà không cần phân tích lại từ đầu.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 vì đi thẳng theo sơ đồ phân loại, áp dụng được cho mọi bài kể cả chưa gặp ví dụ tương tự; Cách 2 chỉ nên dùng để kiểm tra chéo khi đã quen dạng.
Đáp số.Dãy (1) là dãy số liệu. Dãy (2) không là dãy số liệu, không sắp được thứ tự. Dãy (3) không là dãy số liệu nhưng sắp xếp được theo thứ tự (Xuất sắc, Tốt, Khá Tốt, Trung bình).
Sai lầm thường gặp.Xếp nhầm dãy (3) là dãy số liệu vì có thể quy đổi thành điểm số (Xuất sắc ứng với 4, Tốt ứng với 3, …) — sai, vì dữ liệu THU ĐƯỢC là các CHỮ đánh giá, việc gán điểm là quy ước thêm vào sau, không phải bản chất dữ liệu ban đầu.
🚀 Mở rộng.Nếu đổi câu hỏi thành "Cho điểm từ 1 đến 10 cho chất lượng bài giảng" thì dãy (3) sẽ trở thành dãy số liệu thật sự.
Bài 6 · Luyện tập 1★★Trang 90— Đặt câu hỏi khảo sát và phân loại dữ liệu
Luyện tập 1 (trang 90). a) Em hãy đưa ra một số câu hỏi phỏng vấn để: (1) Khảo sát ý kiến của các bạn trong lớp về vật nuôi yêu thích; (2) Khảo sát thời gian (giờ) mà các bạn trong lớp dành cho hoạt động thể thao trong ngày. b) Với mỗi dãy dữ liệu thu được, em hãy cho biết dữ liệu đó thuộc loại nào.
Kiến thức cần nhớ
Câu hỏi có đơn vị đo (giờ, kg, cm, …) sẽ cho dữ liệu là số.
Câu hỏi về tên gọi, sở thích thường cho dữ liệu không là số, không sắp thứ tự.
🧠 Phân tích tư duy
Câu (1) hỏi về "vật nuôi yêu thích" — câu trả lời là tên con vật (chó, mèo, …), không có thứ tự hơn kém tự nhiên. Câu (2) hỏi về "thời gian (giờ)" — đã có sẵn đơn vị đo nên câu trả lời chắc chắn là số. Nhìn vào chữ trong ngoặc "(giờ)" là dấu hiệu nhận ra ngay câu (2) cho dữ liệu số mà không cần thử nghiệm.
1Cách 1. Đặt câu hỏi mở rồi liệt kê câu trả lời
Định hướng. Đặt câu hỏi đơn giản, trực tiếp cho từng nội dung cần khảo sát, sau đó hỏi lần lượt các bạn và ghi lại nguyên văn câu trả lời.
Câu hỏi (1): "Vật nuôi yêu thích của bạn là gì?" Câu hỏi (2): "Trung bình mỗi ngày bạn dành bao nhiêu giờ cho hoạt động thể thao?" Phỏng vấn 5 bạn, thu được: Vật nuôi: Chó, Mèo, Chó, Cá cảnh, Mèo. Thời gian thể thao (giờ): 1; 0,5; 1; 2; 0,5.
Vậy câu hỏi (1) cho dãy dữ liệu tên các con vật, câu hỏi (2) cho dãy dữ liệu là số giờ.
2Cách 2. Đặt câu hỏi trắc nghiệm có sẵn phương án
Định hướng. Thay vì để trả lời tự do, cho sẵn các phương án để các bạn chọn — giúp việc thống kê sau này nhanh và ít sai lệch cách gọi tên hơn.
Câu hỏi (1): "Vật nuôi yêu thích của bạn là con nào trong các con sau: Chó / Mèo / Cá cảnh / Chim / Khác?" Câu hỏi (2): "Thời gian thể thao mỗi ngày của bạn thuộc mức nào: dưới 0,5 giờ / từ 0,5 đến 1 giờ / trên 1 giờ?" Phỏng vấn cùng 5 bạn như Cách 1, kết quả câu (2) nay là các mức thay vì số giờ cụ thể.
Vậy câu hỏi (1) vẫn cho dữ liệu không là số, không sắp thứ tự; nhưng câu hỏi (2) khi hỏi theo mức lại cho dữ liệu không là số, có thể sắp thứ tự — khác với Cách 1.
Nhận xét. Cùng một nội dung khảo sát nhưng cách đặt câu hỏi khác nhau có thể tạo ra hai LOẠI dữ liệu khác nhau, nên cần đặt câu hỏi (2) hỏi trực tiếp số giờ (như Cách 1) nếu muốn thu được dữ liệu là số.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 khi cần dữ liệu chính xác từng giờ (số liệu), nhưng nếu chỉ cần khảo sát nhanh và dễ thống kê thì Cách 2 (câu hỏi có phương án) hợp lí hơn.
Đáp số.Câu hỏi (1) cho dãy dữ liệu không là số, không sắp thứ tự. Câu hỏi (2), nếu hỏi trực tiếp số giờ, cho dãy dữ liệu là số (số liệu).
Sai lầm thường gặp.Đặt câu hỏi (2) kiểu "Bạn có tập thể thao nhiều không?" — câu trả lời sẽ là "Có/Không" hoặc mức độ, không còn là số giờ cụ thể như đề yêu cầu ("thời gian (giờ)"), làm sai mục tiêu khảo sát.
🚀 Mở rộng.Nếu khảo sát thêm "Bạn tập môn thể thao nào?" sẽ tạo ra một dãy dữ liệu thứ ba không là số, không sắp thứ tự, giống dãy vật nuôi yêu thích.
Bài 7 · Tranh luận (trang 90)★★Trang 90— Phân biệt số liệu và mã số (nhãn mang hình thức số)
Tranh luận (trang 90). Một số tuyến xe buýt ở Hà Nội mà bạn An đã đi là: 01; 02; 12; 15. Ba bạn tranh luận: "Đây là dãy số liệu." — "Đây không phải là dãy số liệu." — "Tuyến số 01 là tuyến đi từ Gia Lâm đến Yên Nghĩa đấy!" Em ủng hộ Vuông hay Tròn?
Kiến thức cần nhớ
Một giá trị viết bằng chữ số chưa chắc là số liệu — phải xét xem nó có mang ý nghĩa đo lường, tính toán được hay chỉ là mã/nhãn để phân biệt.
🧠 Phân tích tư duy
Dấu hiệu của bẫy: các giá trị 01; 02; 12; 15 trông giống con số nên dễ vội kết luận đây là dãy số liệu. Nhưng phải hỏi thêm: những "con số" này có dùng để ĐO ĐẾM hay TÍNH TOÁN không, hay chỉ dùng để GỌI TÊN tuyến xe? Ý kiến thứ ba ("Tuyến 01 đi từ Gia Lâm đến Yên Nghĩa") chính là gợi ý: 01 chỉ là một cái tên/mã hiệu, không phải một lượng đo được.
1Cách 1. Kiểm tra bằng phép toán: cộng, trừ, so sánh hơn kém có còn ý nghĩa không
Định hướng. Số liệu thật sự phải cộng, trừ hoặc so sánh "hơn — kém" có ý nghĩa; thử áp phép toán vào 01; 02; 12; 15 xem có hợp lí không.
Thử lấy tổng: 01 + 02 + 12 + 15 = 30 — con số 30 này không có ý nghĩa gì (không phải "tổng số tuyến" hay đại lượng nào). Thử so sánh: "tuyến 12 nhiều hơn tuyến 01 là 11" — câu này vô nghĩa, vì các tuyến không hơn kém nhau về lượng. Trong khi đó, mỗi mã số (01, 02, 12, 15) chỉ dùng để PHÂN BIỆT và GỌI TÊN một tuyến xe buýt cụ thể (như tên riêng).
Vậy đây không phải là dãy số liệu, mặc dù viết bằng chữ số — đây là dãy dữ liệu không là số (dạng mã hiệu), giống như dãy "tên các tỉnh".
2Cách 2. Đối chiếu với ví dụ đã biết (tên tỉnh, số áo cầu thủ)
Định hướng. Liên hệ với các trường hợp quen thuộc đã gặp: số áo cầu thủ, số nhà, mã bưu điện — đều là chữ số nhưng không phải số liệu, để nhận ra tuyến xe buýt cùng bản chất.
Số áo cầu thủ "9", "10" chỉ dùng để phân biệt cầu thủ, không dùng để cộng hay so sánh lượng. Số nhà "12", "15" chỉ dùng để xác định vị trí, không phải đại lượng đo. Tương tự, số hiệu tuyến xe buýt "01", "02", "12", "15" cũng chỉ là NHÃN để gọi tên tuyến, giống như tên tỉnh Ninh Bình, Hưng Yên ở Ví dụ 1.
Vậy kết luận giống Cách 1: dãy số hiệu tuyến xe buýt không phải là dãy số liệu — em ủng hộ ý kiến của Tròn.
Nhận xét. Đây là bẫy thường gặp: "viết bằng chữ số" khác với "là số liệu" — phải luôn kiểm tra ý nghĩa của con số đó trước khi kết luận.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (thử áp phép cộng/so sánh) vì đây là cách kiểm tra nhanh, áp dụng được cho mọi tình huống tương tự (số nhà, số áo, số điện thoại, …), không cần nhớ riêng từng ví dụ.
Đáp số.Em ủng hộ Tròn: dãy 01; 02; 12; 15 không phải là dãy số liệu, vì đây là các mã hiệu (nhãn) dùng để gọi tên tuyến xe buýt, không mang ý nghĩa đo đếm hay tính toán.
Sai lầm thường gặp.Thấy toàn chữ số nên vội kết luận "đây là dãy số liệu" (ý kiến của Vuông) — sai lầm rất phổ biến với các loại dữ liệu là mã số: số điện thoại, số căn cước, số áo cầu thủ, biển số xe đều mắc lỗi tương tự nếu không kiểm tra ý nghĩa.
🚀 Mở rộng.Cùng bản chất: mã số học sinh, số căn cước công dân, mã vùng điện thoại đều là dữ liệu không là số dù được viết hoàn toàn bằng chữ số.
Bài 8 · Hoạt động 4★★Trang 90— Nhận biết tính đại diện của dữ liệu
Hoạt động 4 (trang 90). Vuông và Tròn muốn tìm hiểu về mức độ thường xuyên lên thư viện trường của các bạn học sinh trong trường nên đã lập phiếu như Hình 5.1 ("Bạn có thường xuyên lên thư viện của trường không? Tích ✓ vào phương án bạn lựa chọn: Rất thường xuyên / Thường xuyên / Chỉnh thoảng / Không bao giờ") để tiến hành khảo sát. Vuông nói: "Mình chỉ cần phát phiếu khảo sát cho các bạn lên thư viện trường trong một tuần." Tròn nói: "Không, tớ nghĩ mỗi lớp cần chọn ngẫu nhiên 10 bạn để phát phiếu khảo sát." Em hãy thảo luận nhóm và cho biết dữ liệu thu được trong mỗi cách làm của Vuông và Tròn có đại diện cho toàn bộ học sinh trong trường không.
Kiến thức cần nhớ
Dữ liệu đảm bảo tính đại diện khi mẫu khảo sát phản ánh được toàn bộ đối tượng quan tâm, thường bằng cách chọn ngẫu nhiên.
🧠 Phân tích tư duy
Đối tượng cần quan tâm là "toàn bộ học sinh trong trường" — dấu hiệu để kiểm tra tính đại diện là so sánh nhóm được khảo sát với toàn bộ đối tượng này. Cách của Vuông chỉ khảo sát những bạn ĐÃ lên thư viện (một nhóm thiên lệch), còn cách của Tròn chọn ngẫu nhiên từ mọi lớp nên bao phủ được cả những bạn không lên thư viện.
1Cách 1. So sánh đối tượng được hỏi với đối tượng cần khảo sát
Định hướng. Xác định rõ "đối tượng quan tâm" của bài toán là ai, rồi xem mỗi cách khảo sát có hỏi đúng và đủ đối tượng đó không.
Đối tượng quan tâm: toàn bộ học sinh trong trường (gồm cả bạn có lên thư viện lẫn bạn không lên thư viện). Cách của Vuông: chỉ phát phiếu cho các bạn ĐANG lên thư viện trong tuần, suy ra bỏ sót hoàn toàn nhóm học sinh không lên thư viện. Cách của Tròn: mỗi lớp chọn ngẫu nhiên 10 bạn (không phân biệt bạn đó có hay lên thư viện), suy ra có mặt cả hai nhóm học sinh, từ mọi lớp trong trường.
Vậy dữ liệu theo cách của Vuông KHÔNG đảm bảo tính đại diện (chỉ phản ánh nhóm bạn hay lên thư viện); dữ liệu theo cách của Tròn ĐẢM BẢO tính đại diện.
2Cách 2. Xét ví dụ cực đoan để kiểm chứng
Định hướng. Tưởng tượng trường hợp cực đoan xảy ra với mỗi cách khảo sát để thấy rõ hệ quả nếu tiếp tục dùng cách đó.
Giả sử toàn trường có 1000 bạn nhưng chỉ có 5 bạn hay lên thư viện. Theo cách của Vuông: cả tuần chỉ phỏng vấn được đúng 5 bạn đó — kết luận rút ra (ví dụ "đa số học sinh rất thường xuyên lên thư viện") sẽ hoàn toàn sai lệch so với thực tế 1000 bạn. Theo cách của Tròn: mỗi lớp lấy ngẫu nhiên 10 bạn, tổng hợp từ nhiều lớp sẽ có đủ cả những bạn hay lên và không lên thư viện, phản ánh đúng tỉ lệ thật của cả trường.
Vậy kết luận giống Cách 1: cách của Tròn cho dữ liệu đại diện, cách của Vuông thì không.
Nhận xét. Chọn mẫu khảo sát ngay tại nơi mình muốn tìm câu trả lời có sẵn (thư viện) là lỗi chọn mẫu thiên lệch rất hay gặp trong thực tế.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (so sánh trực tiếp với đối tượng quan tâm) vì đây là cách kiểm tra tổng quát, áp dụng được ngay cho mọi bài về tính đại diện mà không cần dựng thêm ví dụ minh họa.
Đáp số.Cách khảo sát của Vuông không đảm bảo tính đại diện (chỉ hỏi các bạn đã lên thư viện). Cách khảo sát của Tròn (chọn ngẫu nhiên 10 bạn mỗi lớp) đảm bảo tính đại diện cho toàn trường.
Sai lầm thường gặp.Cho rằng cách của Vuông vẫn ổn vì "cũng hỏi được nhiều bạn trong một tuần" — sai, vì số lượng nhiều không quan trọng bằng việc mẫu khảo sát có phản ánh đúng CƠ CẤU của toàn bộ đối tượng hay không.
🚀 Mở rộng.Cùng lỗi chọn mẫu thiên lệch như cách của Vuông: khảo sát ý kiến khách hàng chỉ bằng cách phỏng vấn người đang xếp hàng tại cửa hàng (bỏ sót khách hàng không đến cửa hàng).
Bài 9 · Ví dụ 2★★Trang 91— Nhận biết tính đại diện của dữ liệu
Ví dụ 2 (trang 91). Một hãng hàng không muốn khảo sát ý kiến của khách hàng trên một chuyến bay để đánh giá mức độ hài lòng về chất lượng phục vụ trên chuyến bay đó. a) Em hãy cho biết đối tượng mà hãng hàng không này cần lấy ý kiến. b) Trong hai cách khảo sát sau, cách nào hợp lí hơn? Cách 1. Lấy ý kiến của 20 hành khách ở khoang hạng thương gia. Cách 2. Đánh số ngẫu nhiên 100 hành khách trên chuyến bay và xin ý kiến của những hành khách số 5; 10; 15; 20; …; 100.
Kiến thức cần nhớ
Đối tượng khảo sát phải là toàn bộ nhóm cần đánh giá, không chỉ một khoang/nhóm nhỏ.
Chọn mẫu cách đều nhau trên toàn bộ danh sách đã đánh số cũng là một cách chọn mẫu đảm bảo tính đại diện.
🧠 Phân tích tư duy
Đối tượng cần khảo sát là TẤT CẢ hành khách trên chuyến bay (gồm cả khoang thương gia lẫn khoang phổ thông), trong khi Cách 1 chỉ hỏi khoang thương gia — một nhóm nhỏ, không đại diện cho toàn bộ hành khách. Cách 2 đánh số toàn bộ 100 hành khách rồi chọn cách đều nhau (5; 10; 15; …; 100) — dấu hiệu của kiểu chọn mẫu ngẫu nhiên có hệ thống, phủ đều mọi khoang ghế.
1Cách 1. So sánh đối tượng khảo sát của từng cách với đối tượng cần đánh giá
Định hướng. Xác định rõ đối tượng hãng cần lấy ý kiến, rồi xét xem mỗi cách khảo sát có phủ đúng và đủ đối tượng đó không.
a) Đối tượng cần lấy ý kiến: tất cả hành khách trên chuyến bay (cả khoang thương gia lẫn khoang phổ thông), vì hãng muốn đánh giá chất lượng phục vụ cho cả chuyến bay. b) Cách 1: chỉ hỏi 20 hành khách khoang thương gia, suy ra bỏ sót hoàn toàn hành khách khoang phổ thông. Cách 2: đánh số ngẫu nhiên 100 hành khách rồi lấy đều đặn các số 5; 10; 15; …; 100 (cứ 5 người thì lấy 1), suy ra mẫu trải đều khắp danh sách, có cả khách khoang thương gia lẫn khoang phổ thông.
Vậy đối tượng cần lấy ý kiến là tất cả hành khách trên chuyến bay; Cách 2 hợp lí hơn Cách 1, vì Cách 1 bỏ sót khoang phổ thông còn Cách 2 phủ đều cả chuyến bay.
2Cách 2. Đối chiếu với lỗi chọn mẫu thiên lệch đã gặp ở HĐ4
Định hướng. Nhận ra Cách 1 mắc đúng lỗi chọn mẫu thiên lệch giống cách của Vuông ở HĐ4 (chỉ hỏi một nhóm đặc thù), còn Cách 2 giống cách chọn ngẫu nhiên của Tròn.
Ở HĐ4: Vuông chỉ hỏi các bạn hay lên thư viện, suy ra mẫu thiên lệch, không đại diện cho toàn trường. Cách 1 của Ví dụ 2 chỉ hỏi khoang thương gia — một nhóm hành khách cố định, có thể có yêu cầu dịch vụ khác khoang phổ thông, suy ra cùng kiểu thiên lệch. Ở HĐ4: Tròn chọn ngẫu nhiên 10 bạn mỗi lớp, suy ra đại diện. Cách 2 của Ví dụ 2 chọn cách đều 5; 10; …; 100 trên toàn bộ 100 hành khách đã đánh số ngẫu nhiên, suy ra cùng kiểu đại diện như cách của Tròn.
Vậy kết luận giống Cách 1: Cách 2 hợp lí hơn Cách 1, vì Cách 2 đảm bảo tính đại diện cho toàn bộ hành khách.
Nhận xét. Đánh số ngẫu nhiên rồi lấy cách đều nhau là một kĩ thuật chọn mẫu phổ biến, cho kết quả đại diện tương đương chọn ngẫu nhiên hoàn toàn.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (so sánh trực tiếp đối tượng khảo sát với đối tượng cần đánh giá) vì áp dụng ngay được cho mọi bài về tính đại diện, không cần nhớ lại HĐ4.
Đáp số.a) Đối tượng cần lấy ý kiến là tất cả hành khách trên chuyến bay. b) Cách 2 (đánh số ngẫu nhiên rồi lấy đều đặn các số 5; 10; …; 100) hợp lí hơn, vì Cách 1 chỉ hỏi khoang thương gia nên bỏ sót khoang phổ thông, không đảm bảo tính đại diện.
Sai lầm thường gặp.Cho rằng Cách 1 vẫn ổn vì "20 hành khách cũng là một số lượng không nhỏ" — sai, vì tính đại diện không phụ thuộc số lượng nhiều hay ít, mà phụ thuộc mẫu có phủ đều các nhóm hành khách khác nhau (khoang thương gia và khoang phổ thông) hay không.
🚀 Mở rộng.Nếu chuyến bay chỉ có một hạng ghế duy nhất, Cách 1 và Cách 2 sẽ không còn khác biệt về tính đại diện theo khoang ghế nữa.
Bài 10 · Luyện tập 2★★Trang 91— Nhận biết tính đại diện của dữ liệu
Luyện tập 2 (trang 91). Em hãy cho biết cách khảo sát sau có đảm bảo được tính đại diện không. Để đánh giá mức độ phù hợp của đề thi thử môn Toán, nhà trường đã cho các bạn trong câu lạc bộ Toán học làm bài và xem xét kết quả.
Kiến thức cần nhớ
Tính đại diện của dữ liệu bị phá vỡ khi mẫu khảo sát chỉ lấy từ một nhóm có đặc điểm riêng biệt, không phản ánh đúng toàn bộ đối tượng.
🧠 Phân tích tư duy
Đối tượng cần đánh giá là "đề thi thử môn Toán" dành cho học sinh toàn khối/toàn trường, nhưng mẫu khảo sát chỉ lấy từ "câu lạc bộ Toán học" — đây là nhóm học sinh có năng lực Toán thường cao hơn mặt bằng chung, giống hệt lỗi chọn mẫu thiên lệch đã gặp ở HĐ4 (chỉ hỏi các bạn hay lên thư viện) và ở Nhận xét trang 91 (chỉ lấy ý kiến bạn trong câu lạc bộ Toán học). Chỉ cần so sánh đối tượng khảo sát với đối tượng cần đánh giá là đủ kết luận, không cần biết điểm số cụ thể của đề thi.
1Cách 1. So sánh đối tượng được khảo sát với đối tượng cần đánh giá
Định hướng. Xác định đối tượng thật sự cần đánh giá độ phù hợp của đề (toàn thể học sinh sẽ thi), rồi so với đối tượng đã được chọn làm bài (chỉ câu lạc bộ Toán học).
Đối tượng cần đánh giá: toàn bộ học sinh sẽ dự kì thi thử, gồm nhiều trình độ khác nhau (giỏi, khá, trung bình, yếu). Đối tượng được chọn khảo sát: chỉ các bạn trong câu lạc bộ Toán học — đây là nhóm học sinh yêu thích và thường học tốt môn Toán hơn mặt bằng chung. Suy ra Mẫu khảo sát không bao gồm các bạn có học lực trung bình, yếu — nhóm này thường đánh giá đề "khó" hơn nhóm giỏi Toán.
Vậy cách khảo sát này KHÔNG đảm bảo tính đại diện.
2Cách 2. Đối chiếu với tình huống tương tự đã học (HĐ4)
Định hướng. Nhận ra cấu trúc bài toán giống hệt HĐ4 (cách của Vuông): chọn mẫu ngay trong một nhóm có sẵn đặc điểm liên quan đến chủ đề khảo sát.
Ở HĐ4, Vuông chỉ hỏi các bạn hay lên thư viện khi khảo sát về "mức độ lên thư viện", suy ra mẫu thiên lệch, không đại diện. Ở bài này, nhà trường chỉ cho các bạn giỏi Toán (câu lạc bộ Toán học) làm bài rồi đánh giá độ khó của đề dành cho MỌI học sinh, suy ra cùng kiểu chọn mẫu thiên lệch: chỉ lấy nhóm có liên hệ đặc biệt với chủ đề (giỏi Toán) để đánh giá cho cả nhóm chung.
Vậy kết luận giống Cách 1: cách khảo sát này không đảm bảo tính đại diện, vì kết quả sẽ thiên về hướng "đề dễ" hơn thực tế.
Nhận xét. Muốn đánh giá đúng độ phù hợp của đề cho toàn khối, phải chọn ngẫu nhiên học sinh từ nhiều lớp, nhiều trình độ khác nhau — giống cách của Tròn ở HĐ4.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (so sánh trực tiếp đối tượng khảo sát với đối tượng cần đánh giá) vì đây là cách kiểm tra tổng quát áp dụng được cho mọi bài về tính đại diện, không cần nhớ lại bài cũ.
Đáp số.Cách khảo sát này không đảm bảo tính đại diện, vì chỉ lấy ý kiến của các bạn trong câu lạc bộ Toán học — một nhóm nhỏ có học lực Toán thường tốt hơn mặt bằng chung, không phản ánh đúng cảm nhận của toàn thể học sinh dự thi.
Sai lầm thường gặp.Cho rằng khảo sát vẫn hợp lí vì "các bạn trong câu lạc bộ Toán học cũng là học sinh của trường" — sai, vì tính đại diện đòi hỏi mẫu phải phản ánh đúng CƠ CẤU trình độ của toàn bộ học sinh dự thi, không chỉ cần "cùng là học sinh trường".
🚀 Mở rộng.Muốn khảo sát đúng, nhà trường nên chọn ngẫu nhiên một số học sinh từ mỗi lớp trong khối (không phân biệt học lực) để làm thử đề, giống cách của Tròn ở Hoạt động 4.
Bài 11 · Ví dụ 3★★Trang 91— Nhận biết tính đại diện của dữ liệu
Ví dụ 3 (trang 91). Một công ty dược phẩm đã khảo sát hiệu quả sử dụng của một loại thuốc trị cảm cúm bằng cách cho 100 người bệnh ở độ tuổi từ 20 đến 30 sử dụng loại thuốc này. Kết quả cho thấy có 95 người đã khỏi bệnh sau ba ngày sử dụng thuốc. Công ty đưa ra thông tin quảng cáo về sản phẩm: "Tỉ lệ người dùng khỏi bệnh sau ba ngày sử dụng thuốc đạt 95%." Theo em, dựa vào khảo sát trên mà đưa ra kết luận như trong quảng cáo thì có hợp lí không? Vì sao?
Kiến thức cần nhớ
Kết luận chỉ hợp lí khi đối tượng khảo sát trùng khớp với đối tượng được nói đến trong kết luận.
🧠 Phân tích tư duy
Kết luận trong quảng cáo nói về "người dùng" nói chung (không giới hạn độ tuổi), nhưng khảo sát chỉ thực hiện trên người bệnh 20-30 tuổi — bẫy giống hệt cấu trúc dạng bài Bài 5.5 sắp gặp: đối tượng khảo sát hẹp hơn đối tượng trong kết luận. Cần kiểm tra xem hiệu quả thuốc có thể khác nhau giữa các độ tuổi hay không để đánh giá tính hợp lí.
1Cách 1. So sánh đối tượng khảo sát với đối tượng trong kết luận quảng cáo
Định hướng. Đọc kĩ đối tượng ĐÃ khảo sát (người 20-30 tuổi) và đối tượng trong CÂU QUẢNG CÁO ("người dùng" nói chung), rồi so sánh.
Đối tượng đã khảo sát: 100 người bệnh ở độ tuổi từ 20 đến 30. Đối tượng trong kết luận quảng cáo: "người dùng" nói chung, không giới hạn độ tuổi (có thể gồm trẻ em, người cao tuổi, …). Mà hiệu quả của thuốc có thể khác nhau giữa các độ tuổi (trẻ em, người già thường phản ứng với thuốc khác người trưởng thành). Suy ra Kết quả khảo sát trên 100 người 20-30 tuổi không thể suy rộng cho mọi độ tuổi.
Vậy kết luận trong quảng cáo là không hợp lí, vì đối tượng khảo sát (chỉ 20-30 tuổi) không đại diện cho đối tượng nêu trong kết luận (mọi người dùng thuốc).
2Cách 2. Xét ví dụ cực đoan để kiểm chứng
Định hướng. Giả sử một trường hợp cực đoan để thấy rõ vì sao suy luận của công ty có thể sai.
Giả sử thuốc này thực tế không hiệu quả với trẻ em hoặc người cao tuổi (do liều lượng, thể trạng khác biệt), chỉ hiệu quả với người trưởng thành 20-30 tuổi. Khi đó tỉ lệ khỏi bệnh 95% chỉ đúng cho riêng nhóm 20-30 tuổi đã khảo sát. Nếu quảng cáo vẫn ghi chung là "người dùng" (không giới hạn độ tuổi), người tiêu dùng ở độ tuổi khác có thể hiểu nhầm và kỳ vọng sai về hiệu quả thuốc.
Vậy kết luận giống Cách 1: kết luận trong quảng cáo không hợp lí, vì đã suy rộng kết quả từ một nhóm hẹp (20-30 tuổi) ra cho mọi người dùng.
Nhận xét. Đây là lỗi phổ biến trong quảng cáo sản phẩm: chỉ thử nghiệm trên một nhóm nhỏ rồi công bố kết quả như thể đúng cho tất cả mọi người.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (so sánh trực tiếp hai đối tượng) vì là cách lập luận tổng quát nhất, áp dụng ngay được cho mọi bài tương tự.
Đáp số.Kết luận trong quảng cáo không hợp lí, vì đối tượng khảo sát chỉ là người bệnh 20-30 tuổi, không đảm bảo tính đại diện cho toàn bộ người dùng thuốc ở mọi độ tuổi.
Sai lầm thường gặp.Cho rằng kết luận vẫn đúng vì "95 trên 100 người là một tỉ lệ khảo sát rất cao, đáng tin cậy" — nhầm lẫn giữa ĐỘ CHÍNH XÁC của tỉ lệ trong mẫu đã khảo sát với TÍNH ĐẠI DIỆN của mẫu đó cho một đối tượng rộng hơn (mọi độ tuổi).
🚀 Mở rộng.Nếu công ty sửa lại quảng cáo thành "Tỉ lệ người dùng khỏi bệnh sau ba ngày sử dụng thuốc đạt 95% (thử nghiệm trên người 20-30 tuổi)" thì kết luận đó mới đúng với đối tượng đã khảo sát.
Bài 12 · Tranh luận (trang 92)★★Trang 92— So sánh hai phương án khảo sát theo tính đại diện
Tranh luận (trang 92). Làm cách nào để thực hiện khảo sát thời gian sử dụng mạng Internet vào hai ngày cuối tuần của mỗi bạn học sinh trong trường? Một bạn nói: "Tớ sẽ chọn ngẫu nhiên một số bạn và gửi bảng hỏi đến bố mẹ của các bạn đó yêu cầu trả lời và gửi lại phiếu." Bạn khác nói: "Còn tớ sẽ gửi phiếu hỏi đến các bạn trong câu lạc bộ Tin học của trường." Theo em, cách làm của bạn nào hợp lí hơn?
Kiến thức cần nhớ
Chọn mẫu ngẫu nhiên từ toàn bộ đối tượng đảm bảo tính đại diện tốt hơn chọn mẫu từ một nhóm có đặc điểm riêng liên quan đến chủ đề khảo sát.
🧠 Phân tích tư duy
Đối tượng cần khảo sát là "mỗi bạn học sinh trong trường". Cách thứ nhất chọn NGẪU NHIÊN một số bạn (không phân biệt sở thích, học lực) nên có khả năng đại diện cho toàn trường; cách thứ hai chỉ gửi phiếu cho câu lạc bộ Tin học — một nhóm có thể dùng Internet nhiều hơn hoặc khác cách so với học sinh nói chung, đây là bẫy chọn mẫu thiên lệch quen thuộc như ở HĐ4 và Luyện tập 2.
1Cách 1. So sánh cách chọn mẫu của hai bạn với đối tượng cần khảo sát
Định hướng. Xét xem mỗi cách chọn mẫu có phủ đều được mọi kiểu học sinh trong trường hay chỉ tập trung vào một nhóm đặc thù.
Đối tượng quan tâm: mọi học sinh trong trường (không phân biệt sở thích công nghệ). Cách 1 (chọn ngẫu nhiên rồi hỏi qua phụ huynh): mẫu được chọn ngẫu nhiên trong toàn trường, suy ra có đủ mọi kiểu học sinh, không thiên về nhóm nào. Cách 2 (gửi phiếu cho câu lạc bộ Tin học): chỉ hỏi các bạn yêu thích Tin học/công nghệ — nhóm này thường có thời gian dùng Internet khác biệt (có thể nhiều hơn) so với học sinh nói chung.
Vậy cách chọn ngẫu nhiên (cách 1) hợp lí hơn, vì đảm bảo tính đại diện cho toàn trường; cách gửi phiếu cho câu lạc bộ Tin học (cách 2) không hợp lí vì mẫu thiên lệch.
2Cách 2. Đối chiếu với các bài đã gặp (HĐ4, Luyện tập 2)
Định hướng. Nhận ra bài này lặp lại đúng cấu trúc hai bài trước: một cách chọn ngẫu nhiên toàn trường, một cách chọn từ một câu lạc bộ có liên quan tới chủ đề khảo sát.
Ở HĐ4: chọn ngẫu nhiên 10 bạn mỗi lớp (đại diện) ↔ chỉ hỏi các bạn hay lên thư viện (thiên lệch). Ở Luyện tập 2: chỉ hỏi câu lạc bộ Toán học (thiên lệch) khi cần đánh giá đề cho mọi học sinh. Ở bài này: chọn ngẫu nhiên rồi hỏi qua phụ huynh (giống kiểu "đại diện" của HĐ4) ↔ chỉ hỏi câu lạc bộ Tin học (giống kiểu "thiên lệch" của Luyện tập 2, vì Tin học liên quan trực tiếp đến việc dùng Internet).
Vậy kết luận giống Cách 1: cách chọn ngẫu nhiên hợp lí hơn cách gửi phiếu cho câu lạc bộ Tin học.
Nhận xét. Câu lạc bộ Tin học đặc biệt dễ gây thiên lệch cho khảo sát về Internet, vì bản thân việc tham gia câu lạc bộ đã cho thấy các bạn này quan tâm tới công nghệ nhiều hơn bình thường.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (so sánh trực tiếp với đối tượng cần khảo sát) vì là cách kiểm tra tổng quát, không phụ thuộc việc đã làm bài tương tự trước đó hay chưa.
Đáp số.Cách làm của bạn thứ nhất (chọn ngẫu nhiên một số bạn, gửi bảng hỏi qua phụ huynh) hợp lí hơn, vì đảm bảo tính đại diện cho toàn trường; cách gửi phiếu cho câu lạc bộ Tin học không hợp lí vì đây là nhóm có thể dùng Internet khác biệt so với học sinh nói chung.
Sai lầm thường gặp.Cho rằng cách gửi phiếu cho câu lạc bộ Tin học tốt hơn vì "các bạn đó rành công nghệ, trả lời chính xác hơn" — nhầm lẫn giữa ĐỘ CHÍNH XÁC của từng câu trả lời với TÍNH ĐẠI DIỆN của cả mẫu khảo sát; câu trả lời có thể chính xác nhưng vẫn không đại diện cho số đông.
🚀 Mở rộng.Nếu trường muốn khảo sát riêng về thói quen dùng Internet của các bạn yêu thích công nghệ (không phải toàn trường), thì lúc đó chọn mẫu từ câu lạc bộ Tin học mới là hợp lí.
Bài 5.1 (trang 92). Với mỗi câu hỏi sau, hãy xác định xem dữ liệu thu được thuộc loại nào. a) Bạn có cho rằng đọc sách là một thói quen tốt? A. Rất đồng ý B. Đồng ý C. Không đồng ý D. Rất không đồng ý. b) Ca sĩ Việt Nam nào bạn thích nhất?
Kiến thức cần nhớ
Dữ liệu không là số có hai loại: sắp được thứ tự (các mức độ) và không sắp được thứ tự (tên gọi).
🧠 Phân tích tư duy
Câu (a) cho sẵn bốn mức độ theo thang từ đồng ý cao xuống thấp — dấu hiệu của dữ liệu không là số nhưng sắp được thứ tự (giống dãy "mức độ hấp dẫn" ở HĐ1). Câu (b) hỏi tên riêng một ca sĩ — không có mức hơn kém tự nhiên giữa các tên, nên là dữ liệu không sắp được thứ tự (giống dãy "tên tỉnh" ở Ví dụ 1).
1Cách 1. Đối chiếu với sơ đồ phân loại
Định hướng. Với mỗi câu, kiểm tra câu trả lời có là số không; nếu không, kiểm tra có sắp được theo mức hơn — kém không.
a) Câu trả lời là một trong bốn mức: Rất đồng ý, Đồng ý, Không đồng ý, Rất không đồng ý — không phải số, nhưng sắp được theo thứ tự từ đồng ý nhiều nhất đến ít nhất. Suy ra Câu (a) cho dữ liệu không là số, có thể sắp thứ tự. b) Câu trả lời là tên một ca sĩ (ví dụ: Mỹ Tâm, Sơn Tùng M-TP, …) — không phải số, và không có ca sĩ nào "hơn" hay "kém" ca sĩ khác theo một thứ tự chung. Suy ra Câu (b) cho dữ liệu không là số, không thể sắp thứ tự.
Vậy câu (a) cho dữ liệu không là số nhưng sắp được thứ tự; câu (b) cho dữ liệu không là số và không sắp được thứ tự.
2Cách 2. So sánh với ví dụ mẫu đã học
Định hướng. Nhận ra câu (a) có cùng cấu trúc với câu hỏi (3) ở HĐ1 (Rất đồng ý → Rất không đồng ý), còn câu (b) có cùng cấu trúc với dãy "tên tỉnh" ở Ví dụ 1.
Ở HĐ1, câu hỏi mức độ hấp dẫn với 4 lựa chọn (Rất đồng ý, Đồng ý, Không đồng ý, Rất không đồng ý) đã được xác định là dữ liệu không là số, sắp được thứ tự. Câu (a) của bài này dùng nguyên bốn mức đó, suy ra cùng loại dữ liệu. Ở Ví dụ 1, dãy tên tỉnh (Ninh Bình, Hưng Yên, Bắc Ninh) được xác định là dữ liệu không là số, không sắp được thứ tự. Câu (b) hỏi tên ca sĩ — cùng kiểu "tên riêng" như tên tỉnh, suy ra cùng loại dữ liệu.
Vậy kết luận giống Cách 1: câu (a) không là số, sắp được thứ tự; câu (b) không là số, không sắp được thứ tự.
Nhận xét. Nhận ra cấu trúc quen thuộc giúp trả lời nhanh mà không cần phân tích lại từ đầu.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 vì luôn áp dụng được cho mọi câu hỏi mới, không phụ thuộc việc đã gặp ví dụ tương tự hay chưa.
Đáp số.a) Dữ liệu không là số, có thể sắp xếp theo thứ tự. b) Dữ liệu không là số, không thể sắp xếp theo thứ tự.
Sai lầm thường gặp.Nhầm câu (a) là dãy số liệu vì có thể đánh số thứ tự A, B, C, D cho các phương án — sai, vì các chữ A, B, C, D chỉ là kí hiệu phương án trả lời, còn dữ liệu THẬT SỰ thu được là các CHỮ (Rất đồng ý, Đồng ý, …), không phải con số.
🚀 Mở rộng.Nếu câu (a) đổi thành "Cho điểm từ 1 đến 10 cho mức độ đồng ý" thì dữ liệu thu được sẽ trở thành dãy số liệu, khác với hình thức bốn mức chữ như đề gốc.
Bài 14 · Bài 5.2★★Trang 92— Thiết kế phương án thu thập dữ liệu đảm bảo tính đại diện
Bài 5.2 (trang 92). Vuông đưa ra ý kiến về tay thuận của các học sinh trong trường như hình bên ("Đa phần học sinh trong trường thuận tay phải"). Em hãy đưa ra phương án thu thập dữ liệu phù hợp để giúp Vuông kiểm tra ý kiến của mình nhé!
Kiến thức cần nhớ
Kiểm tra một nhận định về toàn bộ đối tượng cần thu thập dữ liệu từ một mẫu ngẫu nhiên, đại diện cho đối tượng đó.
🧠 Phân tích tư duy
Ý kiến của Vuông là một nhận định về "đa phần học sinh trong trường" — muốn kiểm tra đúng sai phải thu thập dữ liệu về TAY THUẬN từ một mẫu ĐẠI DIỆN cho toàn trường, tránh lặp lại lỗi chọn mẫu thiên lệch đã gặp ở HĐ4 (chỉ hỏi một nhóm đặc thù, ví dụ chỉ hỏi một lớp hoặc một câu lạc bộ). Dữ liệu thu được ở đây là tay thuận (trái/phải), không phải số, nên chỉ cần thống kê tỉ lệ mỗi loại, không cần tính trung bình.
1Cách 1. Lập bảng hỏi và chọn mẫu ngẫu nhiên theo lớp
Định hướng. Đặt một câu hỏi đơn giản về tay thuận, rồi chọn ngẫu nhiên một số bạn ở MỖI lớp trong trường để đảm bảo mẫu bao phủ đều mọi khối lớp.
Câu hỏi: "Bạn thuận tay nào? A. Tay phải B. Tay trái C. Cả hai tay." Cách chọn mẫu: mỗi lớp trong trường chọn ngẫu nhiên 5 bạn để trả lời câu hỏi trên (giống cách của Tròn ở HĐ4). Tổng hợp số bạn chọn A, B, C từ tất cả các lớp thành một bảng thống kê chung của toàn trường.
Vậy ta thu được dãy dữ liệu về tay thuận (không là số, không sắp được thứ tự) đại diện cho toàn trường, đủ để kiểm tra ý kiến của Vuông.
2Cách 2. Quan sát trực tiếp một mẫu ngẫu nhiên
Định hướng. Thay vì hỏi, có thể quan sát trực tiếp tay các bạn dùng để viết trong một mẫu học sinh được chọn ngẫu nhiên — tránh trường hợp học sinh trả lời sai do không để ý.
Chọn ngẫu nhiên một số lớp trong trường (ví dụ mỗi khối chọn 2 lớp). Trong mỗi lớp được chọn, quan sát TẤT CẢ học sinh khi các bạn viết bài, ghi lại tay đang cầm bút (trái/phải). Tổng hợp kết quả quan sát của các lớp đã chọn thành bảng thống kê chung.
Vậy ta cũng thu được dãy dữ liệu tay thuận đại diện cho toàn trường, nhưng bằng phương pháp quan sát thay vì bảng hỏi.
Nhận xét. Cách 2 tránh sai sót do học sinh trả lời nhầm, nhưng tốn công quan sát hơn Cách 1 khi trường có nhiều lớp.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (bảng hỏi + chọn ngẫu nhiên theo lớp) vì nhanh gọn, dễ tổ chức với quy mô toàn trường; Cách 2 chỉ nên dùng khi số lớp được chọn không quá nhiều.
Đáp số.Chọn ngẫu nhiên một số bạn ở mỗi lớp trong trường (không chọn theo một nhóm đặc thù nào) rồi hỏi hoặc quan sát tay thuận của các bạn đó, sau đó tổng hợp thành bảng thống kê chung cho toàn trường.
Sai lầm thường gặp.Chỉ hỏi tay thuận của các bạn trong MỘT lớp hoặc MỘT câu lạc bộ rồi suy ra kết luận cho cả trường — mắc lại lỗi chọn mẫu thiên lệch giống cách của Vuông ở HĐ4, không đảm bảo tính đại diện.
🚀 Mở rộng.Có thể mở rộng khảo sát thêm để so sánh tỉ lệ thuận tay trái/phải giữa các khối lớp khác nhau, không chỉ dừng ở kiểm tra ý kiến "đa phần thuận tay phải".
Bài 15 · Bài 5.3★★Trang 92— Thiết kế bảng hỏi kiểm tra một nhận định so sánh giữa hai nhóm
Bài 5.3 (trang 92). Vân muốn kiểm tra nhận định "Các bạn học sinh nam yêu thích các chương trình thể thao hơn các bạn nữ". Hãy lập bảng hỏi và thu thập dữ liệu để kiểm tra nhận định này.
Kiến thức cần nhớ
Khi kiểm tra một nhận định so sánh hai nhóm, bảng hỏi cần thêm câu hỏi phân loại nhóm (ở đây là giới tính) bên cạnh câu hỏi chính.
🧠 Phân tích tư duy
Nhận định cần kiểm tra so sánh HAI NHÓM (nam và nữ) về cùng một tiêu chí (mức độ yêu thích chương trình thể thao) — dấu hiệu cho thấy bảng hỏi cần có thêm một câu hỏi phụ để ghi nhận giới tính người trả lời, rồi mới hỏi đến mức độ yêu thích, để sau này tách được kết quả theo từng nhóm. Thiếu câu hỏi phân loại nhóm là lỗi phổ biến nhất khi thiết kế bảng hỏi kiểu so sánh.
1Cách 1. Bảng hỏi hai câu: phân loại nhóm rồi hỏi mức độ yêu thích
Định hướng. Đặt câu hỏi đầu tiên để xác định bạn trả lời là nam hay nữ, câu hỏi thứ hai để đo mức độ yêu thích chương trình thể thao theo thang bốn mức.
Bảng hỏi: 1. Bạn là: ☐ Nam ☐ Nữ. 2. Bạn yêu thích các chương trình thể thao ở mức nào? ☐ Rất thích ☐ Thích ☐ Không thích ☐ Rất không thích. Phát bảng hỏi cho một mẫu ngẫu nhiên gồm cả bạn nam và bạn nữ trong lớp (hoặc trong trường), thu phiếu rồi TÁCH RIÊNG kết quả câu 2 theo từng nhóm ở câu 1 (nhóm nam, nhóm nữ).
Vậy ta thu được hai dãy dữ liệu về mức độ yêu thích thể thao — một dãy của các bạn nam, một dãy của các bạn nữ — để so sánh và kiểm tra nhận định của Vân.
2Cách 2. Hai bảng hỏi riêng biệt cho từng nhóm
Định hướng. Thay vì gộp chung một bảng hỏi có câu phân loại, phát riêng hai loại phiếu — một cho các bạn nam, một cho các bạn nữ — cùng một câu hỏi về mức độ yêu thích.
Phiếu dành cho bạn nam: "Bạn yêu thích các chương trình thể thao ở mức nào?" kèm 4 lựa chọn như Cách 1. Phiếu dành cho bạn nữ: giữ nguyên câu hỏi và 4 lựa chọn như trên. Phát đúng loại phiếu cho đúng nhóm học sinh (nam nhận phiếu nam, nữ nhận phiếu nữ), thu lại và thống kê riêng từng loại phiếu.
Vậy ta cũng thu được hai dãy dữ liệu tách sẵn theo nhóm nam, nữ, tương tự Cách 1.
Nhận xét. Cách 1 gọn hơn (chỉ một loại phiếu, không nhầm lẫn khi phát), Cách 2 dễ nhầm khi phát sai phiếu cho từng bạn nhưng lại không cần thêm câu hỏi phân loại.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (một bảng hỏi có thêm câu phân loại giới tính) vì chỉ cần một loại phiếu, dễ tổ chức và không sợ phát nhầm phiếu.
Đáp số.Lập bảng hỏi gồm câu phân loại giới tính (nam/nữ) và câu hỏi mức độ yêu thích chương trình thể thao (4 mức), phát cho mẫu ngẫu nhiên cả nam lẫn nữ, sau đó so sánh mức độ yêu thích trung bình giữa hai nhóm để kiểm tra nhận định của Vân.
Sai lầm thường gặp.Chỉ hỏi mức độ yêu thích mà QUÊN hỏi thêm giới tính người trả lời — khi đó không thể tách riêng dữ liệu của nhóm nam và nhóm nữ, không kiểm tra được nhận định cần so sánh giữa hai nhóm.
🚀 Mở rộng.Có thể mở rộng bảng hỏi để so sánh theo nhiều tiêu chí khác nhau, ví dụ so sánh mức độ yêu thích thể thao giữa các khối lớp thay vì giữa nam và nữ.
Bài 16 · Bài 5.4★★Trang 92— Nhận biết tính đại diện của dữ liệu
Bài 5.4 (trang 92). Các dữ liệu thu thập được trong mỗi trường hợp sau có đảm bảo tính đại diện không? a) Trong một khu dân cư có 5 000 hộ gia đình. Để xác định trung bình mỗi hộ gia đình có bao nhiêu ti vi, một nhóm nghiên cứu đã thu thập dữ liệu bằng cách đánh số các hộ gia đình từ 1 đến 5 000 và ghi lại số ti vi của những hộ gia đình có số thứ tự là 1; 11; …; 4 991. b) Để đánh giá thể lực của học sinh toàn trường, giáo viên thể dục đã cho các bạn trong câu lạc bộ bóng đá của trường chạy cự li 1 000 m và ghi lại kết quả.
Kiến thức cần nhớ
Mẫu chọn cách đều (theo số thứ tự cố định bước nhảy) trên toàn bộ đối tượng vẫn đảm bảo tính đại diện, tương tự chọn ngẫu nhiên.
Mẫu chỉ lấy từ một nhóm có đặc điểm riêng liên quan tới nội dung khảo sát thì không đại diện.
🧠 Phân tích tư duy
Câu (a) chọn mẫu theo quy luật cách đều (1; 11; 21; …; 4 991, mỗi 10 hộ chọn 1 hộ) — đây là kiểu chọn NGẪU NHIÊN CÓ HỆ THỐNG, phủ đều khắp 5 000 hộ, giống cách 2 của hãng hàng không ở Ví dụ 2. Câu (b) chỉ chọn học sinh trong CÂU LẠC BỘ BÓNG ĐÁ — nhóm có thể lực tốt hơn mặt bằng chung — để đánh giá cho toàn trường, đây là bẫy chọn mẫu thiên lệch quen thuộc như ở HĐ4, Luyện tập 2.
1Cách 1. Kiểm tra độ phủ của mẫu trên toàn bộ đối tượng
Định hướng. Với mỗi câu, so sánh mẫu được chọn với đối tượng cần khảo sát: mẫu có phủ đều, không thiên về đặc điểm nào không.
a) Đối tượng: toàn bộ 5 000 hộ gia đình. Mẫu chọn: các hộ số 1; 11; 21; …; 4 991, cách đều nhau 10 hộ, trải dài khắp danh sách 5 000 hộ, không thiên về khu vực hay nhóm hộ nào. Suy ra Dữ liệu thu thập được đảm bảo tính đại diện. b) Đối tượng: toàn bộ học sinh trong trường (nhiều mức thể lực khác nhau). Mẫu chọn: chỉ các bạn trong câu lạc bộ bóng đá — nhóm thường có thể lực tốt hơn học sinh nói chung. Suy ra Dữ liệu thu thập được không đảm bảo tính đại diện.
Vậy trường hợp (a) đảm bảo tính đại diện; trường hợp (b) không đảm bảo tính đại diện.
2Cách 2. Đối chiếu với hai ví dụ mẫu đã học
Định hướng. Nhận ra câu (a) có cùng cấu trúc với Cách 2 của Ví dụ 2 (đánh số ngẫu nhiên rồi lấy các số cách đều nhau), còn câu (b) có cùng cấu trúc với cách của Vuông ở HĐ4 và Luyện tập 2.
Ở Ví dụ 2, Cách 2 (đánh số 100 hành khách rồi lấy khách số 5; 10; …; 100, cách đều 5) đã được xác định là hợp lí, đảm bảo đại diện. Câu (a) đánh số 5 000 hộ rồi lấy hộ số 1; 11; …; 4 991 (cách đều 10), suy ra cùng kiểu chọn mẫu cách đều như Ví dụ 2, suy ra đảm bảo đại diện. Ở HĐ4 và Luyện tập 2, chỉ hỏi một nhóm đặc thù (bạn hay lên thư viện, câu lạc bộ Toán học) đã được xác định là không đại diện. Câu (b) chỉ chọn câu lạc bộ bóng đá, suy ra cùng kiểu chọn mẫu thiên lệch như hai bài đó, suy ra không đảm bảo đại diện.
Vậy kết luận giống Cách 1: câu (a) đảm bảo tính đại diện, câu (b) không đảm bảo tính đại diện.
Nhận xét. Chọn mẫu cách đều nhau trên toàn danh sách (như câu a) là một dạng chọn mẫu ngẫu nhiên có hệ thống, vẫn đảm bảo tính đại diện như chọn ngẫu nhiên thông thường.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (kiểm tra độ phủ của mẫu) vì áp dụng trực tiếp, không cần nhớ lại các ví dụ đã học; Cách 2 chỉ hữu ích để kiểm tra chéo kết quả.
Đáp số.a) Dữ liệu thu thập được đảm bảo tính đại diện (mẫu chọn cách đều, trải khắp 5 000 hộ). b) Dữ liệu thu thập được không đảm bảo tính đại diện (chỉ lấy từ câu lạc bộ bóng đá, một nhóm có thể lực không đại diện cho toàn trường).
Sai lầm thường gặp.Cho rằng câu (a) không đại diện vì "chỉ chọn được 500 trong 5 000 hộ, quá ít" — nhầm lẫn giữa SỐ LƯỢNG mẫu với CÁCH CHỌN mẫu; điều quyết định tính đại diện là mẫu có phủ đều, ngẫu nhiên hay không, chứ không chỉ là số lượng nhiều hay ít.
🚀 Mở rộng.Nếu câu (b) đổi cách chọn thành "chọn ngẫu nhiên một số bạn ở mỗi lớp trong trường" (không phân biệt có chơi bóng đá hay không) thì dữ liệu thu được sẽ đảm bảo tính đại diện.
Bài 17 · Bài 5.5★★Trang 92— Nhận biết tính đại diện của dữ liệu
Bài 5.5 (trang 92). Bình phỏng vấn 50 bạn nam trong trường thấy có 30 bạn thích bóng đá. Bình kết luận rằng "Đa phần các học sinh thích bóng đá". Kết luận này có hợp lí không?
Kiến thức cần nhớ
Kết luận chỉ hợp lí khi đối tượng khảo sát trùng khớp với đối tượng được nói đến trong kết luận.
🧠 Phân tích tư duy
Kết luận của Bình nói về "đa phần CÁC HỌC SINH" (cả nam lẫn nữ), nhưng dữ liệu chỉ thu thập từ 50 bạn NAM — đây chính là bẫy: đối tượng khảo sát (chỉ nam) hẹp hơn đối tượng trong kết luận (mọi học sinh), giống hệt cấu trúc của Ví dụ 3 (khảo sát người 20–30 tuổi nhưng kết luận cho mọi người dùng thuốc). Tỉ lệ 30/50 tính trong nhóm nam là đúng, chỉ có việc suy rộng ra cho cả trường là sai.
1Cách 1. So sánh đối tượng khảo sát với đối tượng trong kết luận
Định hướng. Đọc kĩ hai đối tượng: đối tượng ĐÃ khảo sát (50 bạn nam) và đối tượng trong CÂU KẾT LUẬN ("các học sinh", tức là cả nam lẫn nữ), rồi so sánh xem có khớp nhau không.
Đối tượng đã khảo sát: 50 bạn nam trong trường. Đối tượng trong kết luận: "các học sinh" — không nói riêng nam hay nữ, tức là bao gồm cả học sinh nữ. Mà sở thích bóng đá giữa học sinh nam và học sinh nữ thường khác nhau đáng kể (bóng đá thường được các bạn nam yêu thích nhiều hơn). Suy ra Kết quả 30/50 bạn nam thích bóng đá KHÔNG thể suy rộng ra cho cả các bạn nữ.
Vậy kết luận của Bình không hợp lí, vì đối tượng khảo sát (chỉ nam) không đại diện cho đối tượng nêu trong kết luận (mọi học sinh, cả nam lẫn nữ).
2Cách 2. Đối chiếu với Ví dụ 3 đã học
Định hướng. Nhận ra cấu trúc bài này giống hệt Ví dụ 3: khảo sát trên một nhóm hẹp (người 20–30 tuổi / học sinh nam) rồi đưa ra kết luận cho một nhóm rộng hơn (mọi người dùng thuốc / mọi học sinh).
Ở Ví dụ 3: khảo sát 100 người tuổi 20–30 dùng thuốc, kết luận "95% người dùng khỏi bệnh" cho MỌI người dùng thuốc (mọi độ tuổi) — không hợp lí vì đối tượng khảo sát hẹp hơn đối tượng trong kết luận. Ở bài này: khảo sát 50 bạn NAM, kết luận "đa phần CÁC HỌC SINH thích bóng đá" cho cả nam lẫn nữ — cùng kiểu suy rộng từ nhóm hẹp ra nhóm rộng hơn.
Vậy kết luận giống Cách 1: kết luận của Bình không hợp lí, vì lí do hoàn toàn tương tự Ví dụ 3.
Nhận xét. Đây là lỗi suy luận rất phổ biến: khảo sát trên một nhóm nhỏ đặc thù rồi vội kết luận chung cho cả một tập thể lớn hơn nhiều.
⭐ Cách nên dùng khi đi thi.Nên dùng Cách 1 (so sánh trực tiếp hai đối tượng) vì là cách lập luận tổng quát nhất, áp dụng ngay được cho mọi bài tương tự mà không cần nhớ lại ví dụ cũ.
Đáp số.Kết luận của Bình không hợp lí, vì Bình chỉ khảo sát 50 bạn nam nhưng lại kết luận cho "đa phần các học sinh" (bao gồm cả nam lẫn nữ) — đối tượng khảo sát không đại diện cho đối tượng nêu trong kết luận.
Sai lầm thường gặp.Cho rằng kết luận vẫn đúng vì "30 trên 50 bạn đã là đa số rồi" — nhầm lẫn giữa việc tính đúng TỈ LỆ trong mẫu (30/50 = 60%, đúng là đa số trong nhóm nam được hỏi) với việc suy rộng tỉ lệ đó cho một đối tượng khác (toàn thể học sinh) mà chưa được khảo sát.
🚀 Mở rộng.Nếu Bình sửa lại kết luận thành "Đa phần các bạn NAM trong trường thích bóng đá" (đúng đối tượng đã khảo sát) thì kết luận đó mới hợp lí.