1/66
Looks like no tags are added yet.
Name | Mastery | Learn | Test | Matching | Spaced | Call with Kai | Chat |
|---|
No analytics yet
Send a link to your students to track their progress
Chọn phát biểu sai về khoa học dữ liệu
Bigdata là công nghệ lưu trữ và khai thác dữ liệu có dung lượng lớn (volume), đa dạng (variety), yêu cầu tốc độ cao (velocity) và có tính xác thực (Veracity)
Kết quả mà khoa học dữ liệu hướng đến là
Tri thức
Khoa học dữ liệu là một lĩnh vực giao thoa giữa
Toán học/thống kê, Kiến thức chuyên ngành, Khoa học máy tính (Tất cả đều đúng)
Các nhà khoa học dữ liệu thường sử dụng kỹ thuật phân tích và thống kê nào sau đây?
Tất cả đều đúng (Hồi quy, Phân cụm, Phân loại)
Bước đầu tiên trong quy trình khoa học dữ liệu là gì?
Xác định một giả thuyết phân tích có thể mang lại giá trị kinh doanh
Sự khác biệt chính giữa nhà khoa học dữ liệu và kỹ sư dữ liệu là gì?
Một kỹ sư dữ liệu xây dựng các đường dẫn dữ liệu và giúp chuẩn bị dữ liệu, trong khi một nhà khoa học dữ liệu chịu trách nhiệm thu thập, chuẩn bị và phân tích dữ liệu
Chọn phát biểu SAI về dữ liệu, thông tin, tri thức
Dữ liệu là sự chi tiết hóa của thông tin
Chọn một đáp án KHÔNG PHẢI là nguyên nhân của sự bùng nổ thông tin
Sự phát triển của các ngành Khoa học tự nhiên, Khoa học xã hội...
Để biết điều gì đã xảy ra, người quản lý yêu cầu thông tin kết quả có được từ việc
Phân tích mô tả (Descriptive Analytics)
Để tìm hiểu lý do tại sao một điều gì đó đã xảy ra, người quản lý yêu cầu thông tin kết quả có được từ việc
Phân tích chuẩn đoán (Diagnostic Analytics)
Để tìm hiểu điều gì sẽ xảy ra, người quản lý yêu cầu thông tin kết quả có được từ việc
Phân tích dự đoán (Predictive Analytics)
Để tìm hiểu điều gì nên làm tiếp theo, người quản lý yêu cầu thông tin kết quả có được từ việc
Phân tích quy luật (Prescriptive Analytics)
Chọn phát biểu ĐÚNG về các thành phần của analytics
Tất cả các đáp án đều đúng (Description, prediction, prescription đều là thành phần của analytics)
Quy trình phân tích dữ liệu gồm
Tất cả các phát biểu đều đúng (Data preprocessing, Data transformation, Data Analysis/Making decisions)
Thứ tự của (1) Data transformation và (2) Data Integration trong quy trình phân tích dữ liệu
Data Integration rồi đến Data transformation ((2) rồi đến (1))
Trích xuất những tri thức kinh doanh được ẩn chứa bên trong dữ liệu và cung cấp cho những người cần nó là mục đích của
BI (Business Intelligence)
Các nguồn dữ liệu có thể có trong các thành phần của BI (Business Intelligence) là
Tất cả các nguồn dữ liệu (Purchased Data, Operational Data, Social Data)
Các cấp độ ứng dụng BI được liệt kê từ thấp đến cao là
Informing; Deciding; Problem Solving; Project Management
Chọn phát biểu ĐÚNG về giai đoạn transformation
Thay đổi toàn diện doanh nghiệp (tư duy, mô hình kinh doanh,...)
Chọn giai đoạn phù hợp nhất cho một công ty đang triển khai những hệ thống cho phép khách hàng đặt mua hàng qua thiết bị di động
Digitalization
AI (Trí tuệ nhân tạo) là viết tắt của cụm từ
Artificial Intelligence
AI (Trí tuệ nhân tạo) có khả năng
Tất cả các phát biểu đều đúng (Giải quyết vấn đề, Nhận thức, Giao tiếp ngôn ngữ)
Chọn phát biểu ĐÚNG về Thông minh nhân tạo (Artificial Intelligence - AI)
AI là khả năng máy tính bắt chước con người
Thuật ngữ Blockchain thực chất chỉ là
Cơ sở dữ liệu lưu trữ thông tin
Big Data là thuật ngữ liên quan đến
Tất cả các đáp án đều đúng (Dữ liệu lớn, Dữ liệu đa nguồn gốc, Dữ liệu đa định dạng)
Công cụ thống kê mô tả nào được sử dụng khi cần tổng hợp dữ liệu đa chiều
PivotTable
Công cụ thống kê mô tả nào có thể sử dụng trong trường hợp dữ liệu 2 chiều
Tất cả đều đúng (Subtotal, Consolidate, PivotTable)
Để hợp nhất dữ liệu từ nhiều bảng không cùng cấu trúc khác nhau ta sử dụng
Tự làm bằng tay
Để tính chỉ số EMA của chứng khoán người ta sử dụng phương pháp nào sau đây
Trung bình trượt (Moving Average)
Để dự đoán xu hướng tăng/giảm của một mã chứng khoán bất kỳ dựa trên thông tin về giá cả, lượng cổ phiếu mua vào và bán ra của các ngày trước đó, ta sử dụng công cụ nào sau đây
Hồi quy (Regression)
Định dạng dữ liệu nào sau đây khác với các loại dữ liệu còn lại (âm thanh, ảnh, video, số)
Dữ liệu số
Quy trình khai thác dữ liệu gồm mấy bước
6
Lựa chọn nào sau đây không phải là một bước trong quy trình khai thác dữ liệu
Data mining
Thuộc tính "Loại khách hàng" có các giá trị: "VIP", "Premium" và "Economic" là thuộc tính thuộc kiểu dữ liệu nào sau đây
Định danh
Tiền xử lý dữ liệu không bao gồm các bước nào sau đây
Thu thập dữ liệu
Có mấy cách dùng để xử lý khi dữ liệu bị thiếu
3
Khi nào thì ta cần rời rạc hóa dữ liệu
Dữ liệu thuộc kiểu số học
Phân lớp dữ liệu là thuộc phương pháp
Có giám sát
Số giai đoạn chính trong quy trình phân lớp dữ liệu (Classification)
2
Thuật toán phân lớp tham gia vào quá trình nào sau đây trong mô hình phân lớp dữ liệu
Huấn luyện
Dữ liệu mới trong quá trình phân lớp dữ liệu là
Dữ liệu chưa được phân lớp
Sự khác biệt giữa dữ liệu huấn luyện và dữ liệu kiểm thử
Dữ liệu kiểm thử có thuộc tính phân lớp nhưng bị ẩn đi
Chọn công việc KHÔNG thuộc giai đoạn sử dụng mô hình phân lớp (Model Usage)
Đánh giá độ chính xác của mô hình
Thuật toán phân lớp nào sau đây cho phép xử lý trên nhiều kiểu/loại dữ liệu khác nhau
Cây quyết định
Ưu điểm của thuật toán Cây quyết định (Decision tree)
Không đòi hỏi chuẩn hóa dữ liệu
Thuật toán SVM là viết tắt của cụm từ
Support Vector Machine
SVM thường áp dụng cho bài toán
Phân lớp (Classification)
Hàm hồi quy logistic (Logistic Regression) thường áp dụng cho bài toán
Phân lớp (Classification)
Trong Orange, biến có kiểu dữ liệu categorical là để chỉ các thuộc tính
Rời rạc
Những hiện tượng mà mô hình phân lớp thường gặp phải
Underfitting, (Good) Fitting và Overfitting
Phương pháp chọn mẫu dữ liệu nào sau đây dùng để khắc phục tình trạng over-fitting
Đánh giá chéo (k-fold cross validation)
Đối với bài toán phân lớp đa nhãn thì chỉ số đánh giá nào thường được dùng để đánh giá độ hiệu quả của mô hình phân lớp
F1-score
F-score là giá trị trung bình điều hòa (harmonic mean) của hai độ đo
Precision và Recall
Giá trị a[i;j] trong ma trận nhầm lẫn (confusion matrix) cho biết
Số lượng mẫu i được phân nhầm vào mẫu j
Chọn phát biểu SAI về ma trận nhầm lẫn (Confusion Matrix)
Tổng giá trị của một dòng (hay một cột) có thể = 0
Một người nghi ngờ bệnh lao đi xét nghiệm, kết quả cho thấy bị lao trong khi thật sự không mắc bệnh. Trường hợp này gọi là
Tỷ lệ báo động nhầm
Chọn phát biểu SAI về ứng dụng phân lớp dữ liệu (Classification)
Dự đoán giá USD
Chọn phát biểu SAI về phân lớp dữ liệu (Classification) liên quan đến thuộc tính mục tiêu
Thuộc tính mục tiêu (target variable) phải là kiểu dữ liệu định lượng
Chọn phát biểu SAI về phân lớp dữ liệu (Classification) liên quan đến số lớp gán cho đối tượng
Mỗi đối tượng chỉ được xếp vào 1 lớp
Phân tích giỏ hàng là một kỹ thuật khai thác dữ liệu
Không giám sát
Phân cụm dữ liệu là thuộc phương pháp
Không giám sát
Một phương pháp phân cụm/gom cụm tốt là phương pháp cho kết quả mà trong đó
Độ tương đồng bên trong cụm cao, đồng thời độ tương đồng giữa các cụm thấp
Thuật toán nào sau đây cho phép một phần tử có thể thuộc về một hoặc nhiều cụm khác nhau
Fuzzy C-mean
Thuật toán phân cụm nào sau đây không cần biết trước số cụm
DBSCAN
Trong Orange, đối với thuật toán phân cụm phân cấp (HAC) để có được kết quả phân cụm với số lượng cụm cụ thể ta cần làm gì?
Chọn đường cắt phù hợp trên cây phân cấp kết quả
So sánh kết quả giữa các mô hình/thuật toán phân cụm khác nhau để xem xét tính hiệu quả của việc phân cụm thuộc cách đánh giá nào
Đánh giá tương đối
Trong Orange, đối với thuật toán K-mean, tham số đầu vào nào sau đây dùng để kiểm soát trong trường hợp dữ liệu hội tụ chậm hoặc không hội tụ
Số lần lặp tối đa (maximum iterations)