VietnamAI.orgHiểu đúng AI, đi trước cùng Việt Nam
Hiểu AI từ gốc

Học sâu và mạng nơ-ron là gì, khác học máy chỗ nào?

Học sâu là một nhánh của học máy dùng mạng nơ-ron nhiều lớp, tự tìm ra đặc điểm cần nhìn trong ảnh, tiếng, chữ thay vì để người chỉ định sẵn.

Kỹ sư trẻ ngồi quán cà phê Đà Lạt vẽ sơ đồ các lớp trên sổ tay

Học sâu là một nhánh của học máy, dùng mạng nơ-ron nhân tạo gồm nhiều lớp chồng lên nhau. Điểm khác lớn nhất: với học máy kiểu cũ, người làm phải tự chỉ cho máy nên nhìn vào đặc điểm nào, còn học sâu tự tìm ra những đặc điểm đó từ dữ liệu thô như ảnh, âm thanh, chữ viết.

Nhờ vậy học sâu làm được những việc trước kia gần như bó tay: nhận giọng nói tiếng Việt, đọc chữ viết tay trên phiếu, phân biệt hàng chục loại bệnh trên lá. Đổi lại nó đói dữ liệu, tốn điện, và khó giải thích vì sao ra quyết định như vậy.

Bài này giải thích mạng nơ-ron "nhìn" một bức ảnh như thế nào, chữ "sâu" nghĩa là gì, vì sao cần loại chip đặc biệt, và lúc nào thì một mô hình học máy đơn giản lại là lựa chọn khôn hơn.

Mạng nơ-ron nhìn một bức ảnh như thế nào?

Tên gọi "nơ-ron" mượn từ sinh học, nhưng đừng hình dung nó giống não thật. Mỗi nơ-ron nhân tạo chỉ là một phép tính nhỏ: nhận vài con số đầu vào, nhân mỗi số với một trọng số, cộng lại, rồi quyết định có "bật" mạnh hay yếu. Hàng nghìn phép tính như vậy xếp thành một lớp, nhiều lớp nối tiếp nhau thành một mạng.

Lấy ví dụ một hợp tác xã muốn phân loại trái thanh long đạt chuẩn xuất khẩu qua ảnh chụp trên băng chuyền. Lớp đầu của mạng chỉ nhận ra những thứ rất đơn giản: chỗ đổi màu, đường viền, mảng sáng tối. Lớp tiếp theo ghép các đường viền thành hình cong, đốm, vết xước. Lớp sâu hơn nữa ghép tiếp thành khái niệm như "tai trái bị héo", "vỏ có vết thâm".

Không ai lập trình sẵn "hãy tìm vết thâm". Mạng tự hình thành những bộ dò đó vì chúng giúp đoán đúng nhãn mà người phân loại đã gắn cho ảnh. Chữ "sâu" chính là số lớp nhiều, mỗi lớp xây trên kết quả của lớp trước, từ đơn giản lên phức tạp.

Còn học máy kiểu cũ thì sao? Người làm phải tự đo trước: đường kính trái, tỉ lệ màu đỏ, số đốm. Máy chỉ học cách kết hợp những con số người đã chọn. Chọn đúng đặc điểm thì chạy tốt, quên mất một đặc điểm quan trọng thì máy không bao giờ tự nghĩ ra.

Vì mạng tự tìm đặc điểm, nên nó cũng có thể tìm nhầm. Mạng có thể học rằng ảnh trái đạt chuẩn hay có nền băng chuyền màu xanh, chỉ vì tình cờ lô ảnh tốt chụp ở dây chuyền mới. Người làm học sâu giỏi luôn kiểm tra xem mạng đang nhìn vào vùng nào của ảnh.

Vì sao học sâu cần nhiều dữ liệu và chip mạnh?

Số trọng số rất lớn. Một mạng nhận ảnh bình thường có hàng triệu trọng số cần chỉnh. Ít dữ liệu mà nhiều trọng số thì mạng dễ học thuộc lòng.

Mỗi ảnh là rất nhiều con số. Một ảnh điện thoại có hàng triệu điểm ảnh, mỗi điểm ba màu. Mạng phải nhân cộng trên toàn bộ.

Phép tính lặp lại giống nhau. Phần lớn là nhân ma trận, tức nhân cộng hàng loạt con số theo cùng một kiểu, rất hợp với chip làm nhiều phép tính song song.

Chip đồ hoạ hoá ra rất hợp. Loại chip vốn sinh ra để vẽ hình trò chơi làm hàng nghìn phép tính cùng lúc, nên huấn luyện nhanh hơn chip máy tính thường rất nhiều lần.

Huấn luyện tốn hơn dùng. Dạy một mạng có thể mất nhiều ngày trên cụm máy, nhưng dùng mạng đã dạy để nhận một ảnh chỉ mất chớp mắt, chạy được cả trên điện thoại.

Điện năng là chi phí thật. Phòng máy chạy chip liên tục cần điện và làm mát. Đây là lý do hạ tầng AI gắn chặt với chuyện nguồn điện.

Học chuyển giao cứu doanh nghiệp nhỏ. Không ai buộc phải dạy từ đầu. Lấy mạng đã học hàng triệu ảnh chung, dạy thêm vài nghìn ảnh thanh long là đủ cho nhiều việc.

Tăng cường dữ liệu. Xoay, lật, đổi độ sáng ảnh có sẵn để mạng quen nhiều điều kiện chụp mà không phải chụp thêm.

Dữ liệu phải đúng bối cảnh dùng. Mạng học ảnh chụp đèn trắng trong xưởng sẽ vấp khi đem ra chụp dưới nắng ngoài bãi.

Mạng nhỏ cho thiết bị nhỏ. Có kỹ thuật nén mạng cho chạy trên điện thoại, camera giá rẻ, đổi lại chính xác giảm đôi chút.

Không phải lúc nào to cũng tốt hơn. Mạng lớn hơn cần dữ liệu tương xứng. Thiếu dữ liệu thì mạng vừa phải thường cho kết quả ổn định hơn.

Các kiểu mạng nơ-ron hay gặp, mỗi kiểu giỏi việc gì

Mạng tích chập. Quét ảnh từng mảng nhỏ bằng các bộ lọc, giỏi nhận vật thể, đọc biển số, soi lỗi sản phẩm trên dây chuyền.

Mạng hồi quy. Xử lý chuỗi theo thứ tự, từng được dùng nhiều cho giọng nói và văn bản trước khi transformer phổ biến.

Transformer. Nhìn cả chuỗi cùng lúc và tự cân chữ nào liên quan chữ nào. Nền móng của mô hình ngôn ngữ lớn và nhiều mô hình ảnh hiện nay.

Bộ mã hoá tự động. Nén dữ liệu rồi dựng lại, hay dùng để tìm điểm bất thường như máy móc chạy khác lạ.

Mô hình khuếch tán. Học cách gỡ nhiễu từng bước để tạo ảnh mới từ mô tả. Nền tảng của nhiều công cụ tạo ảnh.

Mạng đồ thị. Làm việc với dữ liệu dạng mạng lưới quan hệ, như tuyến giao hàng hay quan hệ giữa các tài khoản ngân hàng.

Mạng đa phương thức. Nhận cùng lúc chữ, ảnh, tiếng. Ví dụ chụp ảnh tờ hoá đơn rồi hỏi bằng lời tổng tiền là bao nhiêu.

Mạng nhận giọng nói. Chuyển sóng âm thành chữ. Với tiếng Việt, thanh điệu là thử thách riêng vì cùng một âm, đổi dấu là đổi nghĩa.

Mạng tổng hợp giọng. Đọc văn bản thành tiếng tự nhiên. Đi kèm nguy cơ giả giọng người thật để lừa đảo.

Mạng gợi ý. Kết hợp lịch sử xem, mua của nhiều người để đoán món bạn thích. Chạy ngầm trong các ứng dụng mua sắm, xem phim.

Mạng điều khiển. Kết hợp với học tăng cường để điều khiển robot, drone phun thuốc theo đường bay an toàn.

Khi nào học máy đơn giản lại là lựa chọn khôn hơn?

Học sâu nổi tiếng đến mức nhiều người nghĩ cứ bài toán AI là phải dùng nó. Thực tế ở các doanh nghiệp, rất nhiều bài toán có dữ liệu dạng bảng, như lịch sử đơn hàng, thông tin khách, số liệu kho. Với loại dữ liệu này, các mô hình học máy truyền thống như cây quyết định ghép lại thường cho kết quả ngang hoặc tốt hơn, chạy nhanh, rẻ và dễ giải thích hơn.

Dễ giải thích quan trọng hơn ta nghĩ. Một ngân hàng từ chối khoản vay cần nói được lý do. Một trường học dùng mô hình phát hiện học sinh có nguy cơ bỏ học cần biết mô hình dựa vào đâu để thầy cô can thiệp đúng chỗ. Mô hình đơn giản cho phép nhìn thấy yếu tố nào nặng ký, còn mạng nơ-ron sâu thì khó soi hơn nhiều.

Quy tắc dân làm nghề hay dùng: dữ liệu thô như ảnh, tiếng, chữ thì nghĩ tới học sâu. Dữ liệu bảng, ít dòng, cần giải thích thì bắt đầu bằng mô hình đơn giản và chỉ chuyển sang học sâu khi chứng minh được là hơn rõ rệt. Bắt đầu bằng thứ đơn giản cũng cho bạn một mốc để so sánh.

Một sai lầm hay gặp ở các dự án nhỏ là đổ công dựng mạng nơ-ron cầu kỳ trong khi dữ liệu còn lộn xộn. Kết quả kém, người làm đổ cho mô hình, rồi đổi mô hình khác, vẫn kém. Gốc rễ thường nằm ở dữ liệu. Dọn dữ liệu trước, chọn mô hình sau.

Những điểm yếu của học sâu cần biết trước khi dùng

Khó giải thích. Biết mạng đúng hay sai, nhưng hỏi vì sao thì câu trả lời mù mờ. Có công cụ soi vùng ảnh mạng chú ý, nhưng chỉ là gợi ý.

Dễ bị đánh lừa. Thay đổi rất nhỏ trên ảnh, mắt người không thấy, có thể làm mạng nhận sai hoàn toàn.

Tự tin quá mức. Mạng có thể báo chắc chắn rất cao với một ảnh nó chưa từng gặp loại tương tự.

Phụ thuộc điều kiện thu dữ liệu. Đổi loại camera, đổi góc đặt máy là chính xác có thể tụt rõ.

Học theo định kiến dữ liệu. Dữ liệu khuôn mặt ít người da sẫm thì nhận diện nhóm đó kém hơn.

Tốn kém khi huấn luyện lại. Cập nhật mạng lớn không đơn giản như sửa một công thức.

Quên kiến thức cũ. Dạy thêm việc mới có thể làm mạng kém đi ở việc cũ nếu không làm cẩn thận.

Cần người gắn nhãn chuyên môn. Ảnh y khoa phải bác sĩ gắn, ảnh bệnh cây phải kỹ sư nông nghiệp gắn. Công sức này thường bị đánh giá thấp.

Khó kiểm thử hết. Phần mềm thường thử được từng nhánh luật, mạng nơ-ron thì không có nhánh luật nào để thử.

Bảo mật mô hình. Mạng có thể vô tình nhớ một phần dữ liệu học, kể cả thông tin riêng tư nếu dữ liệu không được làm sạch.

Vẫn cần người chịu trách nhiệm. Dù chính xác cao, quyết định ảnh hưởng tới sức khoẻ, tiền bạc cần người có chuyên môn xem lại.

Câu hỏi thường gặp

Mạng nơ-ron nhân tạo có giống não người không?

Chỉ giống ở ý tưởng ban đầu là nhiều đơn vị nhỏ nối với nhau. Cách học, cách vận hành và quy mô đều khác não thật rất xa, nên đừng suy từ mạng nơ-ron ra hiểu biết về não.

Bao nhiêu lớp thì được gọi là học sâu?

Không có ranh giới chính thức. Thường người ta gọi là học sâu khi mạng có nhiều lớp ẩn giữa đầu vào và đầu ra, từ vài lớp trở lên, và các mạng hiện đại có thể lên tới hàng trăm lớp.

Có thể chạy học sâu trên máy tính cá nhân không?

Dùng mạng đã huấn luyện thì được, nhiều mạng nhỏ chạy cả trên điện thoại. Huấn luyện mạng lớn từ đầu thì cần máy có chip đồ hoạ mạnh hoặc thuê máy chủ đám mây.

Học sâu có thay được chuyên gia không?

Nó làm tốt một số bước lặp lại, như sàng lọc ảnh hay phân loại sơ bộ, giúp chuyên gia tập trung vào ca khó. Quyết định cuối cùng và trách nhiệm vẫn thuộc về người có chuyên môn.

Người mới nên học gì trước khi học học sâu?

Nên nắm học máy cơ bản trước: chia dữ liệu học và chấm, sai số, quá khớp. Sau đó học thêm một thư viện lập trình phổ biến và tự làm vài bài nhỏ với dữ liệu ảnh có sẵn.

Cần tư vấn cụ thể cho trường hợp của bạn?

Chúng tôi sẽ liên hệ trong vòng 24 giờ.

Đăng ký tư vấn ngay

Bài viết liên quan

Bạn cần hỗ trợ thêm?

Để lại thông tin, chúng tôi sẽ liên hệ trong 24 giờ.