AI tạo ảnh không đi tìm một bức ảnh có sẵn rồi cắt dán lại. Nó bắt đầu từ một khung toàn hạt nhiễu, giống màn hình tivi mất sóng, rồi qua vài chục bước gỡ nhiễu, mỗi bước nhích bức ảnh lại gần hơn với câu mô tả bạn gõ vào. Những gì nó "biết" về cái bàn, con mèo hay ánh nắng buổi chiều là các quy luật thống kê rút ra từ rất nhiều cặp ảnh và chữ.
Hiểu được cơ chế này thì nhiều chuyện tưởng kỳ quặc trở nên dễ hiểu: vì sao bàn tay có lúc sáu ngón, vì sao chữ trên biển hiệu thành ký tự lạ, vì sao cùng một câu lệnh mà mỗi lần ra một ảnh khác. Bài này giải thích từng bước, không cần công thức, và chỉ ra chỗ nào người dùng ở Việt Nam hay hiểu nhầm.
Từ màn hình mất sóng đến bức ảnh: quá trình gỡ nhiễu
Hình dung bạn có một tấm ảnh chụp quán cà phê vỉa hè. Lúc huấn luyện, người ta rắc nhiễu lên tấm ảnh ấy từng chút một, qua nhiều nấc, cho tới khi nó chỉ còn là một đám hạt xám. Mô hình được giao một việc duy nhất: nhìn một tấm ảnh đang bị nhiễu ở một nấc nào đó và đoán xem phần nhiễu nào đã được rắc thêm vào. Lặp lại việc đoán này trên một khối lượng ảnh khổng lồ, mô hình dần học được ảnh "thật" thường trông ra sao: cạnh bàn thẳng, bóng đổ theo hướng nắng, lá cây có gân.
Khi bạn dùng, quá trình chạy ngược lại. Máy khởi đầu bằng một khung nhiễu hoàn toàn ngẫu nhiên. Ở mỗi bước, mô hình đoán phần nào là nhiễu và bớt đi một ít. Sau vài chục bước, đám hạt dần lộ ra hình khối, rồi màu, rồi chi tiết. Người trong nghề gọi loại này là mô hình khuếch tán, vì quá trình huấn luyện giống như mực khuếch tán dần trong nước, còn lúc tạo ảnh là gom mực lại.
Câu mô tả của bạn đi vào ở đâu? Trước khi gỡ nhiễu, câu chữ được một bộ phận khác chuyển thành một dãy số đại diện cho ý nghĩa. Dãy số ấy được đưa vào ở mọi bước, như một người đứng bên cạnh nhắc: "nhớ là quán cà phê, ghế nhựa thấp, buổi sáng". Mô hình không đọc câu như người đọc, nó chỉ dùng dãy số đó để lệch hướng gỡ nhiễu về phía những ảnh từng đi kèm với những chữ tương tự.
Vì bắt đầu từ nhiễu ngẫu nhiên nên mỗi lần chạy là một điểm xuất phát khác. Con số quyết định điểm xuất phát này thường được gọi là hạt giống. Giữ nguyên câu lệnh và hạt giống thì ra ảnh gần như y hệt, đổi hạt giống thì bố cục đổi hẳn. Đây là lý do một bạn làm thiết kế ở Đà Nẵng có thể tạo ba mươi phương án logo trong một buổi sáng, nhưng muốn sửa đúng một chi tiết của phương án thứ mười hai thì lại khó hơn nhiều.
Một điểm hay bị hiểu sai: mô hình không lưu sẵn kho ảnh rồi lục ra. Kích thước của nó nhỏ hơn rất nhiều so với lượng ảnh đã học, nên thứ còn lại chủ yếu là quy luật. Tuy vậy, với những hình ảnh xuất hiện quá nhiều lần trong dữ liệu, như một bức tranh nổi tiếng hay một nhân vật hoạt hình quen thuộc, mô hình có thể vẽ ra thứ rất giống bản gốc. Đó là chỗ chuyện bản quyền bắt đầu rắc rối.
Vì sao AI vẽ sai tay, sai chữ, sai số lượng?
Bàn tay khó vì quá nhiều tư thế. Trong ảnh, bàn tay hay bị che, cầm đồ, nắm lại, chụp nghiêng. Mô hình thấy vô số dáng tay nhưng ít khi thấy đủ năm ngón rõ ràng, nên nó học được "cảm giác bàn tay" hơn là cấu trúc đếm được.
Mô hình không biết đếm. Nó không có khái niệm "năm" như người. Nó chỉ thấy vùng ảnh trông giống ngón tay hay chưa. Vì vậy câu lệnh "ba cái ly" vẫn có thể ra bốn cái ly.
Chữ là hình, không phải chữ. Với mô hình, chữ trên biển hiệu chỉ là nét cong nét thẳng. Nó bắt chước được dáng chữ nhưng không nắm chính tả, nên biển "Phở Bò" dễ thành một chuỗi ký tự vô nghĩa.
Tiếng Việt có dấu càng khó. Dấu thanh và dấu mũ chồng lên nhau là chi tiết nhỏ, ít gặp trong dữ liệu huấn luyện so với chữ Latinh trơn. Muốn chữ đúng, cách chắc nhất vẫn là thêm chữ bằng phần mềm thiết kế sau.
Quan hệ không gian dễ lẫn. Câu "con mèo ngồi trên hộp, con chó nằm dưới bàn" có hai đối tượng và hai quan hệ. Mô hình hay trộn: mèo dưới bàn, chó trên hộp. Càng nhiều vế, càng dễ sai.
Thuộc tính bị lây sang nhau. Gõ "áo đỏ, quần xanh" có khi ra áo xanh quần đỏ, hoặc cả bộ đỏ. Màu sắc trong dãy số ý nghĩa không gắn chặt với từng món đồ như mình nghĩ.
Khuôn mặt nhỏ ở xa thường méo. Gương mặt chiếm vài chục điểm ảnh không đủ chỗ cho mắt mũi miệng. Ảnh đám đông ở chợ Bến Thành do AI vẽ thường đẹp từ xa, phóng to thì người ở hậu cảnh méo mó.
Vật thể Việt Nam ít dữ liệu. Nón lá, xe ba gác, gánh hàng rong, bàn thờ gia tiên xuất hiện ít hơn nhiều so với đồ vật phương Tây. Kết quả hay lai: nón lá giống nón châu Á chung chung, áo dài thành kimono.
Ánh sáng đẹp không có nghĩa là đúng vật lý. Bóng đổ có thể đi hai hướng khác nhau trong cùng ảnh. Mắt người lướt qua khó thấy, nhưng ảnh dùng cho quảng cáo kiến trúc hay nội thất thì lộ ngay.
Mỗi lần sửa là một lần vẽ lại. Bảo "giữ nguyên, chỉ đổi màu áo" thì nhiều công cụ vẽ lại cả khung, gương mặt cũng đổi. Công cụ có chức năng tô vùng để sửa cục bộ sẽ đỡ hơn.
Sai sót không ngẫu nhiên hoàn toàn. Lỗi hay rơi vào đúng những chỗ dữ liệu thiếu hoặc rối. Biết vậy thì bạn kiểm ảnh có trọng tâm: tay, chữ, số lượng, đồ vật đặc thù Việt Nam.
Những hiểu lầm phổ biến về AI vẽ tranh
"AI cắt ghép ảnh trên mạng." Không đúng về cơ chế. Ảnh được dựng từ nhiễu theo quy luật đã học. Nhưng như đã nói, với hình quá phổ biến, kết quả có thể giống bản gốc đến mức có vấn đề.
"Câu lệnh càng dài càng tốt." Câu dài với nhiều ý mâu thuẫn làm mô hình rối. Câu rõ chủ thể, bối cảnh, ánh sáng, góc máy thường hơn một đoạn văn dài đầy tính từ.
"Gõ tiếng Anh mới ra ảnh đẹp." Nhiều công cụ hiểu tiếng Việt khá ổn với ý đơn giản. Nhưng với chi tiết tinh như chất liệu, kiểu ánh sáng, tiếng Anh vẫn thường ăn khớp hơn vì dữ liệu nhiều hơn.
"Có hạt giống là tái tạo được mãi." Chỉ đúng khi cùng phiên bản mô hình và cùng cài đặt. Nhà cung cấp cập nhật mô hình là cùng hạt giống ra ảnh khác.
"Ảnh AI không ai nhận ra." Nhiều ảnh mang dấu hiệu: da mịn quá mức, hậu cảnh nhòe vô lý, chữ vô nghĩa. Một số công cụ còn gắn dữ liệu đánh dấu nguồn gốc vào tệp ảnh.
"Độ phân giải cao là chi tiết thật." Phóng ảnh lên lớn, máy tự "bịa" thêm chi tiết cho đầy. Ảnh in khổ lớn cho bảng quảng cáo cần soát kỹ từng góc.
"AI hiểu thương hiệu của mình." Nó không biết màu nhận diện hay kiểu chữ riêng của bạn trừ khi bạn đưa ảnh mẫu hoặc huấn luyện thêm. Mặc định, ảnh sẽ mang thẩm mỹ phổ thông.
"Ảnh AI là ảnh miễn phí, dùng thoải mái." Điều khoản mỗi công cụ khác nhau, và quyền đối với ảnh do AI tạo ở nhiều nơi còn đang tranh cãi. Dùng cho thương mại nên đọc kỹ điều khoản và hỏi luật sư khi cần.
"AI sẽ thay hết người chụp ảnh." Ảnh sản phẩm thật, ảnh sự kiện, ảnh chân dung khách hàng vẫn cần máy ảnh. AI mạnh ở ảnh minh họa, ảnh ý tưởng, ảnh nền.
"Không cần kỹ năng gì." Người có mắt thẩm mỹ, hiểu bố cục và ánh sáng ra ảnh tốt hơn hẳn. AI tăng tốc người giỏi nhiều hơn là thay người chưa biết.
"Ảnh xấu là do công cụ dở." Nhiều khi là do yêu cầu một việc mô hình vốn yếu, như chữ dài hay sơ đồ chính xác. Đổi cách làm hợp lý hơn đổi công cụ.
Dùng hiểu biết này vào việc thật
Một xưởng in áo thun ở Gò Vấp muốn dùng AI phác hình in. Nếu hiểu cơ chế, họ sẽ không bắt AI viết câu khẩu hiệu lên áo mà để phần chữ cho nhà thiết kế làm trong phần mềm. AI lo phần hình: con hổ cách điệu, họa tiết hoa sen, nền loang màu. Chia việc như vậy vừa nhanh vừa ít phải sửa.
Một giáo viên mỹ thuật cấp hai ở Huế dùng AI để tạo ảnh minh họa cho bài giảng về phối cảnh. Ảnh ra đẹp nhưng các đường hội tụ không về đúng một điểm. Thay vì bỏ, cô biến lỗi ấy thành bài tập: học sinh tìm chỗ sai phối cảnh trong ảnh AI. Hiểu máy sai ở đâu biến điểm yếu thành tư liệu.
Với người làm truyền thông, quy trình hợp lý là: tạo nhiều phương án nhanh để chọn hướng, chọn một hai ảnh gần ý nhất, sửa cục bộ bằng công cụ tô vùng, rồi hoàn thiện chữ và chi tiết thương hiệu bằng phần mềm thiết kế. Đừng kỳ vọng một lệnh ra ngay ảnh dùng được.
Chỗ nào AI dở thì nói thẳng: sơ đồ kỹ thuật, bản vẽ cần đúng kích thước, ảnh mô tả sản phẩm thật để bán hàng, ảnh có người thật cụ thể. Những thứ này dùng AI dễ sinh rắc rối hơn là tiết kiệm. Ảnh sản phẩm bán hàng mà khác hàng thật là mời khách khiếu nại.
Các nút chỉnh trong công cụ tạo ảnh nghĩa là gì?
Số bước gỡ nhiễu. Nhiều bước thì chi tiết mịn hơn nhưng chậm hơn. Quá một ngưỡng nào đó, thêm bước gần như không thay đổi gì.
Mức bám câu lệnh. Đặt cao thì ảnh bám sát chữ nhưng dễ gắt màu, cứng. Đặt thấp thì ảnh tự nhiên hơn nhưng có thể đi lạc ý.
Hạt giống. Con số quyết định khung nhiễu ban đầu. Giữ nguyên để so sánh khi chỉ đổi một chữ trong câu lệnh.
Kích thước và tỷ lệ khung. Mô hình học trên vài khổ ảnh nhất định. Chọn khổ quá lạ dễ sinh ảnh lặp hai người, hai cái đầu.
Câu lệnh loại trừ. Ô ghi những thứ không muốn có. Dùng cho chữ, hình mờ, vật thừa, thay vì viết phủ định trong câu chính.
Ảnh tham chiếu. Đưa một ảnh để mô hình mượn bố cục, màu hay dáng người. Chỉ dùng ảnh bạn có quyền.
Mức biến đổi từ ảnh gốc. Khi sửa từ một ảnh có sẵn, mức thấp giữ gần ảnh cũ, mức cao gần như vẽ mới.
Tô vùng sửa cục bộ. Khoanh một chỗ để vẽ lại, phần còn lại giữ nguyên. Hữu ích nhất cho tay, mặt, vật thừa.
Mở rộng khung. Cho mô hình vẽ thêm ra ngoài mép ảnh. Hợp để biến ảnh vuông thành ảnh bìa ngang.
Phóng to bằng AI. Tăng độ phân giải và tự thêm chi tiết. Chi tiết thêm là đoán, không phải thật, cần soát lại.
Phiên bản mô hình. Mỗi phiên bản có gu riêng. Ghi lại phiên bản đã dùng khi cần làm lại một loạt ảnh giống nhau.
Câu hỏi thường gặp
AI tạo ảnh có cần mạng internet không?
Phần lớn công cụ phổ biến chạy trên máy chủ của nhà cung cấp nên cần mạng. Cũng có mô hình chạy được trên máy tính cá nhân, nhưng cần card đồ họa đủ mạnh và chịu khó cài đặt.
Tại sao cùng câu lệnh mà hai người ra ảnh khác nhau?
Vì mỗi lần chạy bắt đầu từ một khung nhiễu ngẫu nhiên khác nhau, và có thể khác cả phiên bản mô hình, kích thước ảnh, số bước. Muốn giống nhau phải giữ cùng mọi cài đặt.
AI có học từ ảnh mình tải lên không?
Tùy điều khoản từng dịch vụ. Một số dùng dữ liệu người dùng để cải thiện mô hình, một số cho phép tắt. Ảnh nhạy cảm, ảnh khách hàng, ảnh trẻ em thì đừng tải lên dịch vụ chưa đọc kỹ điều khoản.
Làm sao để AI vẽ chữ tiếng Việt đúng?
Hiện cách ổn định nhất là để trống chỗ chữ, rồi thêm chữ bằng phần mềm thiết kế. Một số mô hình mới vẽ chữ khá hơn, nhưng chữ có dấu vẫn hay sai, cần soát từng ký tự.
Mô hình khuếch tán khác gì cách AI viết văn?
Mô hình ngôn ngữ đoán từng từ tiếp theo, còn mô hình khuếch tán gỡ nhiễu trên cả bức ảnh cùng lúc qua nhiều bước. Hai cách học khác nhau nên điểm mạnh điểm yếu cũng khác nhau.