Quy trình làm việc với tài nguyên mỹ thuật game bằng AI: Nhân vật, bối cảnh, UI, phong cách pixel hoàn tất trong một lần
Việc tạo ảnh đơn lẻ bằng AI từ lâu đã không có gì lạ, cái khó là làm sao cho một trăm tài nguyên trông như do cùng một người vẽ. Từ hình ảnh ý tưởng trên Midjourney, mô hình phong cách Scenario, sprite pixel cho đến dây chuyền Meshy 3D, tách nền và phóng to, bài viết này sẽ trình bày rõ ràng về quy trình 2D, 3D, UI, pixel art và các lằn ranh đỏ về bản quyền.
Trong một studio chia sẻ ở khu Tây Đồn (West District), Đài Trung, Trần Giai Dĩnh (Chen Chia-ying), họa sĩ minh họa tự do 29岁, đang bàn giao dự án lớn nhất trong năm của cô: một tựa game thẻ bài roguelike do một đội ngũ độc lập ba người ở miền Nam thực hiện, bao gồm 120 hình minh họa thẻ bài, 40 chân dung nhân vật (sprite) kẻ địch và toàn bộ giao diện UI. Trước đây, với khối lượng công việc này, cô sẽ phải thuê ngoài ba đồng nghiệp và mất nửa năm thực hiện; lần này, cô hoàn thành trong sáu tuần, và ngân sách mà đội ngũ trả chỉ bằng 40% trước đây. Cô không vẽ nhanh hơn, mà là đang "huấn luyện" phong cách của chính mình vào AI.
"Khách hàng chưa bao giờ cần một bức ảnh đẹp duy nhất, họ cần một trăm bức ảnh trông như thể do cùng một người vẽ." Câu nói này đã vạch trần cốt lõi của nghệ thuật game AI: việc tạo ra một bức ảnh đơn lẻ từ lâu đã không còn khó, cái khó là tính nhất quán, tính khả dụng và không vướng vào rắc rối bản quyền.
Tài liệu 2D: Bản thảo ý tưởng nhan nhản khắp nơi, chỉ những gì đưa được vào engine mới gọi là tài liệu
Trong giai đoạn khám phá ý tưởng, Midjourney (giá thuê bao từ 10 USD/tháng) vẫn là công cụ nhanh nhất để nắm bắt bầu không khí, có thể quét qua năm mươi hướng mỹ thuật trong một giờ. Nhưng bản thảo ý tưởng không có nghĩa là tài liệu game: game cần nền sạch, góc nhìn thống nhất và hình ảnh có thể cắt ghép. Giai đoạn sản xuất hàng loạt hãy chuyển sang Leonardo AI, công cụ này có các mô hình mặc định hướng đến tài liệu game, giúp xuất ra các đạo cụ và biểu tượng theo lô; hoặc Scenario, một sản phẩm được thiết kế hoàn toàn cho các đội ngũ phát triển game.
Phong cách pixel có giải pháp chuyên dụng riêng: Pixellab tạo trực tiếp các sprite và hoạt ảnh khung hình (frame-by-frame), giúp loại bỏ quy trình rườm rà "tạo ảnh rồi chuyển sang pixel thủ công". Đối với UI có các yếu tố văn bản (nút bấm, tiêu đề), hãy sử dụng Ideogram, đây là một trong số ít công cụ tạo ảnh không làm hỏng chữ; các biểu tượng dạng vector hãy giao cho Recraft, xuất file SVG vào engine mà không bị vỡ hình.
Một khung prompt phong cách pixel thực tế:
pixel art, 32x32 sprite, [mô tả chủ thể], side view, transparent background,
limited palette of 16 colors, clean silhouette, no anti-aliasing,
consistent with 16-bit era JRPG style
Kích thước, góc nhìn, số lượng màu sắc và tính năng khử răng cưa — cố định cả bốn yếu tố này, tỷ lệ sử dụng được của ảnh tạo ra sẽ chênh lệch gấp đôi trở lên. Xem thêm các cách viết prompt tại Thực chiến prompt tạo ảnh AI.
Tính nhất quán phong cách: Biến "phong cách của bạn" thành một mô hình
Tạo ảnh rời rạc không cứu vãn được tính nhất quán, giải pháp chính là mô hình tùy chỉnh. Có hai con đường:
Con đường lười biếng là chọn Scenario: Tải lên từ 20 đến 50 bức ảnh tham khảo có cùng phong cách (tốt nhất là do chính bạn vẽ), huấn luyện mô hình độc quyền, sau đó tất cả tài liệu sẽ được xuất ra từ mô hình này. 50 điểm miễn phí đủ để bạn thử nghiệm cảm giác, các gói trả phí bắt đầu từ 15 USD/tháng, bao gồm cả quyền thương mại, là một khoản chi phí mà những người làm nghề tự do có thể đưa thẳng vào bảng báo giá.
Con đường của những người cầu toàn (control freak) là sử dụng ComfyUI kết hợp với LoRA: Chạy cục bộ Flux hoặc Stable Diffusion, sử dụng hình ảnh của chính bạn để huấn luyện LoRA, sau đó kết hợp với ControlNet để khóa tư thế và bố cục. Ngưỡng kỹ thuật cao, nhưng không mất phí hàng tháng, toàn bộ tệp nằm trong tay bạn, và trên Civitai có rất nhiều LoRA phong cách game có sẵn để dùng tạm. Người mới bắt đầu có thể xem Hướng dẫn ComfyUI.
Người dùng Midjourney hãy nhớ hai tham số --sref (tham khảo phong cách) và --cref (tham khảo nhân vật), độ ổn định tuy không bằng mô hình được huấn luyện nhưng đủ dùng cho giai đoạn khám phá ban đầu.
Một mẹo thực tế: Khuôn mặt của chân dung nhân vật là phần dễ bị "lệch chuẩn" nhất. Thay vì tạo lại một trăm lần, chi bằng tạo đến khi đạt độ giống 80% rồi đưa vào Photoshop hoặc Krea để vẽ lại cục bộ (inpainting) — con người chỉnh sửa ảnh của AI luôn nhanh hơn AI tự chỉnh sửa ảnh của chính nó.
3D và cảnh quan: Đặt kỳ vọng đúng chỗ
Mức độ thực tế của việc tạo 3D bằng văn bản vào năm 2026: Đạo cụ dùng được, nhân vật tạm ổn, nhân vật chính thì đừng nghĩ tới. Phiên bản miễn phí của Meshy AI cung cấp 100 điểm mỗi tháng, bản Pro có giá 20 USD/tháng, tạo vũ khí, đồ nội thất và đá tĩnh vật vừa nhanh vừa đẹp; lưu ý rằng các sản phẩm từ bản miễn phí tuân theo giấy phép CC BY 4.0 và mô hình được công khai, các dự án thương mại vui lòng sử dụng bản trả phí. Tripo3D có tốc độ tạo mô hình nhanh, chi tiết tương đương với Meshy; các bề mặt cứng có tính quy luật mạnh (kiến trúc, phương tiện giao thông) có thể thử Sloyd, tạo hình theo tham số, lưới đa giác (topology) sạch sẽ hơn nhiều.
Trước khi đưa mô hình 3D do AI tạo ra vào engine, hầu như tất cả đều phải tái tạo lưới (retopology) và giảm số lượng đa giác (decimation), đặc biệt là với game di động — bước này hiện chưa có giải pháp tự động hoàn toàn đáng tin cậy. Hộp bầu trời (skybox) thì đã khá trưởng thành, Blockade Labs có thể tạo toàn cảnh 360 độ chỉ với một câu lệnh, bầu không khí của cảnh quan lập tức được thiết lập. Để tìm hiểu sâu hơn, hãy đọc Hướng dẫn tạo mô hình 3D bằng AI.
Quy trình hậu kỳ: Xóa phông, phóng to, đặt tên — nhàm chán nhưng có giá trị
Khi khối lượng tài liệu lớn, thắng thua nằm ở quy trình làm việc. Để xóa phông nền, hãy sử dụng remove.bg hoặc Photoroom để xử lý hàng loạt, ngoại trừ phong cách pixel — việc xóa nền cho ảnh pixel bằng thuật toán rất dễ làm mất màu biên, tốt nhất là yêu cầu nền trong suốt ngay từ khi tạo ảnh. Việc phóng to nên ưu tiên sử dụng công cụ mã nguồn mở miễn phí Upscayl chạy cục bộ, các hình ảnh chủ đạo quan trọng mới đưa lên Magnific để bổ sung chi tiết; chiều ngược lại là "thu nhỏ" cũng đừng xem nhẹ, ảnh độ phân giải cao ném thẳng vào engine là kẻ thù của hiệu năng, game 2D hãy nhớ xuất theo kích thước hiển thị thực tế và đóng gói các sprite loại tương tự thành tập bản đồ kết cấu (texture atlas) để giảm số lần gọi vẽ (draw call).
Trước khi xuất file, hãy cố định quy tắc đặt tên (định dạng như enemy_slime_idle_01.png), phân chia thư mục theo "nhân vật, cảnh quan, UI, hiệu ứng", bạn của hai tháng sau sẽ cảm ơn bạn của hiện tại. Cách làm của Giai Dĩnh còn quyết liệt hơn: cô lưu cả prompt cùng với tên file trong một bảng tính, ba tháng sau khách hàng yêu cầu bổ sung một bức ảnh cùng phong cách, cô có thể trực tiếp gọi ra phiên bản mô hình và prompt lúc đó để tái tạo, hoàn thành bàn giao trong mười phút.
Ranh giới đỏ về bản quyền: Có thể dùng, có thể bán và an tâm là ba việc khác nhau
Thực tiễn hành nghề hiện tại tại Đài Loan có xu hướng cho rằng: Hình ảnh hoàn toàn do AI tạo ra, không có sự tham gia sáng tạo của con người, rất khó để xác lập quyền tác giả — nghĩa là, người khác sao chép tranh của bạn, bạn không dễ để kiện thành công. Đối với các dự án thương mại, hãy hình thành ba thói quen: Sử dụng các gói trả phí bao gồm quyền thương mại; lồng ghép lượng chỉnh sửa và bố cục thủ công đầy đủ trên các sản phẩm do AI tạo ra; lưu giữ prompt, tệp gốc và lịch sử chỉnh sửa. Khi đưa lên Steam, bạn phải trung thực khai báo các tài liệu do AI tạo ra trong bảng câu hỏi về nội dung. Quy tắc sau bản cập nhật tháng 1 năm 2026 chỉ quản lý "nội dung người chơi có thể nhìn thấy", việc dùng AI để vẽ các bản thảo ý tưởng nội bộ thì không cần báo cáo. Đọc thêm: Ảnh do AI tạo ra có bán được không, toàn bộ quy trình phát triển xem tại Lộ trình làm game indie bằng AI.
Tóm tắt và Đánh giá từ Học viện TheAI
Điểm chia cắt của nghệ thuật game AI không nằm ở việc biết cách viết prompt hay không, mà nằm ở việc có công nghiệp hóa "phong cách" hay không: Huấn luyện mô hình của riêng bạn, xây dựng tốt quy trình hậu kỳ, lưu giữ chuỗi bằng chứng bản quyền. Sự kinh ngạc của một bức ảnh đơn lẻ thì ai cũng làm được, nhưng tính nhất quán của một trăm bức ảnh mới là sự chuyên nghiệp. Phong cách pixel, UI, 3D đều có các công cụ chuyên dụng riêng, đừng dùng một mình Midjourney để chinh phục tất cả.
Đánh giá trong một câu: Khả năng cạnh tranh của nghệ thuật game năm 2026 chính là "biến tài sản phong cách thành hiện thực" — phong cách của bạn biến thành mô hình, quy trình của bạn biến thành dây chuyền sản xuất.
Đề xuất cụ thể cho độc giả: Những người nhận việc tự do trước tiên hãy sử dụng các tác phẩm cũ của chính mình để huấn luyện một mô hình Scenario, khi báo giá hãy coi luồng công việc AI là lợi thế về thời gian giao hàng chứ không phải là lý do để giảm giá; các đội ngũ độc lập có ngân sách mỹ thuật hạn chế, nên ưu tiên chi cho "30 bức tranh gốc thủ công đầu tiên để định nghĩa phong cách", phần còn lại giao cho mô hình sản xuất hàng loạt. Nếu bạn cũng muốn AI hóa các đoạn hội thoại NPC, hãy đọc tiếp Nhập môn hội thoại NPC và tương tác tường thuật bằng AI.
Câu hỏi thường gặp
Tài nguyên game do AI tạo ra có được thương mại hóa không?
Tùy thuộc vào giấy phép của công cụ: Gói trả phí của Scenario bao gồm quyền thương mại; phiên bản miễn phí của Meshy AI áp dụng CC BY 4.0 và mô hình được công khai, các dự án thương mại bắt buộc phải dùng gói trả phí, đồng thời lưu giữ prompt và lịch sử chỉnh sửa.
Làm thế nào để các nhân vật do AI tạo ra có phong cách đồng nhất?
Đào tạo mô hình tùy chỉnh là giải pháp chính xác: Tải lên từ 20 đến 50 ảnh tham khảo trên Scenario để huấn luyện mô hình độc quyền, hoặc dùng ComfyUI trên máy cục bộ để huấn luyện LoRA; các tham số --sref và --cref của Midjourney rất phù hợp cho việc khám phá giai đoạn đầu.
Công cụ AI nào là tốt nhất để tạo tài nguyên phong cách pixel?
Công cụ chuyên dụng Pixellab có thể trực tiếp tạo sprite và hoạt ảnh theo từng khung hình; nếu dùng công cụ tạo ảnh thông thường, bạn phải viết cố định kích thước, góc nhìn, số lượng màu và no anti-aliasing trong prompt thì mới dùng được.
Mô hình 3D tạo bằng văn bản có thể đưa thẳng vào engine game không?
Các vật phẩm tĩnh thì gần như có thể dùng được, nhưng phần lớn mô hình vẫn cần tối ưu hóa lưới (retopology) và giảm số đa giác (decimation), điều này đặc biệt cần thiết cho game di động; mô hình nhân vật hiện tại chỉ được khuyến nghị dùng làm bản nháp hoặc cho cảnh xa.