Thứ Hai, 28 tháng 9, 2026

Dữ liệu + mô hình = bài báo: 95% bài báo chỉ là “rác rưởi”?

Dữ liệu + mô hình = bài báo: Có phải hơn 95% nghiên cứu kinh tế Việt Nam chỉ là “rác rưởi”?
Trong thời gian mới đi làm, tôi đã may mắn được dự một seminar do giáo sư Phan Đình Diệu, Viện trưởng Viện khoa học tính toán và điều khiển, chủ trì. Hôm đó một báo cáo viên trình bày bài có tên là “Cấu trúc dữ liệu”. Lúc đó, “Cấu trúc dữ liệu” đang là một thứ mốt.
Tại hội thảo, tôi đã học được một công thức: Cấu trúc dữ liệu + Thuật toán = Chương trình. Các chương trình ngày nay, bao gồm cả Trí tuệ nhân tạo (AI), mô hình ngôn ngữ lớn (LLM - Large Language Model), và thậm chí cả những chương trình phức tạp và tiên tiến nhất, đều dựa trên công thức này. Dĩ nhiên, nếu phân tích chi li, các hệ thống tính toán hiện đại phức tạp hơn rất nhiều, nhưng công thức ấy giúp tôi hiểu một điều cơ bản: một chương trình chỉ có giá trị khi cả cấu trúc dữ liệu và thuật toán mà nó sử dụng đều phù hợp với mục tiêu cần giải quyết.

Tôi không giỏi toán, cũng không giỏi lập trình, vì vậy khi giáo sư Hoàng Tụy bảo tôi trở lại Viện Toán học Việt Nam, tôi đã từ chối và chuyển hẳn sang lĩnh vực kinh tế và quản lý kinh tế nhưng có sử dụng các mô hình toán học, nhất là mô hình kinh tế lượng.

Nhiều năm làm kinh tế, tôi chợt nhận ra trong nghiên cứu kinh tế cũng có một “công thức” tương tự: dữ liệu + mô hình = bài báo. Theo ý kiến ​​khiêm tốn của tôi, tất cả các bài báo về kinh tế và chính sách kinh tế dùng toán học hiện nay ở Việt Nam đều có thể tóm gọn lại như sau: dữ liệu + mô hình = bài báo.

Nhưng liệu dữ liệu + mô hình có mặc nhiên tạo ra tri thức mới hay không?

Một mô hình có thể rất đẹp về mặt toán học nhưng hoàn toàn không trả lời được một câu hỏi kinh tế quan trọng. Một bộ dữ liệu có thể rất lớn nhưng không có nghĩa là nó chứa thông tin phù hợp với câu hỏi nghiên cứu. Một hồi quy có thể cho R2 rất cao, hệ số có ý nghĩa thống kê và hàng chục dấu sao, nhưng vẫn không cho chúng ta biết điều gì đáng tin cậy về cơ chế vận hành của nền kinh tế.

Kính gửi quý độc giả, các bạn có thể tham khảo các tạp chí kinh tế và quản lý kinh tế hàng đầu của Việt Nam hiện nay để xem công thức của tôi có thể áp dụng rộng rãi hay không. Tôi đang nói đến phạm vi trong nước; còn quốc tế thì khỏi cần nói, vì công thức này được du nhập từ nước ngoài. Do đó, dữ liệu + mô hình = bài báo đang là công thức được áp dụng rộng rãi.

Đối với cộng đồng kinh tế Việt Nam, đây là một cạm bẫy lớn: Thứ nhất, các mô hình có nguồn gốc từ phương Tây có phù hợp với cơ cấu và hình thái kinh tế của Việt Nam hay không? Các giả định, cấu trúc quan hệ và cơ chế truyền dẫn của mô hình có phù hợp với nền kinh tế Việt Nam trong giai đoạn nghiên cứu hay không? Hoặc, làm thế nào để điều chỉnh các mô hình cho phù hợp với "đặc điểm Việt Nam"? Đây là vấn đề đầu tiên về tính khả thi của mô hình.

Thứ hai, thông tin và dữ liệu được sử dụng có độ chính xác, đáng tin cậy và liên tục đến mức nào? Làm thế nào chúng ta có thể làm sạch số lượng lớn các dữ liệu đã và đang tiếp tục bị thổi phồng vì chủ nghĩa thành tích hoặc đo lường sai lệch để đảm bảo tính tin cậy của mô hình? Đây là điểm thứ hai: dữ liệu không được quá bị thổi phồng và sai lệch so với sự thật.

Nếu một trong hai điều kiện này không được đáp ứng, giá trị của bài báo sẽ bị nghi ngờ và mất giá trị.

Ví dụ: Một mô hình FDI giả định FDI chủ yếu phản ánh động cơ tìm kiếm thị trường. Nhưng Việt Nam lại có đặc điểm rất lớn là FDI định hướng xuất khẩu ra khỏi Việt Nam, tham gia chuỗi cung ứng, nhập khẩu đầu vào, chuyển giao công nghệ và liên kết với khu vực trong nước còn rất hạn chế.

Nếu vậy, câu hỏi là: “Cơ chế mà mô hình giả định có thực sự là cơ chế đang vận hành ở Việt Nam không?”

Ví dụ thứ hai là dữ liệu. Vấn đề sai số đo lường (measurement error), chất lượng thống kê, thay đổi phương pháp thống kê, dữ liệu thiếu liên tục, khác biệt định nghĩa so với quốc tế trong khi lại sử dụng mô hình quốc tế, các dữ liệu ước tính, dữ liệu kế hoạch... được đưa vào mô hình. Tất là đều làm mô hình không còn là minh họa của nền kinh tế thực.

Một ví dụ đơn giản, nếu Việt Nam thổi phồng GDP, thì toàn bộ hệ thống các chỉ tiêu kinh tế được xây dựng trên GDP cũng có thể bị ảnh hưởng theo. GDP không đứng một mình. Nếu GDP công bố cao hơn thực tế, thì hàng loạt chỉ tiêu như GDP/người; năng suất lao động; ICOR; tốc độ tăng GDP ngành; tỷ lệ đầu tư/GDP; thu ngân sách/GDP; chi ngân sách/GDP; nợ công/GDP; tín dụng/GDP; xuất khẩu/GDP; tiêu dùng/GDP; đóng góp của các nhân tố vào tăng trưởng; TFP... đều bị tác động. Rất nhiều tỷ lệ “đẹp” lên theo một cách cơ học. 

Điều này có nghĩa là sai số của một biến nền tảng không nằm yên trong chính biến đó; nó có thể lan truyền sang cả hệ thống chỉ tiêu và cuối cùng đi vào các mô hình nghiên cứu. Nhiều đại biểu Quốc hội cũng đã từng tỏ ra nghi ngờ thông tín số liệu về GDP hay lạm phát do Cục Thống kê tính toán.

Tuy hiện tôi không khẳng định mọi con số GDP đều bị thổi phồng. Tôi chỉ muốn nói rằng người nghiên cứu không nên mặc nhiên coi số GDP công bố là một biến số hoàn toàn không có vấn đề về đo lường.

Một mô hình tinh vi đến đâu cũng không thể tạo ra kết quả đáng tin cậy nếu dữ liệu đầu vào thiếu chính xác, thiếu liên tục, thay đổi định nghĩa qua thời gian hoặc chứa sai số đo lường lớn. Trong nghiên cứu kinh tế Việt Nam, đây là vấn đề đặc biệt đáng quan tâm vì nhiều chuỗi số liệu dài cần phải ghép nối từ các nguồn, các phương pháp thống kê và các thời kỳ khác nhau.

Trên thực tế, tôi cho rằng rất ít bài báo được công bố trong giới học thuật kinh tế và quản lý kinh tế của Việt Nam đáp ứng đồng thời hai điều kiện: mô hình được cải tiến hoặc điều chỉnh đủ để phản ánh những đặc điểm quan trọng của Việt Nam, và dữ liệu sử dụng có độ tin cậy đủ cao để kiểm định những quan hệ mà mô hình đặt ra.

Bạn có tin vào các bài báo như vậy không? Tôi thì không.

Thực tế các nhà kinh tế hàng đầu thế giới và Việt Nam khi dựa trên các mô hình kinh tế phương Tây và dữ liệu do Việt Nam và tổ chức tài chính quốc tế (IMF, WB, UN, WTO, ILO…) cung cấp, để dự đoán triển vọng kinh tế ngắn hạn của Việt Nam, đều đã sai hết lần này đến lần khác; đặc biệt rất thường xuyêndự báo thấp hơn đáng kể so với mức tăng trưởng thực tế mà Việt Nam sau đó công bố.

Trước thực trạng như thế, liệu những bài báo được các nhà kinh tế khác tiếp tục công bố dựa trên dữ liệu và mô hình theo cách làm hiện nay đáng tin cậy không ?

Tóm lại, câu hỏi tôi muốn đặt ra không phải là Việt Nam có quá nhiều bài báo kinh tế hay không. Cũng không phải các nhà kinh tế Việt Nam có sử dụng những mô hình hiện đại hay không. Câu hỏi quan trọng hơn là: sau khi bỏ đi những mô hình hào nhoáng, những bảng hồi quy đầy dấu sao và những bộ dữ liệu rất lớn, chúng ta thực sự học được thêm điều gì về nền kinh tế Việt Nam?

Nếu câu trả lời chỉ là một vài hệ số hồi quy có ý nghĩa thống kê, thì có lẽ chúng ta cần nghiêm túc suy nghĩ lại về cách mình đang làm nghiên cứu kinh tế.

Bởi một bài báo không trở thành nghiên cứu khoa học chỉ vì nó có dữ liệu và có mô hình.

Không có nhận xét nào:

Đăng nhận xét