
MetaLook
●@metalook_io
Bản tin nóng song ngữ từng được tổng hợp và lọc trùng lặp tự động bằng pipeline AI của MetaLook (đã ngừng hoạt động).
Hệ thống đã triển khai
Thu thập dữ liệu tự động từ 100+ nguồn tin
Hệ thống liên tục quét các trang báo, blog công nghệ và mạng xã hội, tự động bóc tách tiêu đề, nội dung và thời gian xuất bản.
Lọc trùng bài viết bằng AI (Vector Embeddings)
Chuyển đổi nội dung thành vector ngữ nghĩa để gom nhóm các bài viết cùng chủ đề, loại bỏ những bài viết xào xáo hoặc sao chép.
Tóm tắt tin tức tự động
Mô hình ngôn ngữ AI trích xuất các ý quan trọng nhất và viết lại thành bản tóm tắt ngắn gọn dễ đọc.
Bản tin song ngữ Anh - Việt
Dịch thuật và hiển thị nội dung tóm tắt đối chiếu song ngữ tự động, gần theo thời gian thực.
Bảng quản trị biên tập
Giao diện giúp đội ngũ biên tập viên quản lý nguồn tin, điều chỉnh độ ưu tiên hoặc duyệt lại nội dung khi cần thiết.
Tổng quan bài toán
Thị trường tài chính và công nghệ xuất bản hàng nghìn bài viết mỗi ngày từ hàng trăm nguồn tin khác nhau. Việc theo dõi tin tức thủ công tốn rất nhiều thời gian vì cùng một sự kiện thường bị xào xáo và đăng lại nhiều lần trên nhiều đầu báo.
Dự án cần một hệ thống tự động tổng hợp tin tức liên tục, nhận diện các bài viết trùng nội dung và tóm tắt thành các ý chính ngắn gọn cho người đọc theo dõi nhanh.
Thách thức kỹ thuật cốt lõi
Xử lý khi nguồn tin thay đổi giao diện hoặc lỗi mạng
Các trang báo thường xuyên đổi cấu trúc HTML hoặc chặn bot. Chúng tôi xây dựng các worker thu thập độc lập để khi một nguồn tin gặp lỗi, toàn bộ hệ thống vẫn chạy bình thường.
Nhận diện bài viết cùng chủ đề một cách chính xác
So sánh từ khóa đơn thuần không nhận diện được các bài viết viết lại (rewritten). Chúng tôi sử dụng vector embeddings để phân tích ngữ nghĩa và gom cụm tin tức chính xác hơn.
Kiểm soát chi phí gọi API mô hình ngôn ngữ
Chúng tôi kết hợp lưu bộ nhớ đệm (cache), gom nhóm bài viết trước khi gửi đi xử lý và kiểm tra độ chính xác của bản tóm tắt để tiết kiệm chi phí vận hành.
Kết quả vận hành
- 30-40
- bài viết được xử lý mỗi giờ liên tục
- 90%
- tỷ lệ nhận diện tin riêng biệt sau lọc trùng
- <30 phút
- thời gian từ lúc báo đăng đến khi lên bảng tin
Khi còn vận hành, hệ thống xử lý ổn định khoảng 800 bài viết mỗi ngày từ hơn 100 nguồn tin, tự động gom nhóm và loại bỏ các tin tức trùng lặp.
Dự án hoàn thành và bàn giao trong 3 tháng với đội ngũ 5 kỹ sư, từ khâu kiến trúc đến triển khai thực tế.
Giá trị mang lại cho dự án đối tác
Kinh nghiệm xây dựng pipeline xử lý dữ liệu lớn, trích xuất dữ liệu tự động và tích hợp mô hình AI được chúng tôi áp dụng trực tiếp cho các hệ thống thông minh của khách hàng.