Techub News tin tức, Sakana AI đã công bố bài nghiên cứu có tiêu đề "Beyond Imitation", giới thiệu hệ thống hỗ trợ bình duyệt đồng nghiệp dựa trên mô hình lớn được xây dựng xung quanh việc phát hiện lỗi. Hệ thống này sử dụng kiến trúc đánh giá nhiều lớp (MLR), áp dụng các mô hình API sẵn có như Claude Sonnet 4 và Claude Haiku 3.5, không yêu cầu GPU hoặc tinh chỉnh, với chi phí mỗi lần đánh giá khoảng 0.47 USD. Trong một bài kiểm tra chuẩn bao gồm 1,164 mâu thuẫn được cấy ghép, hệ thống MLR đã phát hiện được 73.43% các lỗi chính trong 4 lần đánh giá, trong khi mô hình cơ sở tốt nhất chỉ phát hiện được 14.81%. Tuy nhiên, trong bài kiểm tra thực tế với các bài báo bị rút lại, tỷ lệ khớp chính xác của nó chỉ là 16.11%. Hệ thống này bao gồm ba tác nhân thông minh: tác nhân phụ lục tóm tắt chi tiết thí nghiệm, tác nhân tổng quan tài liệu thực hiện tìm kiếm trên mạng để định vị bối cảnh nghiên cứu, và tác nhân đánh giá thực hiện chuỗi nhắc nhở ba giai đoạn để đánh giá. Bài nghiên cứu cũng chỉ ra rằng trọng tâm đánh giá của MLR khác biệt với con người, tập trung nhiều hơn vào tính hiệu quả và thí nghiệm, trong khi con người coi trọng tính rõ ràng và sự mới mẻ hơn. (MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

Mọi thông tin trên trang web này chỉ mang tính tham khảo.
Trang web không bảo đảm tính chính xác, hiệu lực, kịp thời hay đầy đủ của thông tin.
Người dùng tự chịu rủi ro khi hành động dựa trên thông tin của trang web này.
Techub News tin tức, Sakana AI đã công bố bài nghiên cứu có tiêu đề "Beyond Imitation", giới thiệu hệ thống hỗ trợ bình duyệt đồng nghiệp dựa trên mô hình lớn được xây dựng xung quanh việc phát hiện lỗi. Hệ thống này sử dụng kiến trúc đánh giá nhiều lớp (MLR), áp dụng các mô hình API sẵn có như Claude Sonnet 4 và Claude Haiku 3.5, không yêu cầu GPU hoặc tinh chỉnh, với chi phí mỗi lần đánh giá khoảng 0.47 USD. Trong một bài kiểm tra chuẩn bao gồm 1,164 mâu thuẫn được cấy ghép, hệ thống MLR đã phát hiện được 73.43% các lỗi chính trong 4 lần đánh giá, trong khi mô hình cơ sở tốt nhất chỉ phát hiện được 14.81%. Tuy nhiên, trong bài kiểm tra thực tế với các bài báo bị rút lại, tỷ lệ khớp chính xác của nó chỉ là 16.11%. Hệ thống này bao gồm ba tác nhân thông minh: tác nhân phụ lục tóm tắt chi tiết thí nghiệm, tác nhân tổng quan tài liệu thực hiện tìm kiếm trên mạng để định vị bối cảnh nghiên cứu, và tác nhân đánh giá thực hiện chuỗi nhắc nhở ba giai đoạn để đánh giá. Bài nghiên cứu cũng chỉ ra rằng trọng tâm đánh giá của MLR khác biệt với con người, tập trung nhiều hơn vào tính hiệu quả và thí nghiệm, trong khi con người coi trọng tính rõ ràng và sự mới mẻ hơn. (MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

Mọi thông tin trên trang web này chỉ mang tính tham khảo. Trang web không bảo đảm tính chính xác, hiệu lực, kịp thời hay đầy đủ của thông tin. Người dùng tự chịu rủi ro khi hành động dựa trên thông tin của trang web này.