Bài kiểm tra mê cung bổ sung cho Jev
Dựa trên khung thử nghiệm của @karminski3, tác giả bổ sung nhiều kết quả của Jev trên bài toán mê cung và so sánh với bước đi ngẫu nhiên và thuật toán mê cung chuyên nghiệp.
THE JEV GUIDE · CURATED EDITION
Tin ra mắt, giải thích, demo và dự án cộng đồng về TypeSafe Jev được sắp xếp theo chủ đề. Mỗi mục đều liên kết về nguồn X gốc.
Tuyển chọn biên tập · Không đầy đủ · Cập nhật thủ công
01 / EXPLORE
0 means awaiting a verified post
Dựa trên khung thử nghiệm của @karminski3, tác giả bổ sung nhiều kết quả của Jev trên bài toán mê cung và so sánh với bước đi ngẫu nhiên và thuật toán mê cung chuyên nghiệp.
Tác giả đã sử dụng mô hình Jev mới của TypeSafe trong Skills IL để xây dựng công cụ phát hiện tin nhắn lừa đảo ngân hàng nhận qua SMS, WhatsApp hoặc email. Người dùng có thể dán trực tiếp tin nhắn nghi ngờ để xác minh.
Ai đó đã xây dựng một thư mục khổng lồ về mọi thứ liên quan đến Jev, bao gồm kỹ năng, kho mã, bài đăng X/Reddit, tài nguyên, trang web và hơn thế nữa, có thể lọc theo trường hợp sử dụng.
Tác giả đề xuất không nên coi giá trị trả về của Jev là đúng một cách đơn giản; thay vào đó, hãy chú ý đến confidence. Đối với loại Choice, nên thêm tùy chọn cannot_tell để tránh đánh giá sai.
Tác giả cho rằng Jev không phù hợp để phát hiện nội dung do AI tạo, tất cả các trình phát hiện AI đều giống nhau và vô nghĩa trừ khi độ chính xác trên 90%, đồng thời giới thiệu một API khác. Link
Tác giả thử để Jev giải Sudoku, nhận thấy prompt khá khó nhưng tốc độ nhanh, và đề cập rằng LLM bị cho là khó giải Sudoku.
Tác giả nói rằng Jev 1.13 có thể thay thế các mô hình ngôn ngữ lớn trong một số tác vụ.
Rajeshsam lưu ý rằng động lực AI dường như đã quay trở lại khoa học dữ liệu truyền thống với các bộ phân loại System 1 (ví dụ Jev). Ông lập luận rằng các phản hồi có cấu trúc được gõ và lý luận xác định trong Python qua hook tốt hơn là để mô hình đoán luồng điều khiển; hãy để sự mơ hồ ở ranh giới tiếp nhận.
Chạy lại bởi cộng đồng cho thấy Jev và GPT-5.4 không thể phân biệt về mặt thống kê (chênh lệch 3,3 điểm), trong khi Jev chỉ tốn khoảng 1/50 chi phí. Link
Lập trình viên Tal Saiag chia sẻ một pattern Jev: mỗi lần gọi cố ý để lại một phần trạng thái nhỏ chỉ cho lần gọi Jev tiếp theo, gọi là 'Jev carry state'.
Một người dùng chia sẻ bài học từ thử nghiệm với Jev: cần prompt tường minh như các mô hình cấp GPT-4 cũ, rất rẻ, và đã tinh chỉnh khoảng 8 giờ với Astra.
Wildan tweet rằng đã đến lúc Claude sử dụng Jev của TypeSafe AI.