Jevの迷路テスト追加検証
@karminski3のテスト枠組みに基づき、Jevの迷路問題における複数の結果を追加し、ランダムウォークや専門の迷路アルゴリズムと比較しました。
THE JEV GUIDE · CURATED EDITION
TypeSafe Jevに関する発表、解説、デモ、コミュニティ事例をトピック別に整理しています。各項目からXの元投稿を確認できます。
キュレーション選定 · 全件ではありません · 手動更新
01 / EXPLORE
0 means awaiting a verified post
@karminski3のテスト枠組みに基づき、Jevの迷路問題における複数の結果を追加し、ランダムウォークや専門の迷路アルゴリズムと比較しました。
作者はSkills ILでTypeSafeの新モデルJevを使い、SMS・WhatsApp・メールで届く銀行フィッシングメッセージを検出するツールを構築しました。ユーザーは不審なメッセージを貼り付けて検証できます。
Jevに関するスキル、リポジトリ、X/Redditの投稿、リソース、サイトなどを含む大規模なディレクトリが作成され、ユースケースで絞り込めます。
Jevの戻り値を単に正解と見なさず、confidenceに注目すべきだと著者は提案。Choice型ではcannot_tell選択肢を追加して誤判断を避けるべきとする。
著者はJevはAI生成コンテンツ検出には適さないと考え、すべてのAI検出ツールは似たようなもので、精度が90%以上でなければ意味がないと述べ、別のAPIを推奨しています。 Link
作者がJevに数独を解かせたところ、プロンプトが難しかったが速度は速く、LLMは数独が苦手とされる点にも言及。
投稿者は、Jev 1.13 が一部のタスクで大規模言語モデルを置き換える可能性があると述べています。
rajeshsam氏は、AIの勢いがSystem 1分類器(Jevなど)を使った従来のデータサイエンスに一周回って戻ったように見えると述べています。彼は、モデルに制御フローを推測させるよりも、型付き構造化レスポンスとPython内のフックによる決定論的推論が優れており、曖昧さは取り込み境界に残すべきだと主張しています。
コミュニティによる再ベンチマークでは、JevとGPT-5.4は統計的に区別できず(3.3ポイント差)、Jevのコストは約50分の1。 Link
開発者Tal Saiag氏がJevのパターンを共有:各呼び出しが意図的に小さな状態を残し、次のJev呼び出しのためだけに使う「Jev carry state」と呼んでいる。
ユーザーがJevの実験から得た知見を共有:古いGPT-4レベルのモデルのように明示的なプロンプトが必要で、非常に安価、Astraで約8時間調整した。
Wildan氏は、ClaudeがTypeSafe AIのJevを使う時だとツイートしました。