2026-10-03 20:32:53,909 WARNING myia.engines.registry: 引擎尝试失败 source=aihot engine=direct_api error_type=extract_unsupported: direct_api 引擎不支持 extract.type='list'(支持 json_path)
{"channel": "stdout", "kind": "digest", "slot": "pm", "date": "2026-10-03", "category": "AI资讯", "count": 2, "items": [{"image": "https://pbs.twimg.com/media/HTplehXagAEeLl1.jpg", "image_ocr": "Agent Arena\nGPT-6.1Sol：\nRanked #5\nGmm Arena\nARENA.AI\nClaude Fable 5.1（Max）\n2\nClaude Opus 5.5（High）\n3\nClaude Sonnet 5.5（Max）\n4\nGPT-6 Astra （Max）\n5\nGPT-6.1 Sol （Max）\nGPT-6 Sol （Max）\nClaude Opus 5 （High）\n8\nClaude Fable 5 （High）\nClaude Opus 5 （Max）\n10 Gemini 4 Argon （High）\n11\nClaude Opus 4.8（High）\n12\nGPT-5.6 Sol（xHigh）\n13\nClaude Sonnet 5 （High）\n14\nKimi K3 （Max）\n15\nGPT-5.5（xHigh）\n+14.3%\n+13.8%\n+12.5%\n1+12.3%\n-1 +11.2%\n-+9.7%\n+8.7%\n-1+8.2%\n-1+7.9%\n+7.6%\nK\n-1+6.6%\n+6.5%\n+4.4%\n+4.2%\n1+4.2%\n0%\nSOURCE: ARENA AI LEADERBOARD\n（ARENA.AI/LEADERBOARD/AGENT）\n+5%\n+10%\n+15%\nNET IMPROVEMENT VS BASELINE（%）", "image_caption": "① 图中内容：一张由 Arena.AI 发布的“Agent Arena”排行榜截图，展示了15个大语言模型在特定评测基准上的性能表现，以“净改进百分比”为衡量标准。图中重点标出 GPT-6.1 Sol (Max) 排名第5，其性能提升为+11.2%。图表中包含模型名称、排名、性能提升百分比、对应图标及来源信息。\n\n② 可见文字要点：\n- 标题：Agent Arena\n- 副标题：GPT-6.1 Sol: Ranked #5\n- 右上角：Arena (ARENA.AI)\n- 排名列表：\n  1. Claude Fable 5.1 (Max) +14.3%\n  2. Claude Opus 5.5 (High) +13.8%\n  3. Claude Sonnet 5.5 (Max) +12.5%\n  4. GPT-6 Astra (Max) +12.3%\n  5. GPT-6.1 Sol (Max) +11.2% ← 用黄色框高亮\n  6. GPT-6 Sol (Max) +9.7%\n  7. Claude Opus 5 (High) +8.7%\n  8. Claude Fable 5 (High) +8.2%\n  9. Claude Opus 5 (Max) +7.9%\n  10. Gemini 4 Argon (High) +7.6%\n  11. Claude Opus 4.8 (High) +6.6%\n  12. GPT-5.6 Sol (xHigh) +6.5%\n  13. Claude Sonnet 5 (High) +4.4%\n  14. Kimi K3 (Max) +4.2%\n  15. GPT-5.5 (xHigh) +4.2%\n- X轴标签：0%、+5%、+10%、+15%\n- X轴标题：NET IMPROVEMENT VS BASELINE (%)\n- 底部来源：SOURCE: ARENA AI LEADERBOARD (ARENA.AI/LEADERBOARD/AGENT)\n\n③ 与条目标题的关系：\n该配图与标题“开源大模型社区发布多模态 LLM 新版本,评测基准全部开源”存在部分关联，但不完全匹配。图中展示的是“Agent Arena”评测榜单，其评测基准由 Arena.AI 设定并公开，符合“评测基准全部开源”的部分描述。然而，图中并未明确提及“多模态”或“开源社区发布”的信息，且展示的是多个模型（包括闭源模型如 GPT-6.1 Sol、Claude 系列）的性能对比，而非一个新发布的开源多模态模型。因此，该图更适合作为“开源评测基准”或“模型性能对比”的佐证，而非直接支撑标题中“开源社区发布新版本”的核心信息。\n\n④ 关键数值与趋势：\n- GPT-6.1 Sol (Max) 在榜单中排名第5，净改进率为+11.2%。\n- 性能排名前5的模型均来自 Claude 系列或 GPT 系列，其中 Claude Fable 5.1 (Max) 以+14.3%的提升率排名第一。\n- 性能提升率呈阶梯式下降趋势，从+14.3%（第1名）降至+4.2%（第14、15名）。\n- 该榜单显示，当前主流大模型在该评测基准上的性能提升普遍在+4%至+14%之间，且性能差距相对明显。", "image_status": "ok", "score": 8.3, "enrich_model": "glm-4-flash", "score_reason": "高相关性，详细评测数据", "url": "http://127.0.0.1:8765/items/localproof1", "title": "开源大模型社区发布多模态 LLM 新版本,评测基准全部开源", "source": "aihot", "category": "ai-news", "scores": {"value": 8, "relevance": 9, "credibility": 8}, "dedup_key": "http://127.0.0.1:8765/items/localproof1"}, {"image": "https://pbs.twimg.com/media/HTpjhaCbAAAhuRe.jpg", "image_ocr": "Claude Sonnet 5.5\n15.Pareto Frontier for Agent Arena\nGm Arena\nARENA.AI\n+20.00%\nClaude Opus 5.5 （Max）\nClaude Opus 5.5 （High）\nGPT 61 Sol （Max）\n+10.00%\nAN Claude Sonnet 5.5（Max）\nAnthropic• Proprietary\nScore：\nCost/task：\n+12.52%\n$2.74\nDeepseck V4.1 Flash （Max）\nGPT 6 Luna （Max）\n+0.00%\nMiMo V2.6 Pro\nMiMo V2.6 Flash\n-10.00%\nMimo V2.5 Pro\n-20.00%\n$5\n$2\n$1\n$0.50\n$0.20\n$0.10\n$0.05\nMedian cost per task （last\n14 days）O", "image_caption": "① 图中内容：一张对比图，展示“Claude Sonnet 5.5”与“Agent Arena”平台的帕累托前沿（Pareto Frontier）上各大模型的性能与成本关系。图中以散点图形式呈现多个大模型在“任务中位成本”（横轴）与“性能相对提升”（纵轴）上的位置，绿色曲线代表帕累托前沿，即在给定成本下性能最优的模型集合。图中特别标注了Claude Sonnet 5.5 (Max) 的具体性能和成本数据。\n\n② 可见文字要点：\n- 标题：Claude Sonnet 5.5 vs. Pareto Frontier for Agent Arena\n- 水印/品牌：Arena, ARENA.AI\n- 图例/标注：\n  - Claude Sonnet 5.5 (Max)：Anthropic - Proprietary，Score: +12.52%，Cost/task: $2.74\n  - 其他模型：Claude Opus 5.5 (Max)、Claude Opus 5.5 (High)、GPT 6.1 Sol (Max)、Deepseek V4.1 Flash (Max)、GPT 6 Luna (Max)、MiMo V2.6 Pro、MiMo V2.6 Flash、Mimo V2.5 Pro\n  - 横轴标签：Median cost per task (last 14 days)\n  - 纵轴标签：+20.00% 至 -20.00%\n\n③ 与条目标题的关系：\n该图直接支撑标题“Agent 基础设施新进展:大模型长上下文推理成本再降一半”。图中显示，Claude Sonnet 5.5 (Max) 位于帕累托前沿上，其成本为 $2.74/任务，性能提升+12.52%，表明其在性能与成本之间取得了良好平衡。同时，图中其他模型如 MiMo V2.6 Flash 和 Mimo V2.5 Pro 等成本已降至 $0.05 以下，而性能仍保持在+10%以上，说明大模型在长上下文推理任务上的成本确实在持续下降，部分模型成本已降至原价的一半以下，符合“成本再降一半”的标题描述。\n\n④ 关键数值与趋势：\n- Claude Sonnet 5.5 (Max) 成本：$2.74/任务，性能提升：+12.52%\n- 帕累托前沿上成本最低的模型（如 MiMo V2.6 Flash）成本：$0.05/任务，性能提升：+10%以上\n- 趋势：随着成本从 $5 降至 $0.05，性能提升从 +20% 降至 +10% 以下，表明在成本降低的同时，性能提升幅度有所收窄，但整体仍保持在较高水平，说明大模型在长上下文推理任务上的成本效率持续优化。", "image_status": "ok", "score": 7.3, "enrich_model": "glm-4-flash", "score_reason": "中等相关性，具体成本数据", "url": "http://127.0.0.1:8765/items/localproof2", "title": "Agent 基础设施新进展:大模型长上下文推理成本再降一半", "source": "aihot", "category": "ai-news", "scores": {"value": 7, "relevance": 8, "credibility": 7}, "dedup_key": "http://127.0.0.1:8765/items/localproof2"}], "text": "**AI 资讯 · 2026-10-03**\n- [开源大模型社区发布多模态 LLM 新版本,评测基准全部开源](http://127.0.0.1:8765/items/localproof1)\n- [Agent 基础设施新进展:大模型长上下文推理成本再降一半](http://127.0.0.1:8765/items/localproof2)"}
