AI & ML分析25輪施壓測試:大模型紛紛讓步,推理過程卻守住了正確答案arXiv 上的新基準 SPINE 與模型爭論最多 25 輪。受測的七個系統無一例外,對話越長,讓步率越高。Seung Jung·3 天前5分鐘
AI & MLSuno用授權曲庫重建全部模型,此前所有版本將退役Suno的v6基於從華納、BMG和Believe獲得授權的曲庫訓練,公司稱此前的訓練資料一份也沒有沿用。Seung Jung·4 天前5分鐘
開發者工具分析LLM修復程式碼時弄壞可用程式碼的次數,是真正修好次數的十倍一項arXiv研究測得LLM修復迴圈破壞正確程式的比率為0.261,修復缺陷程式的比率僅0.023,並找到了驅動這一行為的內部方向。Seung Jung·4 天前5分鐘