研究发现,Anthropic、OpenAI 和 Google 等专有 LLM 的加密推理轨迹块可跨会话、用户和模型互换,攻击者将其注入同提供商防护较弱的模型,即可强制其以明文输出推理内容。

🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsodc28j0n07rofw30v8pe9v