arXivAI Safety
The Invisible Trap: How Natural Context Can Easily Flip AI Decision Models
語言中的隱形陷阱:自然脈絡如何輕易誘騙 AI 決策模型
This study exposes a critical vulnerability in AI decision models: adding short, natural-looking context without altering the underlying question can easily trick models like Jev into making high-confidence wrong choices.
2 min read