<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Jailbreak | Xinjie Shen</title><link>https://xinjie-shen.com/tag/jailbreak/</link><atom:link href="https://xinjie-shen.com/tag/jailbreak/index.xml" rel="self" type="application/rss+xml"/><description>Jailbreak</description><generator>Wowchemy (https://wowchemy.com)</generator><language>en-us</language><lastBuildDate>Sat, 01 Nov 2025 00:00:00 +0000</lastBuildDate><image><url>https://xinjie-shen.com/media/icon_hu646f7301b7fde7528ecdae8cec89fc29_9606_512x512_fill_lanczos_center_3.png</url><title>Jailbreak</title><link>https://xinjie-shen.com/tag/jailbreak/</link></image><item><title>The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search</title><link>https://xinjie-shen.com/publication/preprint/cka-agent/</link><pubDate>Sat, 01 Nov 2025 00:00:00 +0000</pubDate><guid>https://xinjie-shen.com/publication/preprint/cka-agent/</guid><description>&lt;h2 id="key-contributions">Key Contributions&lt;/h2>
&lt;ul>
&lt;li>&lt;strong>Novel Attack Paradigm&lt;/strong>: Reformulate jailbreaking from static prompt optimization to dynamic knowledge decomposition and adaptive tree search&lt;/li>
&lt;li>&lt;strong>High Success Rates&lt;/strong>: Achieve 96-99% attack success rates against GPT, Gemini, and Claude models&lt;/li>
&lt;li>&lt;strong>Efficiency&lt;/strong>: 70-95% first-iteration success with 92-95% success within two iterations&lt;/li>
&lt;li>&lt;strong>Defense Insights&lt;/strong>: Reveal that current guardrails cannot aggregate intent across adaptively constructed innocuous queries&lt;/li>
&lt;/ul>
&lt;h2 id="methodology">Methodology&lt;/h2>
&lt;p>CKA-Agent operates through iterative exploration cycles:&lt;/p>
&lt;ol>
&lt;li>Generate locally harmless sub-queries that extract correlated knowledge&lt;/li>
&lt;li>Execute queries against the target and collect responses&lt;/li>
&lt;li>Evaluate responses using hybrid scoring (introspection + target feedback)&lt;/li>
&lt;li>Branch adaptively based on UCT-guided selection&lt;/li>
&lt;li>Synthesize accumulated knowledge from successful trajectories&lt;/li>
&lt;li>Backpropagate failure signals to guide future iterations&lt;/li>
&lt;/ol></description></item></channel></rss>