<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Determinism as Multi-Turn SLA on Haxlys's Blog</title><link>https://hugo-blog-static-site.haxlys.workers.dev/frameworks/determinism-as-multi-turn-sla/</link><description>Recent content in Determinism as Multi-Turn SLA on Haxlys's Blog</description><generator>Hugo -- 0.152.2</generator><language>kr-ko</language><lastBuildDate>Thu, 30 Apr 2026 11:24:00 +0900</lastBuildDate><atom:link href="https://hugo-blog-static-site.haxlys.workers.dev/frameworks/determinism-as-multi-turn-sla/index.xml" rel="self" type="application/rss+xml"/><item><title>Scaling Pain — 智谱 GLM-5가 초대규모 Coding Agent 추론에서 실제로 부딪힌 벽</title><link>https://hugo-blog-static-site.haxlys.workers.dev/posts/scaling-pain-zhipu-glm5-coding-agent/</link><pubDate>Thu, 30 Apr 2026 11:24:00 +0900</pubDate><guid>https://hugo-blog-static-site.haxlys.workers.dev/posts/scaling-pain-zhipu-glm5-coding-agent/</guid><description>智谱(Z.ai)이 공개한 「Scaling Pain」은 GLM-5 시리즈가 초대규모 Coding Agent 호출에서 겪은 추론 인프라 문제를 처음으로 공개한 글이다. 처리량 +132%, 이상 출력률 만분의 십몇에서 만분의 3 미만으로의 개선, 그리고 SGLang 업스트림으로 환원된 PR #22811이 의미하는 바를 짚는다.</description></item></channel></rss>