はじめに
hkob の雑記録の第527回目(連続101日目)は、新しいオープンモデルである GLM 5.2 が利用可能になった件を記録しておきます。
NotionHQ のポスト
以下のポストがありました。
新しいオープンウェイトモデル:GLM 5.2 が Notion で利用可能になりました。
長期的タスク向けに構築。@baseten 経由で提供。
New open-weight model: GLM 5.2 is now available in Notion.
— Notion (@NotionHQ) 2026年6月16日
Built for long-horizon tasks. Served via @baseten. pic.twitter.com/M4mBXGUCo0
GLM に聞いてみた
せっかくなので、GLM 5.2 自体に「GLM ってどんな特徴がありますか」と聞いてみました。やはり長時間の自律タスクに特化しているようですね。
GLM(Zhipu AI / Z.ai が開発)の主な特徴:
アーキテクチャ・規模
- MoE(Mixture of Experts)構成: GLM-5.2 は約753Bパラメータ(GLM-4.5は355B総量・32Bアクティブ)
- オープンウェイト: MITライセンスで公開、商用利用・二次開発が自由
- 1Mトークンコンテキスト(GLM-5.2): 従来比5倍のコンテキストウィンドウ、最大131Kトークン出力
長期タスク向け設計
- ロングホライズン・エージェント: 大規模コーディング、自動リサーチ、パフォーマンス最適化など長時間の自律タスクに特化した学習を実施
- GLM-5.1はMETR基準でオープンソース唯一の8時間連続自律動作を実現
- GLM-5.2はTerminal-Benchで80%超を達成した初のオープンウェイトモデル
推論・思考モード
- 2段階のReasoningモード(High / Max): リクエストの複雑さに応じて思考深度を切替可能
- Interleaved Thinking: 応答・ツール呼び出し前に推論を実行し、指示追従精度を向上
- Preserved Thinking: マルチターン会話で思考ブロックを保持し、再推論のコストを削減
コーディング・エージェント能力
- Claude Code、Cline、Roo Code等の主要コーディングツールキットとシームレス互換
- ネイティブ関数呼び出し(Function Calling)で複数ターンにわたるツール・API連携が可能
- SWE-Bench Pro、Terminal-Bench等のコーディングベンチマークでフロンティア級のスコア
コスト効率
- GLM Coding Plan は Lite ($3/月) 〜 Max まで展開、Claude等と比較して約1/7〜1/50のコスト
- API価格も $0.55–0.60/M入力、$2.00–2.20/M出力と低価格帯
GLMシリーズの推移
バージョン コンテキスト 特筆事項 GLM-4.5 128K ハイブリッド推論、agentic基盤モデル GLM-4.6 200K 128K出力、CC-BenchでClaude Sonnet 4に肉薄 GLM-4.7 — Interleaved/Preserved Thinking、30B-A3B Flash版 GLM-5 — Vibe Coding → Agentic Engineering、Vending Bench 2で1位 GLM-5.1 ~200K 8時間連続自律タスク、SWE-Bench Pro SOTA GLM-5.2 1M 2段階推論、Terminal-Bench 80%超 NotionでもBaseten経由でGLM 5.2が利用可能になったのが、ご参照いただいたポストの内容です。
Baseten
NotionHQ のポストや上の特徴でも書かれている Baseten の GLM 5.2 のページにアクセスしてみました。
トップページには以下のように書かれています(日本語に翻訳しています)。やはり長時間の自律的タスクを特徴として謳っています。
GLM-5.2は、Z.AIが開発した次世代の主力エージェントエンジニアリングモデルであり、数時間に及ぶタスクを自律的に実行できるように設計されています。GLM-5.1よりも大幅に強化されたコーディング機能とエージェント機能、そして1MのコンテキストウィンドウをサポートするMoE + DSAアーキテクチャを備えたGLM-5.2は、本番規模での継続的な反復を必要とする長期的なコーディングワークフロー向けの、最先端のオープンモデルです。
パフォーマンスグラフが出ていますが、確かに Terminal Bench で 80% を超えていますね。上の方で GLM が自分で主張していましたが、オープンモデルでは初らしいです。

おわりに
オープンモデルの中ではかなりインテリジェンスが高いモデルですね。ただ、Notion での長時間稼働するモデルのユースケースってどんなものがあるのですかね。以前は20分くらいが上限だった気がしますが。