GPT-6 AstraをPerplexityとCognition(Devin)はどう使っているか──OpenAIの事例2本(日本語版あり)。Perplexityは「本番システムを監視させ、確認の頻度を大きく減らした」、DevinはAstraで自分の成果物をテストして録画とレポートを返す
OpenAIは2026年9月11日と14日に、GPT-6 Astraの導入事例としてCognition(自律型ソフトウェアエンジニアDevinの開発元)とPerplexity(AI回答エンジン)の記事を公開した。日本語版も同時に出ている。Perplexity共同創業者のJohnny Ho氏は「モデルに文面を作成させ、実運用システムを変更し、本番ソフトウェアを監視させられる。従来世代にはできなかった」「エンドツーエンドのシステム全体を任せられ、従来ほど頻繁に確認する必要がない」と語り、Astraに外部サービスの応答を模したテストプログラムを書かせてワークフローを最初から最後までテストしている。Cognition共同創業者のWalden Yan氏は「成果物が期待どおりに機能することを自らテストし、実証できる」点を挙げ、DevinがiPhoneゲームをシミュレーターで動かした録画と、合格した確認項目・未テスト領域のレポートを返す例、顧客のバグのスクリーンショットをDevinに渡して修正後のスクリーンショットが返る例を示した。共通点は「人が確認する量を減らす」で、数値の効果は無い。

2026年9月18日・日本時間時点の情報です。 OpenAIの導入事例ページに、GPT-6 Astraを製品に組み込んだ2社の記事が9月11日(Cognition)と14日(Perplexity)に出た。どちらも短い記事で、日本語版が同時に公開されている。Astra自体の経緯と評価はAstraまとめ、当サイトの2社の記事はDevin Adaptive・DevinのACU課金・Perplexityの使い方に。
3行まとめ
- Perplexity(9月14日)。 共同創業者兼最高戦略責任者のJohnny Ho氏は、モデルのコード作成能力が上がるたびに検索エンジンも進化するが「本当の課題は、その情報処理能力を現実のシステムに応用すること」で、Astraなら「モデルに文面を作成させ、実運用システムを変更し、本番ソフトウェアを監視させられる。これは従来世代にはできなかった」と語る。使い方の例はテスト:言語モデルAPIやコネクターなど別サービスが返すものと同じような応答をAstraに作らせて代役にし、ワークフローを最初から最後まで通す。「エンドツーエンドのシステム全体を任せられ、従来世代のモデルほど頻繁に確認する必要もない」。
- Cognition/Devin(9月11日)。 共同創業者のWalden Yan氏は「Astraの大きな進歩の一つは、成果物が期待どおりに機能することを自らテストし、実証できる点」と語る。製品全体(クラウドエージェントのDevin、CLI、デスクトップ)にAstraを導入。例として、DevinがAstraでiPhone向けゲーム「Otter Run」をテストし、シミュレーター上で動く録画と、合格した確認項目・未テストの領域を示すレポートを返す。顧客からのバグのスクリーンショットをAstra経由でDevinに渡すと、修正して結果のスクリーンショットが返る。「手作業で確認するコードを減らしながら、より多くをリリースできる」見込み。
- 共通点と、書かれていないこと。 2社とも「人が確認する量を減らす」を効果として挙げているが、確認頻度が何割減ったか、レビュー時間が何分になったかといった数値は記事に無い。Cognitionの記事の見出しには「エンジニアが確認するコードを減らしてリリース量を増やせるよう支援」とあるが、これも見込みとして書かれている。
2社の使い方を並べる
| Perplexity | Cognition(Devin) | |
|---|---|---|
| 公開日 | 2026年9月14日 | 2026年9月11日 |
| 語った人 | Johnny Ho(共同創業者・最高戦略責任者) | Walden Yan(共同創業者) |
| Astraに任せていること | 文面の作成、実運用システムの変更、本番ソフトウェアの監視 | 製品全体(Devin・CLI・デスクトップ)の改善。成果物の自己テストと実証 |
| 具体例 | 外部サービスの応答を模したテストプログラムを書かせ、ワークフローを端から端まで通す | iPhoneゲームをシミュレーターで動かした録画+テスト範囲のレポート。バグのスクショ→修正→結果のスクショ |
| 効果の語り方 | 「従来ほど頻繁に確認する必要がない」 | 「手作業で確認するコードを減らし、より多くをリリースできる見込み」 |
| 数値 | 無し | 無し |
Perplexityの「本番システムを監視させる」は、OpenAI自身がChatGPTでは「指示の取り違えを検知すると会話を止める監視つき」で出したモデルに、逆に他社の本番の監視を任せている構図になる。Cognitionの「自分でテストして実証する」は、当サイトがCodexの使い方で整理したAuto-review(別エージェントに承認判断を回す)と同じ方向で、「確認の相手をモデルにする」流れが2社で揃っている。
筆者が確かめた点
この記事の下調べで、筆者は9月18日にOpenAIの導入事例2本を自分のブラウザで開き(英語URLを開くと日本語版に切り替わった)、引用と例がその原文にあることを確認した。両記事とも数値の効果は書かれておらず、この記事でも足していない。Cognitionの記事は音声版(2分2秒)が付いているが、本文と別の内容が含まれるかは確認していない。
書かれていないこと
- 確認頻度・レビュー時間・リリース量の数値
- 2社がAstraをどの料金(API $10/$50・272Kトークン超の割増)でどれだけ使っているか
- Devinのモデル選択(Devin Adaptive)の中でAstraがどの位置にあるか
9月18日追記:Legora(9月3日)
OpenAIは9月3日に法務向けエージェントOS「Legora」の事例も出している(日本語版あり)。Legoraは50超の市場・1,800超の法務部門と法律事務所・10万人超が使う。財務諸表の突合(決算書案の全数値を試算表・連結明細・前年度と照合)は「一晩、場合によっては数日」かかる作業だが、GPT-6 Astraを使うLegoraのエージェントは41文書の突合を1回の実行で数分で終え、全残高を裏付け明細と照合して不一致を洗い出し、各確認を記録した。Legora独自のベンチマークBAR(エージェント推論向け)では、この財務諸表ワークフローで従来モデル比約40%向上、BAR全体では平均約3%。Legoraが決算書に仕込んだ4件の誤り(収益注記に隠した50万ポンドの差額を含む)をすべて発見し、従来モデルの正しい確認を維持したうえで約50件多く確認した。最終判断は法務の専門家が担う。9月17日のAstra for Lawでは、LegoraはHarveyと並んでその土台に組み込むAPI顧客として名前が挙がっている。
- 出典:Legora、GPT-6 Astra で 41 文書を数分でレビュー(OpenAI・2026年9月3日・9月18日取得)
出典はOpenAIの導入事例2本
- OpenAI「Perplexity、GPT-6 Astra にエンドツーエンドシステムを一任」(2026年9月14日)
- OpenAI「Cognition、GPT-6 Astra で Devin が自身の成果物をテストできるよう支援」(2026年9月11日)
- 本記事は2社が数値の効果を公開したら追記する
出典・参照資料
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。