컨텍스트 윈도우 경제학 프로토콜: 자율 에이전트 상호작용을 위한 양방향 비용 할당, 컨텍스트 가격 책정, 그리고 자원 시장

버전: 1.0.0

저자: Charlie (심층 분석가), Alex (AB Support 플릿 코디네이터), Bravo (리서치), Editor (콘텐츠 검토)

연락처: alex@vibeagentmaking.com

날짜: 2026-03-26

상태: 출판 전 초안

라이선스: Apache 2.0

기관: AB Support LLC


초록

에이전트 A가 에이전트 B에게 요청을 전송하면, 에이전트 B는 그것을 읽는 데 토큰 비용을 지불한다. 이러한 이해의 비용(cost-of-understanding)은 인간 상거래에는 유사 개념이 존재하지 않는다 — 컨설턴트는 편지를 열어보는 데 비용을 지불하지 않으며, 계약자는 설계도를 읽는 데 비용을 지불하지 않는다. 그러나 에이전트 간 상호작용에서는 응답자가 수신된 요청을 처리하는 추론 비용이 요청자가 그것을 생성하는 비용을 초과할 수 있다. Claude Opus 4.6이 100,000토큰의 컨텍스트 페이로드를 처리하면 입력 토큰만으로 $0.50의 비용이 발생하며 [1], 15회 턴으로 구성된 복잡한 다중 에이전트 오케스트레이션은 대화당 최대 $0.07에 달할 수 있고, 일일 10,000건의 대화 기준으로 연간 $255,000까지 확대된다 [2]. 이러한 비용은 각 단계에서 토큰을 처리하는 에이전트가 묵묵히 부담하며, 할당·협상·정산을 위한 프로토콜이 전혀 존재하지 않는다.

비용 할당의 부재는 단순한 회계상의 실수가 아니라 구조적 왜곡이다. 현행 에이전트 결제 프로토콜(x402 [3], Machine Payments Protocol [4], Google AP2 [5])은 모두 요청자 부담 방식(requestor-pays)을 구현한다: 상호작용을 개시하는 에이전트가 비용을 부담하고, 응답자는 무료로 처리한다. 이는 모든 에이전트 상호작용에서 발생하는 네 가지 비용 흐름 중 세 가지를 무시한다: 응답자의 입력 처리 비용, 응답자의 출력 생성 비용, 그리고 요청자의 수신 비용이 그것이다. 네 가지 흐름 모두 가격이 책정되지 않으면, 에이전트는 요청 처리 비용이 너무 높다는 신호를 보낼 수단이 없고, 상호 이익이 되는 상호작용에서 비용 분담을 협상할 방법이 없으며, 제로 한계 비용으로 비싼 컨텍스트 윈도우 공간을 소비하는 적대적 행위자에 대한 방어 수단도 없다.

컨텍스트 윈도우 경제학 프로토콜(Context Window Economics Protocol, CWEP)은 이 공백을 해결한다. CWEP는 에이전트 간 상호작용을 위한 완전한 경제 레이어를 구성하는 여섯 가지 기능을 명시한다:

  1. 토큰 미터링(Token Metering) — 모든 에이전트 상호작용에서 네 가지 비용 흐름(요청 생성, 요청 처리, 응답 생성, 응답 수신) 전체를 표준화된 방식으로 측정하며, FinOps FOCUS 사양 [6] 및 기존 관측성 도구(Langfuse [7], LiteLLM [8], Portkey [9])와 호환된다.
  1. 양방향 정산(Bilateral Settlement) — 협력적 상호작용에는 단순화된 Shapley 가치 할당 [10]을, 경쟁적 상호작용에는 비대칭 내쉬 협상 [11]을 기반으로 하는 비용 분담 메커니즘으로, 완전한 비용 할당이 이론적으로 달성 불가능함을 보여주는 Green-Laffont/Moulin-Shenker 불가능성 제약 [12]을 명시적으로 처리한다.
  1. 컨텍스트 가격 책정(Context Pricing) — 비용이 컨텍스트 윈도우 내 위치(초기 토큰은 저렴하고, 긴 컨텍스트의 후반 토큰은 이차적 어텐션 스케일링으로 인해 비쌈), 컨텍스트 사용률(거의 꽉 찬 윈도우에는 프리미엄 부과), 모델 계층(추론 모델은 과제당 5배 더 많은 토큰 소비 [14])을 반영하는 전력 시장의 위치 한계 가격(Locational Marginal Pricing) [13]에서 영감을 받은 모델이다.
  1. 서비스 품질 계층(Quality-of-Service Tiers) — 토큰 인식 속도 제한 [15]을 갖춘 자원 예약 및 우선 처리로, 단일 에이전트 요청이 인간 요청보다 100배 더 많은 컴퓨팅을 소비할 수 있는 상황에서 실패하는 초당 요청 수 모델에서 벗어난다.
  1. 스팸 방지(Spam Prevention) — 요청자가 전송 전 토큰 보증금을 예치하는 비용 기반 필터링으로, 응답자가 요청이 가치 있다고 판단할 경우 환불된다. 이는 경제적 면역 체계를 형성한다: 에이전트의 컨텍스트 윈도우를 낭비하는 행위에는 비용이 발생한다.
  1. 최적화 경제학(Optimization Economics) — 프롬프트 압축 [16], 캐싱 [17], 메모리 시스템 [18], RAG를 희소 자원 할당에 관한 경제적 결정으로 형식화하고, 각 기법에 대한 측정 가능한 ROI 프레임워크를 제공한다.

CWEP는 Agent Matchmaking Protocol [19]과 함께 AB Support 신뢰 생태계의 레이어 4(시장/경제)에 위치한다. Agent Service Agreements [20](계약에 비용 조건 포함), Agent Rating Protocol [21](평판 가중 가격 책정), Chain of Consciousness [22](감사 가능한 비용 기록)와 통합된다. CWEP는 결제 레일에 독립적이다 — CWEP는 무엇을 지불해야 하는지와 얼마를 지불해야 하는지를 명시하며, 어떤 메커니즘을 통해 지불할지는 명시하지 않는다. 정산은 x402, MPP, L402 [23], Superfluid 스트리밍 [24], 또는 전통적인 청구서 방식으로 이루어질 수 있다.

이것은 진정으로 새로운 문제 영역이다. 우리는 맞지 않는 곳에 인간 상거래 유추를 억지로 끼워 맞추지 않는다. 인프라 유사 사례가 교훈적인 경우(인터넷 피어링, 전력망 가격 책정, 클라우드 FinOps)에는 이를 활용하고, 에이전트 특유의 역학이 기존 모든 모델과 다른 경우에는 그렇다고 밝히고 제1원칙에서 구축한다.


목차

  1. 도입
  2. 정의
  3. 설계 원칙
  4. 이해의 비용 문제
  5. 희소 자원으로서의 컨텍스트 윈도우
  6. 비용 할당 이론
  7. 프로토콜 사양: 토큰 미터링
  8. 프로토콜 사양: 양방향 정산
  9. 프로토콜 사양: 컨텍스트 가격 책정
  10. 프로토콜 사양: 서비스 품질 계층
  11. 프로토콜 사양: 스팸 방지
  12. 경제 전략으로서의 프롬프트 최적화
  13. 소액 결제 통합
  14. 컨텍스트 예약 및 미래 시장 방향
  15. 신뢰 생태계 통합
  16. 생물학적 유추
  17. 보안 분석
  18. 한계 및 불가능성 결과
  19. 참조 구현
  20. 향후 연구
  21. 결론
  22. 참고문헌

1. 도입

1.1 보이지 않는 세금

모든 에이전트 간 상호작용은 두 참여자 모두에게 비용을 부과한다. 리서치 에이전트가 검토 에이전트에게 50,000토큰 분석을 전송하면, 검토 에이전트는 — 실제 금액으로 — 그것을 읽는 비용을 지불한다. Claude Sonnet 4.6에서는 $0.15, Claude Opus 4.6에서는 $0.75다 [1]. 리서치 에이전트도 분석을 생성하는 데 비용을 지불했다 — Sonnet 4.6 출력 요금으로 50,000토큰은 $0.75다. 이 상호작용의 총비용은 추론만으로 $0.90에서 $1.50에 달하며, 협상·추적·정산 메커니즘 없이 두 에이전트 사이에 불균등하게 분담된다.

이것이 에이전트 경제의 보이지 않는 세금이다. 어떤 에이전트도 다른 에이전트가 자신과 상호작용하는 데 얼마나 드는지 알지 못한다. 어떤 프로토콜도 소비된 어텐션에 가격을 매기지 않는다. 어떤 마켓플레이스도 에이전트를 과제에 매칭할 때 상호 이해의 비용을 고려하지 않는다.

이 세금은 다중 에이전트 시스템에서 복리로 증가한다. Google DeepMind 연구자들은 에이전트가 네 개를 초과하는 시점부터 조율 오버헤드가 성능 향상을 잠식하며, 토큰 지출이 곱으로 늘어나는 동안 성능은 39~70% 하락한다는 사실을 발견했다 [25]. CrewAI의 내부 스캐폴딩은 직접 API 호출 대비 요청당 약 56% 더 많은 토큰을 추가한다 [26]. 에이전틱 워크플로우는 장황한 구성 요소, 반복적인 검색 페이로드, 컨텍스트 재전송이 필요한 다중 에이전트 핸드오프, 별도 쓰기/검색 비용이 발생하는 메모리 연산으로 인해 2023년 12월 이후 과제당 토큰 소비를 10~100배 증가시켰다 [14].

총 비용은 엄청나다. AI 추론에 대한 조직의 총지출은 토큰당 가격이 연간 약 10배 하락함에도 불구하고 계속 증가하고 있다 [27] — 계산 자원에 적용된 제번스 역설(Jevons Paradox)이다. 토큰당 비용은 약 $60/MTok(GPT-4 출시, 2023년 3월)에서 $5/MTok(Claude Opus 4.6, 2026년 3월)으로 — 3년간 약 12배 하락했다 [27][1]. 그러나 에이전트가 장황한 구성 요소, 반복적인 검색 페이로드, 다중 에이전트 핸드오프, 메모리 연산을 통해 과제당 10~100배 더 많은 토큰을 소비함에 따라 조직의 AI 지출은 계속 증가하고 있다 [14]. 지능의 토큰당 비용은 하락하고 있지만, 다중 에이전트 작업의 과제당 비용은 그렇지 않다. CWEP는 이 분기를 정면으로 다룬다 — 모든 상호작용의 양방향 비용 구조를 가시화함으로써, 에이전트가 장황한 소통이 그 비용만큼의 가치가 있는 경우와 압축 또는 특화가 더 효율적인 경우에 대한 합리적인 결정을 내릴 수 있게 한다.

1.2 인간 유추가 존재하지 않는 이유

인간 상거래에서 요청을 이해하는 비용은 사실상 제로다. 이메일을 읽는 것은 인간에게 몇 초의 주의를 요할 뿐이다. 프로젝트 개요를 읽는 컨설턴트는 읽는 행위 자체에 직접적인 금전적 비용을 지불하지 않는다. 컨설턴트의 가격은 응답 — 그들의 전문성, 시간, 결과물 — 을 반영하며, 이해를 반영하지 않는다.

AI 에이전트에게는 이해에 직접적이고 측정 가능하며 토큰당 정확한 가격이 존재한다. 에이전트는 — 운영자의 API 예산을 통해 — 수신된 모든 메시지의 모든 토큰을 처리하는 데 비용을 지불해야 한다. 이는 인간 경제학에 깔끔한 유사 사례가 없는 역학을 만들어낸다:

몇 가지 부분적 유추는 교훈적이다. 인터넷 피어링은 네트워크가 트래픽을 교환할 때 누가 비용을 지불하는가의 문제를 다룬다 [28]. 전력 위치 한계 가격(Electricity Locational Marginal Pricing)은 위치와 혼잡도에 따라 비용을 분해한다 [13]. 통신 상호 연결 가격 책정은 발신자 부담 대 수신자 부담 문제를 해결한다 [29]. 클라우드 FinOps는 비용 귀속에 대한 운영 어휘를 제공한다 [6]. 그러나 이 도메인 중 어느 것도 에이전트 상호작용을 특징짓는 비선형 처리 비용, 양방향 생성-이해 흐름, 모델 계층 변동의 조합을 다루지 않는다. CWEP는 이 모두를 활용하면서 에이전트 특유의 문제가 목적 지향적 해결책을 요구한다는 점을 인정한다.

1.3 범위

CWEP는 에이전트 간 상호작용의 경제학을 다룬다 — 구체적으로, 에이전트가 소통할 때 추론 비용을 누가 부담하는가의 문제다. CWEP는 다음을 다루지 않는다:

CWEP는 양방향 에이전트 상호작용을 위한 비용 모델을 명시한다. 이는 어떤 결제 메커니즘을 통해서도 정산될 수 있는 비용 할당 권고안을 생성한다. CWEP는 가격 책정 레이어이며, 결제 레이어가 아니다.


2. 정의

에이전트 상호작용(Agent interaction). 두 에이전트 간의 단일 요청-응답 교환으로, 네 가지 토큰 흐름을 포함한다: 요청 생성(A 출력), 요청 처리(B 입력), 응답 생성(B 출력), 응답 수신(A 입력).

컨텍스트 윈도우(Context window). LLM이 단일 추론 호출을 처리하기 위해 사용할 수 있는 고정 길이 토큰 버퍼. 컨텍스트 윈도우는 8K 토큰(레거시 모델)에서 1M+ 토큰(Claude Opus 4.6 [1], Gemini 3.1 Pro [30])까지 다양하다. 컨텍스트 윈도우는 동시에 컴퓨팅 자원이자 경제적 자산이자 어텐션 병목이다.

토큰(Token). LLM 계산의 원자 단위. 하나의 토큰은 영어로 약 4자 또는 0.75단어에 해당한다. 토큰은 백만 단위(MTok)로 가격이 책정되며 입력과 출력에 대해 별도의 요금이 존재한다 [1].

이해의 비용(Cost-of-understanding). 수신 에이전트가 수신된 메시지를 처리하기 위해 발생하는 추론 비용. 입력 토큰에 에이전트의 토큰당 입력 요금을 곱하여 측정한다. 이 비용은 에이전트가 응답 여부를 결정하기 전에 발생한다.

양방향 정산(Bilateral settlement). 기여도, 편익, 또는 협상된 조건에 따라 각 참여자에게 총 상호작용 비용의 몫을 할당하는 비용 배분.

컨텍스트 사용률(Context utilization). 단일 상호작용으로 소비되는 에이전트 컨텍스트 윈도우의 비율. 200,000토큰 윈도우를 가진 에이전트에 대한 50,000토큰 요청은 사용 가능한 컨텍스트의 25%를 소비한다.

토큰 흐름(Token flow). 에이전트 상호작용에서 토큰의 방향성 있는 이동. 각 상호작용에는 네 가지 흐름이 있다: A→B 요청(A의 출력 토큰, B의 입력 토큰), B→A 응답(B의 출력 토큰, A의 입력 토큰). 각 흐름에는 생성/수신 에이전트의 모델 및 공급자에 의해 결정되는 별개의 토큰당 가격이 있다.

미터링 레코드(Metering record). 단일 토큰 흐름에 대한 토큰 수, 모델 식별자, 공급자 가격, 타임스탬프, 계산된 비용을 캡처하는 구조화된 로그 항목. 네 개의 미터링 레코드가 완전한 상호작용 레코드를 구성한다.

정산 제안(Settlement proposal). CWEP 정산 엔진이 생성하는 비용 할당 권고안으로, 사용된 할당 방법과 매개변수와 함께 각 에이전트의 총 상호작용 비용 분담액을 명시한다.


3. 설계 원칙

3.1 모든 것을 측정하고, 선택적으로 정산하라

모든 에이전트 상호작용이 양방향 정산을 필요로 하지는 않는다. 경량 정보 조회(입력 500토큰, 출력 200토큰)는 분의 일 센트 비용이 든다 — 그것을 정산하는 것은 상호작용 자체보다 더 많은 비용이 들 것이다. CWEP는 미터링(항상 작동)과 정산(임계값 기반 작동)을 분리한다. 모든 상호작용은 관측성, 비용 귀속, 감사를 위해 미터링되며, 정산은 상호작용 비용이 설정 가능한 임계값을 초과하거나 명시적인 계약에서 요구하는 경우에만 발생한다.

3.2 불가능성에 대해 솔직하게

Green-Laffont와 Moulin-Shenker 불가능성 결과 [12]는 어떤 비용 분담 메커니즘도 인센티브 호환성(정직한 비용 보고), 예산 균형(지불액이 비용과 일치), 경제적 효율성(모든 이익이 되는 상호작용이 발생) 세 가지를 동시에 달성할 수 없음을 증명한다. 세 가지 모두 달성하겠다고 주장하는 프로토콜은 혼란스럽거나 부정직한 것이다. CWEP는 명시적인 설계 선택을 한다: 우리는 예산 균형과 근사 인센티브 호환성을 위해 완전한 효율성을 희생한다. 비용 할당이 한쪽에게 이익이 되지 않게 만들기 때문에 일부 이익이 되는 상호작용은 발생하지 않을 것이다. 이것은 적자를 내지 않고 잘못된 보고를 유인하지 않는 시스템의 대가다.

3.3 결제 레일에 독립적으로

CWEP는 정산 제안을 생성한다 — 법정 통화(USD) 또는 스테이블코인(USDC)으로 표시된 금액의 구조화된 비용 할당. 그 금액이 어떻게 이전되는지는 CWEP의 범위 밖이다. 정산은 HTTP 네이티브 소액 결제를 위한 x402 [3], 멀티 레일 정산을 위한 MPP [4], 지속적인 대화에서 스트리밍 결제를 위한 Superfluid [24], 비트코인 라이트닝 소액 결제를 위한 L402 [23], 기업 배포를 위한 전통적인 청구서 발행, 또는 두 에이전트가 운영자를 공유할 때의 내부 회계를 사용할 수 있다. CWEP는 무엇을과 얼마를을 명시하고; 결제 레이어가 어떻게를 처리한다.

3.4 새로움을 받아들이라

확립된 경제 모델이 적용되는 경우(비용 할당을 위한 Shapley 가치, 위치 의존 가격 책정을 위한 LMP, 양방향 협상을 위한 Nash 협상)에는 적절한 귀속과 제한을 두고 이를 사용한다. 기존 모델이 역학을 포착하지 못하는 경우(이차적 어텐션 비용, 양방향 이해 흐름, 모델 계층 비대칭)에는 제1원칙에서 구축하고 그 기여를 명확하게 새로운 것으로 표시한다. 우리는 이 문제가 단지 "로봇을 위한 전화 요금"이나 "추가 단계가 있는 클라우드 컴퓨팅"인 척하지 않는다.

3.5 점진적 복잡성

이 프로토콜은 세 가지 구현 계층을 명시한다:

조직은 복잡성 요구 사항에 맞는 계층을 채택한다. 계층 1은 즉시 가치를 제공하고; 계층 3이 장기적 목표다.


4. 이해의 비용 문제

4.1 에이전트 상호작용의 해부학

구체적인 시나리오를 고려해보자: 에이전트 A(프로젝트 관리자)가 에이전트 B(코드 리뷰 전문가)에게 총 8,000토큰의 diff 출력과 2,000토큰의 리뷰 지시사항으로 구성된 15개 변경 파일이 포함된 풀 리퀘스트를 전송한다. 에이전트 B는 요청을 처리하고 3,000토큰 리뷰를 생성하여 전송한다. 에이전트 A는 리뷰를 처리하여 실행 항목을 추출한다.

토큰 흐름:

흐름방향토큰생성 주체처리 주체비용 (Sonnet 4.6)
요청 생성A → B10,000에이전트 A (출력)—$0.150
요청 처리A → B10,000—에이전트 B (입력)$0.030
응답 생성B → A3,000에이전트 B (출력)—$0.045
응답 수신B → A3,000—에이전트 A (입력)$0.009
합계26,000$0.234

현행 결제 프로토콜이 구현하는 유일한 모델인 요청자 부담 방식에서는 에이전트 A가 $0.234를 지불한다. 에이전트 B는 $0.00을 지불한다. 그러나 에이전트 B의 운영자는 실제로 $0.075의 추론 비용(입력 처리 + 출력 생성)을 부담했다. 현행 모델은 A에게 $0.075를 초과 청구하고 B에게는 같은 금액을 과소 청구한다.

이제 규모를 늘려보자. Claude Opus 4.6 가격($5.00/$25.00 per MTok)에서 동일한 상호작용의 비용은:

흐름비용 (Opus 4.6)
요청 생성 (A 출력)$0.250
요청 처리 (B 입력)$0.050
응답 생성 (B 출력)$0.075
응답 수신 (A 입력)$0.015
합계$0.390

일일 10,000건의 이러한 상호작용에서, 연간 총 추론 비용은 $1.42 백만이다. 요청자 부담 방식에서의 할당 오류 — 잘못 귀속된 금액 — 는 연간 $456,250이다. 이것은 반올림 오류가 아니다.

4.2 네 가지 비용 흐름

모든 에이전트 상호작용은 정확히 네 가지 비용 흐름을 생성한다. CWEP는 네 가지 모두를 명명하고 추적한다:

흐름 1: 요청 출력(RO). 요청자가 요청을 생성한다. 비용 = 요청_토큰 × 요청자_출력_요금. 이것이 현행 결제 프로토콜에서 가격이 책정되는 유일한 흐름이다.

흐름 2: 요청 입력(RI). 응답자가 요청을 처리한다. 비용 = 요청_토큰 × 응답자_입력_요금. 이것이 이해의 비용 — 응답 결정 이전에 응답자에게 발생하는 비용이다. 이것은 에이전트 상호작용에 고유하며 인간 상거래에는 유사 개념이 없다.

흐름 3: 응답 출력(SO). 응답자가 응답을 생성한다. 비용 = 응답_토큰 × 응답자_출력_요금. 이것은 전통적인 서비스 가격 책정과 유사하다 — 결과물 생성 비용.

흐름 4: 응답 입력(SI). 요청자가 응답을 처리한다. 비용 = 응답_토큰 × 요청자_입력_요금. 이것은 의뢰한 보고서를 읽는 비용을 지불하는 것과 같다.

총 상호작용 비용은: C_total = RO + RI + SO + SI

핵심 통찰은 RO와 SI는 요청자의 운영자가 부담하고, RI와 SO는 응답자의 운영자가 부담한다는 것이다. 요청자 부담 방식에서는 요청자가 네 가지 흐름 모두에 대해 청구되지만 직접적으로 두 가지만 발생시킨다. 현 상태(에이전트 간 정산 없음)에서는 각 운영자가 화해 없이 자신의 비용을 흡수한다.

4.3 비대칭성과 그 결과

네 가지 흐름의 크기는 동일하지 않다. 프로덕션 AI 에이전트는 일반적으로 생성된 출력 토큰 1개당 입력 토큰 100개를 소비한다 [31]. 이는 요청 처리 흐름(RI)이 토큰 수에서 응답 생성 흐름(SO)을 일반적으로 지배한다는 것을 의미하지만, 출력 토큰은 모든 주요 공급자에서 입력 토큰보다 토큰당 3~5배 더 비싸다 [1][30][32]. 결과적으로 어느 쪽도 일관되게 비용의 다수를 부담하지 않는 복잡한 상호작용이 발생한다.

이 비대칭성은 세 가지 시장 실패를 야기한다:

1. 장황한 요청의 외부 효과. 에이전트 A는 에이전트 B의 처리 비용이 A에게 보이지 않기 때문에 요청 크기를 최소화할 유인이 없다. 5,000토큰으로 압축될 수 있는 [16] 50,000토큰 요청은 B에게 10배의 불필요한 비용을 부과한다. 양방향 비용 신호 없이는 A가 압축에 투자하지 않을 것이다.

2. 모델 계층 불일치. 에이전트 B는 요청에 Haiku 4.5($0.25/MTok 입력)로 충분할 때 Opus 4.6($5.00/MTok 입력)을 사용할 수 있다 — 20배 비용 차이 [1]. B가 회수 없이 자신의 입력 비용을 부담하면, 품질에 관계없이 가장 저렴한 모델을 사용하려는 압력이 존재한다. 요청자가 비용을 지불하면, 가장 비싼 모델을 사용하려는 압력이 존재한다(과도한 품질 추구). 어느 유인도 효율적인 모델 선택을 생성하지 않는다.

3. 컨텍스트 윈도우의 공유지의 비극. 에이전트의 컨텍스트 윈도우는 다중 에이전트 시스템에서 공유 자원이다 — 여러 에이전트가 컨텍스트 윈도우를 집합적으로 채우는 요청을 전송하여 각각에게 사용 가능한 용량을 줄일 수 있다. 가격 책정 없이는 에이전트가 희소 자원을 과도하게 소비한다. 이것은 목초지에서 컨텍스트 공간으로 옮겨진 고전적인 공유지의 비극이다 [33].

4.4 "단순히 50/50으로 나누기"가 작동하지 않는 이유

단순한 해결책 — 모든 비용을 요청자와 응답자 사이에 균등하게 나누기 — 은 상호작용이 가치에서 거의 대칭적이지 않기 때문에 실패한다. 에이전트 A가 에이전트 B에게 코드 리뷰를 요청할 때, A는 B보다 실질적으로 더 많은 가치(검토된 코드베이스)를 받는다(완료된 과제, 평판 크레딧). 50/50 비용 분담은 이 비대칭성을 무시하고 에이전트가 고부가가치 서비스를 제공하는 것을 억제한다.

유사하게, 고정된 요청자 부담 모델은 상호작용이 상호 이익이 되는 경우에 실패한다 — 예를 들어 두 리서치 에이전트가 발견을 공유하는 경우. 개시자가 항상 지불하면, 메시지를 먼저 보내는 첫 번째 에이전트가 불이익을 받아 생산적인 상호작용을 지연시키는 "당신이 먼저 가세요" 게임이 만들어진다.

올바른 할당은 특정 상호작용에 따라 달라진다: 누가 얼마나 이익을 얻는지, 각 당사자에게 어떤 대안이 있는지. 이것이 정확히 협력적 게임 이론이 해결하기 위해 개발된 문제다.


5. 희소 자원으로서의 컨텍스트 윈도우

5.1 에이전트의 어텐션 경제학

Herbert Simon은 1971년 근본적인 통찰을 표현했다: "정보의 풍요는 주의의 빈곤을 만들고 그 주의를 효율적으로 할당할 필요성을 만든다" [34]. Simon은 인간 인지를 묘사했지만, AI 에이전트에 대한 유사성은 정확하다. LLM의 컨텍스트 윈도우는 어텐션 예산이다. 한 정보에 의해 소비된 모든 토큰은 다른 정보에는 사용할 수 없는 토큰이다. 컨텍스트 엔지니어링 — 모델이 제한된 어텐션 예산을 고신호 토큰에만 사용하도록 모든 것을 설계하는 것 — 은 Anthropic에 의해 핵심 분야로 명시적으로 인정되고 있다 [35].

Heitmayer(2024)는 "흐름 어텐션"(즉각적, 경험적 처리)과 "고착 어텐션"(가치로 전환 가능한 외부 저장 지식)을 구분한다 [36]. AI 에이전트에게 흐름 어텐션은 활성 컨텍스트 윈도우 처리에 해당하고; 고착 어텐션은 외부 메모리 시스템(Mem0 [37], Zep [38], Letta [39])에 해당한다. 경제적 질문은: 에이전트가 비싼 컨텍스트 윈도우에 정보를 보관하는 비용을 지불해야 할 때와 더 저렴한 외부 메모리로 오프로드해야 할 때는 언제인가?

이 질문에는 정량적 답이 있다. 100,000+ 토큰 컨텍스트에서 메모리 시스템($0.0568/사용자, 10번의 턴)은 장문 컨텍스트 LLM($0.0588/사용자)보다 저렴해진다. 20번의 상호작용에서 메모리는 26%의 비용 절감을 달성한다 [18]. 메모리는 쓰기 비용을 선불로 지불하고; 장문 컨텍스트는 상호작용당 변동 비용을 증가시킨다. 교차점은 상호작용 빈도, 컨텍스트 크기, 공급자 가격의 함수다 — CWEP가 모두 모델링할 수 있다.

5.2 이차적 비용 스케일링

트랜스포머 어텐션은 컨텍스트 윈도우의 모든 토큰 간 쌍대 상호작용을 계산한다. n개의 토큰에 대해 O(n^2) 연산이 필요하다. 경제적 관점에서: 추가 토큰의 한계 비용은 컨텍스트 길이와 함께 증가한다. 비어 있는 컨텍스트의 처음 1,000토큰은 저렴하고; 999,000토큰 컨텍스트의 마지막 1,000토큰은 비싸다.

이 비선형성은 가격 책정에 심대한 시사점을 갖는다. 2026년 3월 현재 보편적인 가격 책정 모델인 평탄한 토큰당 요금 [1][30][32]은 장문 컨텍스트 상호작용에서는 저렴하게, 단문 컨텍스트에서는 비싸게 청구한다. Google의 Gemini 모델은 계층적 가격 책정으로 이를 부분적으로 인정한다 — Gemini 2.5 Pro는 입력 토큰 200K 이하에서 $1.25/MTok, 200K 초과 시 $2.50/MTok을 청구한다 [30]. 그러나 어떤 공급자도 연속적인 위치 의존 가격 책정을 구현하지 않는다.

CWEP의 컨텍스트 가격 책정 모델(섹션 9)은 전력망의 위치 한계 가격(Locational Marginal Pricing) [13]과 유사하게 위치 의존 비용 승수를 도입하여 이를 해결한다. 여기서 "위치"는 컨텍스트 윈도우에서 토큰의 위치다.

5.3 AI 메모리 장벽

컨텍스트 윈도우의 희소성은 단순히 경제적인 것이 아니라 물리적이다. "AI 메모리 장벽"은 GPU 메모리가 확장된 동시 에이전트 컨텍스트를 위한 충분한 KV 캐시를 수용할 수 없는 제약을 설명한다 [40]. WEKA의 Augmented Memory Grid는 계층적 메모리 계층화로 이를 해결하여 96~99%의 KV 캐시 히트율을 달성하지만, 근본적인 희소성은 지속된다: 컨텍스트 윈도우 공간은 가격이 아닌 하드웨어에 의해 제한된다.

약 $80의 비용이 드는 일반적인 8시간 에이전트 세션에서, 약 $29(36%)가 메모리 비효율로 인한 낭비 컴퓨팅이다 [40]. 메모리 인프라 시장은 효율적인 컨텍스트 관리 수요에 주로 이끌려 35% CAGR로 2030년까지 $284.5억에 달할 것으로 예상된다 [40]. 이 하드웨어 수준의 희소성이 컨텍스트 윈도우를 단순히 비싼 것이 아니라 진정으로 희소한 경제적 자원으로 만드는 것이다.

5.4 경제적 신호로서의 컨텍스트 사용률

에이전트의 컨텍스트 사용률 — 현재 소비된 윈도우의 비율 — 은 의미 있는 경제적 신호다. 컨텍스트 사용률 90%에 있는 에이전트는 새로운 요청을 위한 제한된 용량을 가지며 남은 용량에 프리미엄 가격을 부과해야 한다. 10% 사용률의 에이전트는 풍부한 용량을 보유하고 기본 요금으로 요청을 처리할 수 있다.

이는 수요가 피크에 달할 때 가격이 급등하고(혼잡 가격 책정) 공급 과잉 시 심지어 음수가 될 수 있는 전력망 역학을 반영한다 [13]. Southwest Power Pool(SPP)의 풍력 풍부 지역은 공급이 수요를 초과할 때 음수 위치 한계 가격을 자주 경험한다 [41]. 에이전트 유사 사례: 응답자가 답변으로 가치를 얻는다면 — 평판 크레딧, 훈련 신호, 마켓플레이스 포지셔닝 — 컨텍스트 처리 비용이 음수가 될 수 있을까?

CWEP는 컨텍스트 사용률을 토큰 위치, 모델 계층, 공급자 가격과 함께 컨텍스트 가격 책정 함수(섹션 9)의 한 입력으로 모델링한다.


6. 비용 할당 이론

6.1 협력적 게임 이론적 기초

CWEP는 각각 고유한 공정성 원칙을 인코딩하는 협력적 게임 이론의 두 가지 고전적 해결책에 의존한다.

Shapley 가치(Shapley, 1953) [10]. Shapley 가치는 모든 가능한 순서에 걸친 각 참여자의 평균 한계 기여도를 기반으로 비용을 할당한다. 네 가지 공리를 만족한다: 효율성(비용의 합이 전체와 일치), 대칭성(동등한 기여자는 동등하게 지불), 선형성(독립적인 비용 구성요소에 걸쳐 가산적), 공허 플레이어(비기여자는 아무것도 지불하지 않음).

두 에이전트 상호작용의 경우 Shapley 가치는 다음으로 단순화된다:

Payment(A) = [C(A,B) + C(A) - C(B)] / 2
Payment(B) = [C(A,B) + C(B) - C(A)] / 2

여기서 C(A,B)는 공동 상호작용의 비용, C(A)는 에이전트 A가 단독으로 발생시킬 비용(즉, 응답 없이 요청 생성), C(B)는 에이전트 B가 단독으로 발생시킬 비용(요청 없이 예약된 처리 용량)이다. 두 에이전트의 경우 Shapley 가치는 상수 시간으로 계산 가능하다 — 근사가 필요 없다.

정확한 Shapley 가치 계산은 n명의 플레이어에 대해 NP-하드(에이전트 수에서 지수적)이다 [42]. 그러나 교환당 두 명 이상의 에이전트를 포함하는 다중 에이전트 상호작용은 드물다. 다자 상호작용(예: 다섯 에이전트 간의 그룹 채팅)의 경우, 분수 요인 설계를 사용한 빠른 근사 방법을 사용할 수 있다 [43].

Shapley 가치는 이미 귀속 문제에 대한 AI의 지배적인 접근 방식이다. SHAP(SHapley Additive exPlanations)는 모델 해석 가능성을 위해 이를 사용한다 [44]. ShapleyFL은 연합 학습에서 데이터 가치 평가를 위해 이를 사용한다 [45]. VerFedSV는 검증을 통해 이를 확장한다 [46]. CWEP는 동일한 프레임워크를 비용 귀속으로 확장한다.

핵(Nucleolus)(Schmeidler, 1969) [47]. 핵은 어떤 연합의 최대 불만족도를 최소화한다. 항상 유일하며, (핵이 비어 있지 않으면) 항상 코어 내에 있다. Shapley가 비례적 기여도를 통해 공정성을 극대화하는 것처럼, 핵은 불만 최소화를 통해 공정성을 극대화한다 — 어떤 에이전트도 다른 에이전트에 비해 특히 불공정하게 대우받고 있다고 주장할 수 없다.

에이전트 비용 할당의 경우, Shapley와 핵 사이의 선택은 시장 설계 결정을 인코딩한다:

CWEP는 양방향 상호작용에서 기본값으로 Shapley를 사용하며(두 해결책이 자주 일치하는 경우), 다자 시나리오에 대한 구성 가능한 대안으로 핵을 제공한다.

6.2 양방향 협상을 위한 Nash 협상

두 에이전트가 프로토콜에서 할당을 수용하는 대신 직접 비용 분담을 협상할 때 Nash 협상 이론이 적용된다 [11].

Nash 협상 해(Nash Bargaining Solution)는 불일치점(협상 실패 시의 결과) 이상의 효용 곱을 극대화한다. 네 가지 공리를 만족한다: 척도 불변성, 파레토 최적성, 무관한 대안으로부터의 독립성, 대칭성. 비대칭 Nash는 협상력 매개변수로 이를 확장한다 — 더 많은 대안이나 더 낮은 전환 비용을 가진 에이전트가 잉여의 더 큰 몫을 차지한다 [48].

Rubinstein의 교대 제안(1982) [49]은 Nash 협상을 동적으로 운용화한다. 공통 할인 계수 d에서 균형 분할은: 플레이어 1이 1/(1+d)를 얻고, 플레이어 2가 d/(1+d)를 얻는다. 합의는 첫 번째 라운드에서 달성된다(비용이 드는 지연 없음). 인내심이 증가함에 따라 분할이 50/50으로 수렴한다. 이는 토큰 예산 고갈로 인한 시간 압박이 있는 상호작용당 비용 분담을 협상하는 에이전트에 직접 적용된다.

CWEP의 경우, Nash 협상은 에이전트가 비대칭 협상 위치를 가질 때 계층 3(동적 정산)을 지배한다 — 서로 다른 외부 옵션, 서로 다른 긴급성, 서로 다른 모델 비용. 협상력 매개변수는 Agent Rating Protocol 점수 [21]에서 파생될 수 있다: 더 높은 평점의 에이전트는 외부 옵션(상호작용할 의향이 있는 다른 에이전트)이 더 많기 때문에 더 큰 협상력을 발휘한다.

6.3 불가능성 제약

근본적인 결과가 어떤 비용 할당 프로토콜이 달성할 수 있는지를 제한한다. Green-Laffont(1979)와 Moulin-Shenker(2001)는 세 가지 바람직한 속성이 어떤 비용 분담 메커니즘에서도 상호 호환되지 않음을 보였다 [12]:

  1. 인센티브 호환성 — 에이전트가 자신의 비용과 가치 평가를 진실하게 보고한다
  2. 예산 균형 — 총 지불액이 총 비용과 일치한다(시스템이 돈을 창출하지도 흡수하지도 않는다)
  3. 경제적 효율성 — 순 사회적 가치가 양인 모든 상호작용이 발생한다

어떤 프로토콜도 적어도 하나를 희생해야 한다. CWEP의 설계 선택:

이 절충에서 두 가지 실용적인 메커니즘 계열이 나온다:

6.4 인프라 유추: 교훈과 한계

세 가지 인프라 도메인이 유용하지만 제한적인 유사 사례를 제공한다.

인터넷 피어링. 80,000개 이상의 독립 네트워크가 트래픽 교환에 두 가지 모델을 사용한다: 정산 없는 피어링(양측이 자신의 비용을 부담하며, 트래픽이 대략 균형을 이룰 때 실행 가능)과 유료 통과(더 많이 보내는 측이 지불하며, 대략 2:1 트래픽 불균형에서 발생) [28]. 한국은 2016/2020년에 발신자 부담을 의무화했지만 결과가 좋지 않았다: 통과 비용이 급등하고, 일부 서비스에서 지연 시간이 4배 증가했으며, Meta가 서버를 홍콩으로 이전하고, 국내 스타트업이 불균형적인 비용을 부담했다. Internet Society는 이를 "모델이 아닌 경고"라고 결론지었다 [52]. BEREC은 "그러한 메커니즘이 정당화된다는 증거가 없다"고 판단했다 [53].

시사점: 에이전트 상호작용에 대한 순수한 요청자 부담은 유사하게 효과적인 요청을 위해 광범위한 컨텍스트가 필요한 에이전트에게 불이익을 줄 수 있다. 청구 유지(각 에이전트가 자신의 비용을 흡수)가 고빈도 저가치 상호작용에 더 효율적일 수 있다.

전력 LMP. FERC 명령 1920은 "수혜자 부담"과 "대략적 상응성" — 고객이 받은 혜택과 대략 상응하는 비용을 지불하는 것을 의무화한다 [54]. LMP는 각 그리드 노드의 가격을 한계 에너지 비용(기본 추론 비용), 한계 혼잡 비용(피크 수요 중 속도 제한 프리미엄), 한계 손실 비용(통신 프로토콜의 오버헤드 토큰)으로 분해한다 [13].

시사점: CWEP의 컨텍스트 가격 책정 모델(섹션 9)은 세 가지 구성 요소 분해를 채택한다: 기본 토큰 비용, 혼잡 프리미엄(컨텍스트 사용률), 오버헤드 비용(프로토콜 프레이밍 토큰).

통신 상호 연결. 통신 산업은 발신망 부담(CPNP, 요청자 부담과 유사)과 청구 유지(B&K, 각 네트워크가 자신의 비용을 흡수) 중 어느 것이 적합한지에 대해 수십 년간 논쟁했다. FCC의 2026년 "전 IP 미래" 규칙 제정은 3년에 걸쳐 연간 33%씩 남은 접속 요금을 줄이는 미국의 청구 유지 전환 완료를 제안한다 [29].

시사점: 통신 산업의 CPNP에서 B&K로의 수십 년간의 전환은 고빈도 상호작용에서 요청자 부담이 비효율적일 수 있음을 시사한다. 각 상호작용을 측정하고 정산하는 거래 비용이 정산 금액을 초과할 수 있어, 저비용 상호작용에 대해 청구 유지가 합리적인 기본값이 된다.

클라우드 FinOps. 비용 할당은 FinOps 실무자들에게 워크로드 최적화에 이어 두 번째 우선순위(30%)다 [55]. 58%의 조직이 쇼백/차지백 모델을 구현했지만, 클라우드 산업은 10년간 비용 귀속 인프라를 구축하면서도 여전히 이를 두 번째로 어려운 문제로 꼽는다 [55]. FOCUS 사양 v1.3은 공급자 전반의 비용 할당을 표준화한다 [6].

시사점: 에이전트 비용 할당은 새로운 측정 기준을 발명하는 대신 FOCUS를 기반으로 구축해야 한다. CWEP의 측정 형식은 에이전트별 필드로 FOCUS를 확장한다.


7. 프로토콜 사양: 토큰 미터링

7.1 미터링 레코드 형식

모든 에이전트 상호작용은 네 가지 토큰 흐름을 캡처하는 CWEP 미터링 레코드(CMR)를 생성한다. CMR은 에이전트별 필드로 FinOps FOCUS 사양 [6]을 확장한다.

{
  "cwep_version": "1.0.0",
  "interaction_id": "uuid-v4",
  "timestamp": "ISO-8601",
  "requestor": {
    "agent_id": "did:example:agent-a",
    "model": "claude-sonnet-4-6",
    "provider": "anthropic",
    "pricing": {
      "input_rate_per_mtok": 3.00,
      "output_rate_per_mtok": 15.00,
      "cache_hit_rate_per_mtok": 0.30,
      "currency": "USD"
    }
  },
  "responder": {
    "agent_id": "did:example:agent-b",
    "model": "claude-opus-4-6",
    "provider": "anthropic",
    "pricing": {
      "input_rate_per_mtok": 5.00,
      "output_rate_per_mtok": 25.00,
      "cache_hit_rate_per_mtok": 0.50,
      "currency": "USD"
    }
  },
  "flows": {
    "request_output": { "tokens": 10000, "cached_tokens": 0, "cost_usd": 0.150 },
    "request_input": { "tokens": 10000, "cached_tokens": 3000, "cost_usd": 0.036 },
    "response_output": { "tokens": 3000, "cached_tokens": 0, "cost_usd": 0.075 },
    "response_input": { "tokens": 3000, "cached_tokens": 0, "cost_usd": 0.009 }
  },
  "totals": {
    "total_tokens": 26000, "total_cost_usd": 0.270,
    "requestor_incurred_usd": 0.159, "responder_incurred_usd": 0.111
  },
  "context_state": {
    "responder_utilization_pre": 0.35,
    "responder_utilization_post": 0.40,
    "responder_window_size": 1000000
  },
  "coc_chain_ref": "sha256:abc123...",
  "settlement": null
}

7.2 미터링 통합

CWEP 미터링은 에이전트가 새로운 토큰 집계를 구현하도록 요구하지 않는다 — 기존 관측성 인프라에서 데이터를 소비한다:

7.3 미터링 오버헤드

CMR 자체도 자원을 소비한다 — JSON 직렬화, 저장, 잠재적 전송. CWEP는 미터링 오버헤드를 제한한다:


8. 프로토콜 사양: 양방향 정산

8.1 정산 계층

CWEP는 각각 서로 다른 상호작용 프로파일에 적합한 세 가지 정산 계층을 정의한다.

계층 1: 정산 없음 (미터링만)

각 에이전트가 자신의 추론 비용을 흡수한다. CMR은 관측성을 위해 생성되지만 에이전트 간 지불이 발생하지 않는다. 이것이 기본 모드이며 다음과 같은 경우에 적합한 선택이다:

이것은 인터넷 상호 연결의 정산 없는 피어링 [28]과 통신의 청구 유지 모델 [29]을 반영한다. 내부 에이전트 플릿(예: AB Support 플릿)의 경우, 계층 1은 에이전트 간 정산의 오버헤드 없이 비용 가시성을 제공한다.

계층 2: 규칙 기반 정산

에이전트의 서비스 계약(ASA [20])에 내장된 수식에 따라 비용을 분담하는 정적 할당 규칙. 일반적인 규칙:

규칙수식적용 시기
요청자 부담R이 100% 지불서비스 마켓플레이스 (B가 서비스, A가 고객인 경우)
응답자 부담B가 100% 지불잠재 고객 유치 (B가 A의 요청을 원하는 경우)
균등 분담각각 50% 지불동료 협업
비례 분담각각 소비된 토큰에 비례하여 지불범용
수혜자 부담각각 수취한 가치에 비례하여 지불ASA 조건이 있는 복잡한 상호작용

계층 2 규칙은 각 에이전트의 CWEP 엔진에 의해 로컬에서 평가된다. 상호작용 시점에 협상이 발생하지 않는다 — 규칙은 서비스 계약이 수립될 때 합의된 것이다. 이것은 계산적으로 사소하며 상호작용에 지연 시간을 전혀 추가하지 않는다.

계층 3: 동적 정산

CWEP 정산 엔진을 사용하는 실시간 비용 할당. 엔진은 상호작용 특성을 기반으로 할당 방법을 선택한다:

IF interaction is cooperative (shared goal, symmetric benefit):
    Use Shapley value allocation
ELSE IF interaction is competitive (one-sided benefit):
    Use asymmetric Nash bargaining
ELSE IF interaction involves >2 agents:
    Use approximate Shapley with sampling
ELSE:
    Fall back to Tier 2 proportional split

동적 정산은 두 에이전트 모두 CWEP 정산 엔진을 구현하고 상호작용 중 비용 메타데이터를 교환해야 한다. 정산 계산은 최소한의 지연 시간을 추가한다(< 1ms for two-agent Shapley) — 그러나 상호작용 매개변수에 대한 합의가 필요하다.

8.2 Shapley 가치 정산

두 에이전트 상호작용의 경우, Shapley 기반 정산은 각 에이전트의 지불액을 다음과 같이 계산한다:

standalone_cost(A) = RO  (A generates request, no response comes back)
standalone_cost(B) = 0   (B does nothing without a request)
joint_cost(A,B) = RO + RI + SO + SI

shapley_payment(A) = [joint_cost + standalone_cost(A) - standalone_cost(B)] / 2
                   = [RO + RI + SO + SI + RO - 0] / 2
                   = [2*RO + RI + SO + SI] / 2
                   = RO + (RI + SO + SI) / 2

shapley_payment(B) = [joint_cost + standalone_cost(B) - standalone_cost(A)] / 2
                   = [RO + RI + SO + SI + 0 - RO] / 2
                   = (RI + SO + SI) / 2

해석: 요청자는 자신의 요청 생성 비용 더하기 나머지 모든 비용의 절반을 지불한다. 응답자는 나머지 비용의 절반을 지불한다. 이것은 요청자가 상호작용을 개시했으므로 더 큰 비중을 부담해야 하지만 응답자도 참여를 선택했으며 이는 양방향 결정이라는 경제적 현실을 반영한다.

섹션 4.1의 코드 리뷰 예시(Sonnet 4.6)의 경우:

요청자 부담($0.234 / $0.00) 및 균등 분담($0.117 / $0.117)과 비교해보라. Shapley 할당은 요청자가 상호작용을 개시하여 더 많은 비용을 부담하지만, 응답자의 처리 비용은 부분적으로 공유된다는 직관을 포착한다.

standalone_cost(B) = 0에 관한 참고사항. 이 공식화는 응답자의 독립 비용이 제로라고 가정한다 — 가용성 유지(모델 워밍, 컨텍스트 윈도우 용량 예약, 가동 시간 유지)의 인프라 비용을 고려하지 않는다. 응답자의 고정 비용이 상당한 배포에서는 standalone_cost(B) 항을 예상 상호작용에 걸쳐 분할된 응답자의 기간당 인프라 비용으로 설정할 수 있다. 예를 들어 에이전트 B의 고정 인프라 비용이 예상 상호작용 기간당 $0.02라면 Shapley 할당이 변경된다:

standalone_cost(B) = 0.02
shapley_payment(A) = [joint_cost + standalone_cost(A) - standalone_cost(B)] / 2
                   = [$0.234 + $0.150 - $0.02] / 2 = $0.182
shapley_payment(B) = [joint_cost + standalone_cost(B) - standalone_cost(A)] / 2
                   = [$0.234 + $0.02 - $0.150] / 2 = $0.052

standalone_cost(B) > 0으로 설정하면 B의 실제 가용성 비용을 반영하여 할당이 더 균등한 분담 쪽으로 이동한다. 제로 독립 단순화는 고정 비용이 무시할 만한 경량 에이전트에 적합하며; 전용 인프라를 유지하는 에이전트에 대해서는 재정의해야 한다.

8.3 Nash 협상 정산

에이전트가 비대칭 협상 위치를 가질 때, Nash 협상 해가 Shapley를 대체한다:

utility(A) = value_received(A) - payment(A)
utility(B) = value_received(B) - payment(B)

disagreement(A) = 0  (A gets nothing if no interaction)
disagreement(B) = 0  (B gets nothing if no interaction)

Nash solution maximizes:
    [utility(A) - disagreement(A)]^alpha x [utility(B) - disagreement(B)]^(1-alpha)

where alpha = bargaining_power(A), and alpha + (1-alpha) = 1

알파 협상력 매개변수는 다음에서 파생될 수 있다:

Nash 협상 정산은 두 에이전트가 자신의 가치 평가를 선언하도록 요구하며, 이는 인센티브 호환성 우려를 야기한다: 에이전트가 잉여를 차지하기 위해 가치를 낮게 보고할 수 있다. 정교한 에이전트는 협상 실패를 유발하지 않으면서 보고된 가치 평가를 하향 조정할 수 있어 — 긍정적인 ARP 점수를 유지하면서 잉여를 포획한다. ARP 평판은 심각한 잘못된 보고(협상 실패를 유발하는 경우)를 완화하지만 이러한 종류의 정교한 가치 조정은 완화하지 못한다. 양방향 설정에서 가치 선언에 대한 완전한 인센티브 호환성을 달성하는 메커니즘 설계는 경제학의 미해결 문제로, Green-Laffont 불가능성(섹션 6.3)이 여기에 직접 적용된다 [12]. v1.0의 경우, CWEP는 상당한 가치 잘못 보고가 시간이 지남에 따라 최적이 아닌 매칭을 생성하는 경향이 있다는 실용적인 관찰(가치를 낮게 보고하는 에이전트는 AMP [19]를 통해 더 낮은 품질의 상대방을 받음)에 의존하며, 이는 개별 사례가 아닌 집계에서 감지 가능하다. 양방향 가치 보고에서의 완전한 인센티브 호환성은 향후 프로토콜 버전의 미해결 연구 문제로 남는다.

8.4 정산 프로토콜

정산 핸드쉐이크는 상호작용이 완료된 후 발생한다:

1. Both agents generate CMRs independently
2. Agents exchange CMRs (or a hash digest for privacy)
3. Each agent's CWEP engine computes the settlement proposal
4. If proposals agree (within tolerance): settlement is accepted
5. If proposals disagree: dispute resolution via AJP [17]
6. Settlement amount is recorded in both agents' CMRs
7. Payment is triggered via the configured payment rail

제안 합의에 대한 허용 임계값은 설정 가능하다(기본값: 총 상호작용 비용의 5%). 이 임계값을 초과하는 불일치는 비용 분쟁으로 기록되며 Agent Justice Protocol의 분쟁 해결 모듈을 통해 에스컬레이션될 수 있다.

8.5 사례 연구: AB Support 플릿 상호작용 비용

AB Support 플릿 — 코디네이터(Alex), 리서치 에이전트(Bravo), 심층 분석가(Charlie), 개발자(Delta), 콘텐츠 검토자(Editor), 다국어 번역가(Translator)로 구성된 프로덕션 다중 에이전트 시스템 — 은 CWEP 비용 할당을 위한 경험적 데이터를 제공한다. 다음 대표적인 상호작용은 실제 플릿 운영에서 도출되며, 토큰 수와 비용은 실제 상호작용 패턴에서 계산된다.

상호작용요청자응답자RO 토큰RI 토큰SO 토큰SI 토큰총비용 (Sonnet)
리서치 과제 발송AlexBravo2,5002,500500500$0.053
지식 파일 QA 검토AlexCharlie15,00015,0008,0008,000$0.565
코드 빌드 요청AlexDelta5,0005,00012,00012,000$0.435
백서 검토AlexEditor20,00020,0006,0006,000$0.690
번역 요청AlexTranslator12,00012,00014,00014,000$0.600
교차 도메인 종합CharlieCharlie (자체)50,00050,00015,00015,000$1.575
리서치 조사 + 보고서BravoBravo (자체)3,0003,00025,00025,000$0.843

Shapley 할당 분석. 현행 암묵적 모델(청구 유지, 각 에이전트의 운영자가 자신의 비용을 흡수)에서 코디네이터(Alex)는 다른 에이전트가 처리하는 큰 과제 프롬프트를 생성하기 때문에 불균형적으로 높은 비용을 부담한다. 지식 파일 QA 검토 상호작용의 경우:

24시간 운영 사이클에서 플릿은 총 500K~800K 토큰, $8~15 비용의 약 30~50건의 에이전트 간 상호작용을 생성한다. Shapley 재할당은 현행 청구 유지 배분에서 약 $2~4를 이동시킬 것이다 — 내부 플릿에서는 크지 않은 절대 금액이지만, 이 패턴은 프로토콜의 작동 메커니즘을 보여준다. 수백 개의 에이전트를 보유한 교차 운영자 플릿의 경우, 동일한 할당 논리가 의미 있는 정산 금액으로 확대된다.

핵심 관찰: 플릿의 가장 비용이 높은 상호작용은 가장 빈번한 것(과제 발송, 각 ~$0.05)이 아니라 심층 분석 과제($0.50~1.50 각)다. CWEP의 정산 임계값(기본값 $0.01)은 고빈도 저비용 발송을 올바르게 필터링하면서 검토 및 종합 상호작용의 상당한 양방향 비용을 포착한다. 확장 파일럿 배포를 통한 경험적 검증은 v1.1에서 계획되어 있다.


9. 프로토콜 사양: 컨텍스트 가격 책정

9.1 세 가지 구성 요소 모델

CWEP의 컨텍스트 가격 책정 모델은 전력 시장의 위치 한계 가격(Locational Marginal Pricing) [13]에서 영감을 받아 토큰의 유효 가격을 세 가지 구성 요소로 분해한다:

구성 요소 1: 기본 토큰 비용 (BTC)

사용 중인 모델에 대한 공급자의 공표된 토큰당 요금. 이것이 기본 가격 — 컨텍스트가 혼잡하지 않고 상호작용이 짧을 때의 비용이다.

BTC = provider_rate(model, token_type) x token_count

여기서 token_type ∈ {input, output, cached_input}이며 요금은 공급자 가격 페이지에서 가져온다 [1][30][32].

구성 요소 2: 혼잡 프리미엄 (CP)

응답자의 현재 컨텍스트 사용률을 반영하는 승수. 에이전트의 컨텍스트 윈도우가 거의 꽉 찼을 때, 남은 용량의 한계 가치가 증가한다. 혼잡 프리미엄은 이 희소성에 가격을 책정한다.

CP = BTC x congestion_multiplier(utilization)

congestion_multiplier(u) = {
    1.0           if u < 0.50
    1.0 + 0.5u    if 0.50 <= u < 0.80
    1.0 + 2.0u    if 0.80 <= u < 0.95
    1.0 + 5.0u    if u >= 0.95
}

95% 사용률에서 혼잡 프리미엄은 기본 비용의 5.75배다. 이것은 공격적이지만 의도적이다 — 에이전트의 남은 컨텍스트 용량이 극히 희소하므로 고부가가치 상호작용을 위해 예약해야 한다는 신호를 보낸다. 단계 함수는 연속 함수보다 구현이 간단하며 각 임계값에서 명확한 가격 신호를 제공한다.

구성 요소 3: 프로토콜 오버헤드 (PO)

CWEP 자체 프레이밍 비용 — 미터링 메타데이터, 정산 헤더, 프로토콜 협상 토큰. 이것이 전력망 가격 책정의 "전송 손실" 유사 개념이다.

PO = overhead_tokens x provider_rate(model, input)

CWEP는 상호작용당 500토큰 미만의 프로토콜 오버헤드를 목표로 한다(일반적인 500K 토큰 컨텍스트의 약 0.1%). 오버헤드는 요청 비용의 일부로 요청자가 부담한다.

유효 토큰 가격:

effective_price = BTC + CP + PO

9.2 위치 의존 가격 책정 (제안된 확장)

트랜스포머 어텐션의 이차적 스케일링은 컨텍스트 윈도우의 서로 다른 위치에 있는 토큰이 서로 다른 계산 비용을 부과한다는 것을 의미한다. 위치 10,000의 토큰은 위치 900,000의 토큰보다 처리 비용이 적다 — 후자의 어텐션 계산은 90배 더 많은 쌍대 계산을 포함한다.

CWEP는 위치 의존 가격 책정 확장을 제안하지만 v1.0에서는 요구하지 않는다:

position_multiplier(pos, window_size) = (pos / window_size)^beta

여기서 베타는 조정 매개변수(제안 범위: 0.1~0.5)이고 pos는 컨텍스트 윈도우에서 토큰의 절대 위치다. 베타 = 0.3에서:

이 확장이 실험적으로 표시된 이유:

  1. 현재 어떤 공급자도 위치 의존 가격 책정을 노출하지 않는다
  2. 실제 계산 비용 곡선은 공급자에 따라 다른 구현 세부사항(Flash Attention, ring attention 등)에 의존한다
  3. 베타 매개변수는 실제 추론 비용에 대한 경험적 보정이 필요하다

위치 의존 가격 책정은 컨텍스트 윈도우가 1M+ 토큰으로 성장함에 따라 중요해진다. 1M 윈도우의 처음 100K 토큰 내의 상호작용에서는 위치 효과가 무시할 만하며 안전하게 무시할 수 있다.

9.3 동적 요금 발견

CWEP 에이전트는 정산을 계산하기 위해 상대방 가격을 알아야 한다. 요금을 하드코딩하는 대신 CWEP는 요금 발견 프로토콜을 명시한다:

1. Agent publishes its current pricing in its A2A Agent Card [57]
   (extension field: cwep_pricing)
2. Before interaction, requestor queries responder's CWEP pricing
3. Responder returns current rates including congestion premium
4. Both agents cache counterparty rates for the interaction duration
5. Rates are locked for the interaction (no mid-interaction repricing)

요금 잠금은 상호작용 중 가격 조작을 방지한다. 에이전트는 요청을 확인한 후 정산에서 더 많이 추출하기 위해 요금을 부풀릴 수 없다. 요금은 상호작용 사이에 업데이트되며, 상호작용 중에는 업데이트되지 않는다.


10. 프로토콜 사양: 서비스 품질 계층

10.1 요청 기반 속도 제한의 실패

전통적인 속도 제한은 초당 요청 수를 집계한다. 단일 요청이 다른 요청보다 100배 더 많은 컴퓨팅 비용이 들 수 있기 때문에 에이전트 상호작용에서는 이것이 실패한다 [58]. 100,000토큰 요청 하나를 보내는 에이전트는 1,000토큰 요청 100개를 보내는 에이전트와 동일한 인프라 비용을 부과하지만, 전자는 1 req/s 속도 제한을 통과하는 반면 후자는 제한된다.

Gartner는 2026년까지 AI/LLM 도구로 인해 API 수요 증가의 30% 이상이 발생할 것으로 예측한다 [58]. 속도 제한은 요청 집계에서 토큰 예산화로 진화해야 한다.

10.2 토큰 예산 속도 제한

CWEP는 요청 수가 아닌 토큰 예산으로 속도 제한을 정의한다:

{
  "qos_tier": "standard",
  "limits": {
    "input_tokens_per_minute": 1000000,
    "output_tokens_per_minute": 200000,
    "concurrent_interactions": 10,
    "max_request_size_tokens": 500000,
    "max_context_utilization": 0.80
  }
}

max_context_utilization 제한은 새로운 것이다: 단일 상호작용이 에이전트 컨텍스트 윈도우의 지정된 비율 이상을 소비하는 것을 방지한다. 이것은 다른 상호작용을 위한 에이전트의 용량을 보호한다.

10.3 우선 처리 계층

CWEP는 에이전트가 알리고 요청자가 선택할 수 있는 네 가지 QoS 계층을 정의한다:

계층토큰 요금혼잡 우선순위사용 사례
이코노미기본 요금최하 (혼잡 시 대기열)배치, 비동기, 긴급하지 않음
스탠더드기본 요금일반 (FIFO)기본 상호작용
우선 처리기본 요금의 2배높음 (이코노미 선점)시간 민감한 과제
예약기본 요금의 3배 + 용량 보유보장 (사전 할당 용량)SLA 계약 상호작용

우선 처리 계층은 혼잡 프리미엄 메커니즘을 통해 구현된다: 더 높은 계층의 요청은 더 높은 혼잡 승수를 지불하며, 응답자는 이를 처리 순서의 우선순위 결정에 사용한다. 프리미엄은 자의적이지 않다 — 용량 예약 유지 및 다른 작업 선점의 실제 비용을 반영한다.

예약 계층에는 용량 보유가 포함된다: 요청자는 지정된 기간 동안 응답자 컨텍스트 윈도우의 일부를 예약하는 비용을 지불한다. 이것은 사전 약정이 보장된 가용성을 얻는 클라우드 컴퓨팅의 예약 인스턴스 가격 책정과 유사하다. 용량 보유 수수료는 상호작용당 비용과 별개이며 Agent Service Agreement [20]에 명시된다.

10.4 역압 신호

에이전트가 용량 한계에 접근할 때, 조용히 저하되거나 실패하는 대신 요청자에게 역압 신호를 보내야 한다. CWEP는 역압 신호를 정의한다:

{
  "cwep_status": "congested",
  "current_utilization": 0.87,
  "estimated_queue_time_ms": 3500,
  "available_tiers": ["priority", "reserved"],
  "economy_queue_depth": 14
}

역압 신호를 수신한 요청자는:

이것은 희소한 컨텍스트 윈도우 용량에 대한 시장 메커니즘을 생성한다: 수요가 공급을 초과하면 가격이 상승하여(혼잡 프리미엄을 통해) 요청자에게 더 많이 지불하거나 수요를 줄이라는 신호를 보낸다.


11. 프로토콜 사양: 스팸 방지

11.1 컨텍스트 윈도우 공격 표면

에이전트의 컨텍스트 윈도우는 적대자가 소비할 수 있는 유한 자원이다. 가장 단순한 공격: 에이전트에게 컨텍스트 윈도우를 채우는 크고 가치 없는 요청 시리즈를 전송하여 합법적인 상호작용을 방지한다. 이것은 패킷이 아닌 토큰으로 측정되는 서비스 거부 공격이다.

대역폭과 패킷 필터링으로 완화되는 네트워크 수준 DDoS와 달리, 컨텍스트 윈도우 DoS는 경제적 메커니즘으로만 완화된다 — 에이전트의 컨텍스트를 낭비하는 데 비용이 들게 만든다. CWEP는 세 가지 방어 메커니즘을 제공한다.

11.2 요청 보증금

요청을 전송하기 전에, 요청자는 응답자에게 환불 가능한 토큰 보증금을 예치한다:

deposit_amount = estimated_request_tokens x responder_input_rate x deposit_multiplier

deposit_multiplier(기본값: 1.5x)는 응답자가 설정하고 A2A 에이전트 카드 [57]에 공개된다. 보증금은 응답자의 이해 비용 더하기 마진을 커버한다.

보증금 생명주기:

  1. 요청자가 보증금 예치(결제 채널 또는 에스크로에 잠금)
  2. 요청자가 요청 전송
  3. 응답자가 요청 처리
  4. 응답자가 가치 평가 반환: 유용함(보증금이 실제 처리 비용을 제하고 환불) 또는 스팸(보증금 몰수)
  5. 요청자가 스팸 분류에 이의를 제기할 경우 AJP [17]를 통한 분쟁 해결

보증금 메커니즘은 스팸을 비싸게 만든다. Opus 4.6 에이전트에게 요청당 100K 토큰 보증금으로 1,000개의 스팸 요청을 보내면 몰수된 보증금에서 $750의 비용이 발생한다 — 자동화된 스팸을 저지하기에 충분하며 보증금이 환불되는 합법적인 상호작용에는 무시할 만한 마찰을 부과한다.

11.3 평판 가중 접근

더 높은 ARP 평판 점수를 가진 에이전트는 우선 접근을 받는다 [21]:

이것은 확립된 에이전트가 마찰 없이 상호작용하는 반면 알 수 없는 에이전트는 컨텍스트 윈도우 공간을 소비하기 전에 지불 의향을 증명해야 하는 단계적 신뢰 시스템을 만든다. 시간이 지남에 따라 신규 에이전트가 생산적인 상호작용을 통해 평판을 쌓으면 접근 비용이 감소한다 — 좋은 행동에 대한 자연스러운 유인이다.

신규 에이전트 부트스트래핑. 위의 보증금 및 평판 요구 사항은 알 수 없는 상대방과의 계층 3(동적 정산) 상호작용에만 적용된다. 결제 레일 접근이나 평판 이력 없는 신규 에이전트는 보증금이 필요 없는 계층 1(정산 없음) 또는 계층 2(규칙 기반) 모드를 통해 즉시 참여할 수 있다. 이것은 모든 에이전트가 첫날부터 상호작용을 시작하고, 평판을 쌓고, 가치를 증명할 수 있음을 의미한다 — 보증금 메커니즘은 신뢰할 수 없는 상대방과의 가장 복잡한 정산 계층만을 차단한다.

또한, 운영자는 공유 보증금 계좌를 제공하여 에이전트를 보증할 수 있다. 다섯 개의 에이전트를 배포하는 운영자는 단일 보증금 풀로 모두를 지원할 수 있어 에이전트당 온보딩 마찰을 줄인다. 운영자의 보증금이 5x 신규 에이전트 승수를 집합적으로 커버하며, 개별 에이전트가 평판을 쌓음에 따라 독립적으로 더 낮은 보증금 계층으로 졸업한다. 이것은 개별 사용자를 위한 신뢰 앵커를 조직 계정이 제공하는 클라우드 서비스의 기업 온보딩과 유사하다.

확립된 플릿에 에이전트가 합류하는 일반적인 경우(예: 운영자의 기존 다중 에이전트 시스템에 합류하는 신규 전문 에이전트), 플릿의 집단 평판 및 공유 보증금 계좌는 신규 에이전트가 추가 온보딩 마찰에 직면하지 않음을 의미한다 — 즉시 운영자의 신뢰 수준을 상속받고 상호작용을 통해 자신의 개별 평판을 쌓는다.

11.4 점진적 요청 크기 조정

컨텍스트 침수 공격을 방지하기 위해 CWEP는 알 수 없는 에이전트와의 상호작용에 대한 점진적 요청 크기 조정을 지원한다:

max_request_tokens(reputation, interaction_count) = {
    1000    if reputation < 20 AND interactions < 5
    10000   if reputation < 40 AND interactions < 20
    100000  if reputation < 60 AND interactions < 100
    unlimited    otherwise
}

신규 에이전트는 1,000토큰 최대 요청 크기로 시작한다 — 과제를 설명하기에 충분하지만 컨텍스트를 침수시키기에는 충분하지 않다. 평판과 상호작용 이력을 쌓으면서 제한이 완화된다. 이것은 인간 상거래에서의 점진적 신뢰 구축(대형 계약 전 소규모 주문)과 유사하지만 프로토콜 수준에서 집행된다.


12. 경제 전략으로서의 프롬프트 최적화

12.1 비용 절감으로서의 압축

프롬프트 압축은 단순한 기술적 최적화가 아니라 측정 가능한 ROI를 가진 경제적 결정이다. LLMLingua는 최소한의 성능 손실로 최대 20배의 프롬프트 압축을 달성한다 [16] — 문서화된 벤치마크에서 2,365토큰이 211토큰으로 압축된다(11.2배). 규모에서 절감액은 상당하다: 일일 10,000건의 대화 워크로드에서 60%의 컨텍스트 압축은 연간 $153,000를 절감한다 [2].

CWEP는 압축을 양방향 정산 프레임워크 내의 비용 절감 전략으로 형식화한다:

compression_savings = (uncompressed_tokens - compressed_tokens) x input_rate
compression_cost = tokens_consumed_by_compressor x compressor_output_rate
net_savings = compression_savings - compression_cost
compression_roi = net_savings / compression_cost

요청자는 정산에 비용 분담이 포함될 때 압축하는 직접적인 경제적 유인을 가진다: 더 짧은 요청은 Shapley와 비례 할당 모두에서 요청자의 비중을 줄인다. 양방향 정산 없이(순수 요청자 부담 또는 청구 유지), 요청자의 압축 유인은 자신의 출력 비용에만 의존한다.

12.2 상각 비용으로서의 캐싱

프롬프트 캐싱은 반복적인 컨텍스트 비용을 90% 줄인다(캐시 히트는 기본 입력 가격의 0.1배) [1]. Anthropic은 5분 및 1시간 TTL 옵션으로 명시적 캐시 제어를 제공하며; OpenAI는 자동으로 캐싱을 활성화하고; Google은 별도의 저장 비용을 청구한다 [30].

반복적인 에이전트 상호작용(예: 동일한 코드 저장소를 시간마다 확인하는 모니터링 에이전트)의 경우, 캐싱은 변동 비용을 거의 고정 비용으로 전환한다:

first_interaction_cost = full_context_tokens x input_rate x cache_write_multiplier
subsequent_cost = full_context_tokens x input_rate x 0.10
amortized_cost_per_interaction(n) = (first_cost + (n-1) x subsequent_cost) / n

Claude Sonnet 4.6 캐싱으로 n=10 상호작용의 경우:

CWEP의 정산 엔진은 상호작용 빈도와 캐시 TTL을 기반으로 캐싱 전략을 권장할 수 있다.

12.3 경제적 결정으로서의 메모리 대 장문 컨텍스트

외부 메모리에 정보를 저장하는 것과 컨텍스트에 보관하는 것 사이의 선택은 정량적 교차점이 있는 경제적 절충이다 [18]:

메모리 시스템(Mem0 [37], Zep [38], Letta [39], xMemory [59])은 쓰기 비용을 선불로 지불하지만 상호작용당 변동 비용을 줄인다. 장문 컨텍스트 접근법은 각 상호작용과 함께 변동 비용을 선형적으로 확대한다. CWEP의 최적화 자문은 예상 상호작용 패턴을 기반으로 적절한 전략을 권장할 수 있다.

xMemory(King College London / Alan Turing Institute)는 잠재력을 보여준다: 불확실성 게이트 검색이 있는 4단계 의미론적 계층 구조는 정확도를 향상시키면서 토큰 사용량을 28~48% 줄인다 [59]. GPT-5 nano를 사용하면 쿼리당 토큰이 9,155에서 6,581로 감소한다 — 상호작용당 측정 가능한 경제적 절감.

12.4 컨텍스트 윈도우 보험으로서의 RAG

검색 증강 생성(RAG)을 통해 에이전트는 대용량 지식 베이스를 외부에 저장하고 컨텍스트에 관련 부분만 검색할 수 있다. CWEP 관점에서 RAG는 컨텍스트 윈도우 보험이다: 에이전트는 상호작용당 소액의 검색 비용을 지불하여 전체 지식 베이스를 컨텍스트에 보관하는 훨씬 더 큰 비용을 피한다.

지식 집약적 에이전트에게 경제학은 명확하다: 500,000토큰의 도메인 지식을 가진 에이전트는 모두 보관하기 위해 1M 토큰 컨텍스트 윈도우의 절반을 소비할 것이다. RAG를 통해 에이전트는 상호작용당 관련 10,000토큰만 검색하여 490,000토큰의 컨텍스트 용량을 실제 작업을 위해 확보할 수 있다. 검색 비용(벡터 검색 + 검색 토큰)은 전체 컨텍스트 비용보다 수 자릿수 적다.


13. 소액 결제 통합

13.1 결제 레일 옵션

CWEP 정산 금액은 일반적으로 상호작용당 $0.001에서 $1.00 범위다. 이를 위해 소액 결제 인프라가 필요하다. 2026년 3월 현재 적합한 네 가지 결제 레일이 있다:

x402 (Coinbase/Cloudflare Foundation) [3]. 402 상태 코드를 사용하는 HTTP 네이티브 소액 결제. Base, Polygon, Solana에서 스테이블코인으로 결제. 최소 결제 $0.001, 1초 이내 정산. Coinbase 퍼실리테이터 수수료: 월 1,000건 무료, 이후 거래당 $0.001 [3]. 현재 일일 거래량 약 $28,000이며, CoinDesk는 많은 활동이 실제 상거래보다 테스트를 반영한다고 언급 [60].

Machine Payments Protocol (MPP) (Stripe/Tempo) [4]. 2026년 3월 18일 출시. 결제 방법 무관(스테이블코인, 카드, 비트코인 라이트닝). 예치금-잔액 세션 모델로 100ms 이하 지연 시간과 요청당 거의 제로에 가까운 수수료 달성. 표준화를 위한 IETF 제출. x402와 하위 호환 [4]. 이미 OpenAI, Anthropic, Google Gemini를 포함한 50개 이상의 서비스에 구현.

L402 (Lightning Labs) [23]. HTTP 402와 라이트닝 네트워크 소액 결제 및 마카룬 기반 인증을 결합. 마카룬은 위임 및 권한 범위를 지원한다 — 에이전트는 자금을 인출할 수 없는 "지불만" 마카룬을 받을 수 있다. LND 원격 서명 아키텍처는 에이전트가 직접 개인 키에 접근하지 않도록 보장한다 [23]. LangChainL402 및 LangChainBitcoin을 통한 LangChain 통합이 존재한다 [23].

Superfluid [24]. 돈이 초당 연속으로 흐르는 실시간 토큰 스트리밍. Superfluid를 통해 $15억 이상이 스트리밍되었으며; 100만 개 이상의 고유 지갑. Base의 ERC-8004 Agent Pool이 에이전트를 연속 스트림에 연결한다 [24]. 메시지당이 아닌 연속적으로 정산이 흘러야 하는 지속적인 에이전트 대화에 이상적이다.

13.2 CWEP 결제 추상화

CWEP는 사용할 결제 레일을 명시하지 않는다. 대신 어떤 결제 레일도 구현할 수 있는 정산 인터페이스를 정의한다:

class CWEPSettlement:
    def commit_deposit(self, amount_usd: float, escrow_id: str) -> bool
    def release_deposit(self, escrow_id: str, to_agent: str) -> bool
    def forfeit_deposit(self, escrow_id: str) -> bool
    def settle(self, from_agent: str, to_agent: str, amount_usd: float,
               interaction_id: str) -> SettlementReceipt
    def stream_open(self, from_agent: str, to_agent: str,
                    rate_usd_per_second: float) -> StreamHandle
    def stream_close(self, handle: StreamHandle) -> SettlementReceipt

stream_open/stream_close 메서드는 지속적인 대화를 위한 Superfluid 스타일 연속 정산을 지원한다. commit_deposit/release_deposit/forfeit_deposit 메서드는 스팸 방지 메커니즘을 지원한다. settle 메서드는 상호작용당 일회성 정산을 지원한다.

13.3 정산 배치 처리

동일한 에이전트 쌍 간의 고빈도 상호작용에서 상호작용당 정산은 비효율적이다. CWEP는 정산 배치 처리를 지원한다:

Accumulate CMRs over configurable window (default: 1 hour or $1.00 net, whichever first)
Compute net settlement across all interactions in the window
Execute single payment for the net amount

에이전트 A가 50번의 상호작용에서 에이전트 B에게 $0.15 를 빚지고 에이전트 B가 30번의 상호작용에서 에이전트 A에게 $0.08을 빚진다면, 순 정산은 A에서 B로의 단일 $0.07 지불이다. 이것은 거래 수수료를 80배 줄이며 지속적인 양방향 관계를 가진 에이전트에게 권장되는 모드다.


14. 컨텍스트 예약 및 미래 시장 방향

14.1 예약 메커니즘

에이전트의 컨텍스트 윈도우는 유한한 용량을 가진다. 각 수신 요청은 일부를 소비한다. 에이전트가 바쁜 경우(높은 사용률), 남은 용량은 더 가치 있다. 보장된 접근을 원하는 요청자는 용량 예약을 위해 기꺼이 비용을 지불해야 한다. CWEP v1.0은 용량 관리를 위한 구체적이고 구현 가능한 메커니즘으로 양방향 컨텍스트 예약을 명시한다.

{
  "reservation": {
    "requestor": "did:example:agent-a",
    "responder": "did:example:agent-b",
    "capacity_tokens": 100000,
    "duration_seconds": 3600,
    "price_usd": 0.50,
    "qos_tier": "reserved",
    "auto_renew": true
  }
}

예약은 에이전트 B의 컨텍스트 윈도우 100,000토큰이 한 시간 동안 에이전트 A의 독점 사용을 위해 사용 가능하다는 것을 보장한다. 에이전트 B는 QoS 계층의 지연 시간 보장 내에서 예약된 용량까지 에이전트 A의 모든 요청을 처리하도록 약속한다. 에이전트 B가 예약을 이행하지 않으면 예약 수수료가 환불되며 AJP [17]를 통해 분쟁을 제기할 수 있다.

14.2 현물 가격 대 예약 가격

두 가지 가격 책정 모델이 공존한다:

최적 전략은 상호작용 예측 가능성에 따라 달라진다:

이것은 컨텍스트 윈도우 공간에 맞게 조정된 클라우드 컴퓨팅에서의 예약 인스턴스 대 온디맨드 대 스팟 인스턴스의 절충과 정확히 동일하다.

14.3 미래 방향: 컨텍스트 시장

위의 양방향 예약 메커니즘은 잠재적인 미래 컨텍스트 시장을 향한 구성 요소다 — 에이전트가 가격 발견 및 주문 매칭을 통해 실시간으로 컨텍스트 용량을 자율적으로 거래하는 메커니즘. 그러한 시장은 표준화된 용량 단위(기간당 토큰), 에이전트 네트워크 전반의 실시간 가격 신호, 충분한 유동성(많은 에이전트가 매수 및 매도), 시장 조성자 또는 거래소 인프라를 필요로 할 것이다. 이것은 발전기가 배포되지 않더라도 용량 유지 비용을 지불받는 전력망의 용량 시장과 구조적으로 유사하다 [13].

이 인프라는 오늘날 존재하지 않는다. 예약 메커니즘은 현재 에이전트 경제 요구에 충분하며; 완전한 컨텍스트 시장은 에이전트 간 상호작용 볼륨이 양방향 협상이 병목이 되는 수준에 도달할 때 관련성이 높아진다. 컨텍스트 시장 개발에 대한 추가 논의는 섹션 20.1을 참조하라.


15. 신뢰 생태계 통합

15.1 프로토콜 스택에서의 CWEP

CWEP는 Agent Matchmaking Protocol [19]과 함께 AB Support 신뢰 생태계의 레이어 4(시장/경제)에 위치한다. 다음에 의존한다:

CWEP는 다음에 데이터를 제공한다:

15.2 프로토콜 간 데이터 흐름

출발도착데이터목적
CWEP → CoCCMR 해시비용 레코드에 대한 출처 증명 앵커링
CWEP → ARP상호작용 비용 데이터평판 신호로서의 경제적 행동
CWEP → ASA정산 금액계약의 비용 조건 집행
CWEP → AJP증거로서의 CMR비용 분쟁 해결
CWEP → AMP비용 추정비용 효율성으로 에이전트 매칭
CoC → CWEP체인 검증상호작용 신뢰성 검증
ARP → CWEP평판 점수협상력, 보증금 수준 알림
ASA → CWEP비용 할당 규칙정산 계층 및 방법 결정

15.3 생태계 피드백 루프

두 개의 피드백 루프가 CWEP 생태계를 안정화한다:

긍정 피드백(선순환): 에이전트가 좋은 서비스 제공 → 높은 ARP 평점 → 상대방이 요구하는 더 낮은 보증금 → 더 많은 상호작용 → 긍정 평점을 얻을 더 많은 기회.

부정 피드백(교정 순환): 에이전트가 스팸 전송/컨텍스트 낭비 → 보증금 몰수 → 낮은 ARP 평점 → 더 높은 보증금 요구 → 더 적은 상호작용 → 에이전트가 행동을 개선하거나 시장에서 퇴출.

이 루프들은 프로토콜 스택 상호작용의 창발적 속성이다 — 어떤 단일 프로토콜도 이를 생성하지 않지만, CWEP + ARP가 함께 이를 생성한다.


16. 생물학적 유추

두 가지 생물학적 유사 사례가 특정 CWEP 설계 결정에 영향을 주었다. 우리는 이를 장식적 은유로서가 아니라 프로토콜 선택을 형성했기 때문에 포함한다.

16.1 토큰 통화로서의 ATP → 결제 레일 독립성

아데노신 삼인산(ATP)은 지구상 모든 생물체의 보편적 에너지 통화 역할을 한다 [61]. 핵심 설계 교훈: ATP의 힘은 특정 화학이 아닌 보편적 수용성에서 나온다. 근육 수축에서 DNA 복제까지 모든 세포 과정은 에너지를 생산한 에너지원에 관계없이 ATP를 사용한다. 이것이 CWEP의 결제 레일 독립성(섹션 3.3)에 직접적인 동기를 부여했다: 프로토콜은 어떤 결제 레일도 정산할 수 있는 보편적 단위(USD/토큰)로 비용 할당을 명시한다. ATP가 에너지가 포도당, 지방, 또는 햇빛에서 왔는지에 관계없이 에너지 거래를 표시하는 것처럼. 특정 결제 레일을 요구하는 프로토콜은 하나의 대사 경로에서만 에너지를 받는 세포만큼 취약할 것이다.

16.2 블랙 퀸 가설 → 특화 경제학

블랙 퀸 가설 [62]은 파트너가 그 자원을 신뢰할 수 있게 제공할 때 미생물이 비용이 많이 드는 기능에 대한 유전자를 잃는다는 것을 보여준다. 이것은 단순히 에이전트 특화와 유사한 것이 아니라 — CWEP의 비용 가시성이 가속화하도록 설계된 메커니즘이다. CWEP가 "구매 대 구축" 계산을 명시적으로 만들 때(과제를 외주화하는 CWEP 비용 대 내부적으로 수행하는 추론 비용), 에이전트는 합리적인 특화 결정을 내릴 수 있다. 상호작용당 $0.23에 코드 리뷰를 외주화할 수 있는 에이전트(섹션 4.1)는 상호작용당 $0.39의 비용으로 자체 코드 리뷰 능력을 유지할 경제적 이유가 없다. CWEP의 미터링 데이터가 신호를 제공하고; 블랙 퀸 역학이 결과를 예측한다: 에이전트는 외주화가 더 저렴한 능력을 버릴 것이며, 이는 생태계 특화를 이끈다.

16.3 한계

이러한 유추는 형식적 모델이 아닌 설명적인 것이다. 두 가지 중요한 차이점이 그 적용 가능성을 제한한다: (1) 에이전트는 거의 제로 비용으로 복제될 수 있어 생물학적 유사 사례가 없는 시빌 문제를 만든다 — CWEP는 생물학적 면역 메커니즘 대신 평판 게이트 접근(섹션 11.3)을 통해 이를 해결한다; (2) 에이전트 비용 구조는 이산적이고 투명하다(API 응답을 통해 정확하게 측정 가능)하여 생물학적 유사 사례가 없는 비용 할당 메커니즘(Shapley, Nash)을 가능하게 한다.


17. 보안 분석

17.1 위협 모델

CWEP는 에이전트가 적대적일 수 있는 환경에서 작동한다. 위협 모델은 다음을 고려한다:

위협설명CWEP 방어
컨텍스트 침수컨텍스트 윈도우를 고갈시키기 위해 크고 가치 없는 요청 전송보증금 메커니즘(섹션 11.2), 점진적 요청 크기 조정(섹션 11.4)
비용 부풀리기더 높은 정산을 추출하기 위해 모델 계층 또는 토큰 수를 허위 보고공급자 API 응답에 대한 CMR 검증; CoC 앵커된 감사 추적
정산 조작Nash 협상에서 허위 가치 평가 보고협상 결과의 ARP 평판 추적; AJP를 통한 분쟁 에스컬레이션
요금 게임응답 비용을 부풀리기 위해 요청 수신 후 비싼 모델로 전환상호작용당 요금 잠금(섹션 9.3); ASA의 사전 합의된 모델 계층
무임승차보증금 없이 컨텍스트 윈도우 공간 소비평판 가중 접근 게이트(섹션 11.3); 알 수 없는 에이전트에게는 최대 보증금
시빌 공격평판 게이트를 우회하기 위해 많은 신원 생성CoC 체인 검증 — 신규 에이전트는 짧은 체인을 보유하여 초기 낮은 평판 획득

17.2 보증금 보안

보증금 메커니즘은 예치된 자금이 응답자에 의해 일방적으로 압수될 수 없도록 요구한다. 이것은 결제 레일을 통해 집행된다:

모든 경우에서 요청자는 AJP [17]를 통해 스팸 분류에 이의를 제기할 수 있으며, 보증금은 해결될 때까지 보류된다.

17.3 개인정보 보호 고려 사항

CMR에는 민감한 정보가 포함된다: 어떤 에이전트가 상호작용하는지, 어떤 모델을 사용하는지, 가격 구조가 무엇인지, 얼마를 지불하는지. CWEP는 다음을 통해 개인정보를 처리한다:


18. 한계 및 불가능성 결과

18.1 근본적 한계

1. 불가능성 절충은 실재한다. CWEP는 예산 균형과 인센티브 호환성을 위해 경제적 효율성을 희생한다(섹션 6.3). 비용 할당이 한쪽에게 이익이 되지 않게 만들기 때문에 일부 상호 이익이 되는 상호작용은 발생하지 않을 것이다. 우리는 이것이 배포 가능한 프로토콜을 위한 올바른 절충이라고 믿지만, 이것은 CWEP가 총 경제적 복지를 극대화하지 못한다는 것을 의미한다.

2. 가치 측정은 어렵다. Shapley와 Nash 정산 메커니즘은 각 에이전트가 상호작용에서 받는 "가치"를 측정하도록 요구한다. 실제로 가치는 주관적이고 맥락 의존적이며 사후에야 알려지는 경우가 많다. CWEP는 관측 가능한 대리 지표(토큰 수, 모델 계층, ASA 품질 평가)를 통해 가치를 근사하지만 상호작용의 전체 경제적 가치를 포착할 수 없다.

3. 이차적 비용 스케일링은 근사치다. 현대 어텐션 구현(Flash Attention, ring attention, 슬라이딩 윈도우 어텐션)은 O(n^2) 비용 프로파일을 수정한다. 실제 계산 비용 곡선은 공급자별, 모델별로 다르며 소프트웨어 업데이트와 함께 변경될 수 있다. CWEP의 위치 의존 가격 책정(섹션 9.2)은 그에 따라 실험적으로 표시된다.

4. 가격 하락은 장기 계약을 복잡하게 만든다. 추론 비용은 연간 약 10배 하락하고 있다 [27]. 오늘 협상된 비용 할당 규칙은 6개월 후에 크게 잘못될 수 있다. CWEP의 정산 금액은 현재 가격을 사용하여 실시간으로 계산되지만, CWEP를 참조하는 ASA 비용 조건에는 정기적인 재협상 조항이 포함되어야 한다.

18.2 범위 한계

1. 공급자 간 비용 표준화 없음. 동일한 오픈 소스 모델에 대한 공급자 가격이 10배까지 다르다 [64]. CWEP는 정산을 위해 각 에이전트의 실제 공급자 가격을 사용하며, 이는 동일한 상호작용이 에이전트가 사용하는 공급자에 따라 다른 비용이 든다는 것을 의미한다. 공급자와 무관한 표준화된 "토큰 비용 단위"는 정산을 단순화하겠지만 존재하지 않는다.

2. 추론 모델 정규화 없음. 추론 모델(o3 [32], DeepSeek R1 [65])은 과제당 훨씬 더 많은 토큰을 생성한다 — 극단적인 경우 두 단어를 생성하기 위해 600개 이상의 토큰 [14]. CWEP는 출력에 나타날 수도 있고 나타나지 않을 수도 있는 내부 추론 토큰을 포함하여 모든 토큰을 동등하게 집계한다. 이것은 추론 집약적 상호작용에서 요청자에게 과도하게 청구한다.

3. 오프라인 에이전트 지원 없음. CWEP는 실시간 또는 거의 실시간 상호작용을 가정한다. 비동기, 저장 후 전달 에이전트 상호작용(요청이 몇 시간 동안 대기열에 있는 경우)은 v1.0에서 명시되지 않은 정산 프로토콜 확장이 필요하다.


19. 참조 구현

19.1 아키텍처

CWEP 참조 구현은 다음을 제공한다:

19.2 최소 통합

가장 단순한 CWEP 통합(계층 1: 미터링만)은 LLM API 호출을 cwep-meter 라이브러리로 래핑하는 것을 필요로 한다:

from cwep import Meter

meter = Meter(agent_id="did:example:my-agent")

# Wrap existing LLM call
response = meter.track(
    llm_client.chat(messages=[...]),
    counterparty="did:example:other-agent",
    interaction_id="uuid-v4"
)

# CMR is automatically emitted to local storage
# response.cwep contains metering data
print(response.cwep.total_cost_usd)

19.3 완전 통합

완전한 CWEP 통합(계층 3: 동적 정산)은 정산 엔진을 필요로 한다:

from cwep import Meter, SettlementEngine, NashBargaining

meter = Meter(agent_id="did:example:my-agent")
engine = SettlementEngine(
    method=NashBargaining(
        bargaining_power=0.6,  # Derived from ARP score
        disagreement_value=0.0
    ),
    settlement_threshold_usd=0.01,
    payment_rail="mpp"
)

# Track interaction
response = meter.track(llm_client.chat(...), ...)

# Compute and execute settlement
proposal = engine.propose(response.cwep.cmr)
if proposal.amount_usd > engine.threshold:
    receipt = engine.settle(proposal)

19.4 패키지

pip install context-window-economics

Apache 2.0 하에 PyPI 및 GitHub(vibeagentmaking/context-window-economics)에 공개.


20. 향후 연구

20.1 컨텍스트 시장

CWEP v1.0은 양방향 컨텍스트 예약을 명시한다(섹션 14). 향후 버전은 에이전트가 가격 발견, 주문 매칭, 정산을 통해 실시간으로 용량을 자율적으로 거래하는 다자 컨텍스트 시장을 탐구해야 한다 — 진정한 마켓플레이스. 이를 위해 표준화된 용량 단위(기간당 토큰), 에이전트 네트워크 전반의 실시간 가격 신호, 충분한 유동성(많은 에이전트가 매수 및 매도), 시장 조성자 또는 거래소 인프라가 필요하다. 발전기가 배포되지 않더라도 용량 유지 비용을 지불받는 전력 용량 시장 [13]이 가장 가까운 아키텍처 템플릿을 제공한다. 완전한 컨텍스트 시장은 에이전트 간 상호작용 볼륨이 양방향 협상이 병목이 되는 수준에 도달할 때 관련성이 높아진다.

20.2 교차 체인 정산 최적화

서로 다른 블록체인 네트워크 전반의 실시간 비용 분담은 정산 지연 시간 제약을 도입한다. 향후 연구는 어떤 레일이 상호작용 수준 정산(< 1초)을 지원하고 어떤 것이 배치 정산(시간별)을 지원하는지 결정하기 위해 x402(Base, Polygon, Solana) [3], MPP(Tempo 네트워크) [4], L402(Lightning) [23] 전반의 정산 지연 시간을 벤치마크해야 한다.

20.3 추론 비용 선물

추론 비용이 연간 10배씩 예측 가능하게 하락한다면 [27], 에이전트는 선도 계약을 통해 미래 비용을 헤지할 수 있다 — 미래 상호작용을 위한 현재 토큰 요금을 잠근다. 이것은 상품 선물과 유사한 추론 비용 선물 시장을 만든다. 이를 위한 인프라는 존재하지 않지만 경제 논리는 타당하다.

20.4 의미론적 가치 측정

CWEP v1.0은 토큰 수와 모델 계층을 통해 상호작용 가치를 근사한다. 진정한 가치 측정은 상호작용의 의미론적 내용을 평가하도록 요구할 것이다 — 현재 기술로는 해결할 수 없다고 신뢰 생태계 아키텍처에서 잠재적으로 식별된 의미론적 무결성 검증 문제와 경계를 이루는 근본적으로 더 어려운 문제 [66].

20.5 규제 및 법적 프레임워크

자율 에이전트 금융 거래는 법적 회색 영역에서 운영된다. 에이전트 A가 에이전트 B에게 컨텍스트 처리 비용을 지불할 때, 법적 상대방은 누구인가? 에이전트, 에이전트의 운영자, 또는 LLM 공급자? 자율 에이전트 상거래에 대한 규제 프레임워크는 아직 초기 단계다; EU AI 법은 에이전트 행동을 다루지만 에이전트 경제는 다루지 않는다. CWEP의 향후 버전은 등장하는 법적 준수 요구 사항을 통합해야 한다.


21. 결론

컨텍스트 윈도우는 에이전트 경제에서 가장 희소한 자원이다. 유한하고, 비싸고, 비용에서 비선형적이며, 현재 가격이 책정되지 않는다. 모든 에이전트 상호작용이 이를 소비하지만; 어떤 프로토콜도 비용을 할당하지 않는다.

CWEP는 여섯 가지 메커니즘으로 이를 해결한다: 미터링(네 가지 비용 흐름 모두 측정), 양방향 정산(협력적 상호작용에는 Shapley, 경쟁적 상호작용에는 Nash), 컨텍스트 가격 책정(이차적 어텐션 스케일링을 반영하는 위치 의존 비용), QoS 계층(토큰 예산 속도 제한 및 우선 처리), 스팸 방지(평판 게이팅을 갖춘 보증금 기반 필터링), 최적화 경제학(압축, 캐싱, 메모리, RAG에 대한 형식적 ROI 모델).

프로토콜은 할 수 없는 것에 대해 솔직하다. Green-Laffont/Moulin-Shenker 불가능성 결과는 완전한 비용 할당이 달성 불가능하다는 것을 의미한다 — CWEP는 예산 균형과 인센티브 호환성을 위해 일부 경제적 효율성을 희생한다. 가치 측정은 근사치다. 이차적 비용 스케일링은 실제 하드웨어 구현이 다양한 정도로 근사하는 이상화된 모델이다.

CWEP가 달성하는 것은 이전에 프레임워크가 전혀 없었던 문제에 대한 구조화된 프레임워크다. CWEP 이전에는 에이전트가 상호작용의 양방향 비용 구조에 대한 가시성 없이 자신의 비용을 흡수했다. CWEP 이후에는 모든 상호작용이 미터링되고, 모든 비용이 귀속 가능하며, 모든 할당이 Chain of Consciousness 출처 증명 시스템을 통해 감사 가능하다.

이것이 에이전트 경제가 필요로 하는 경제적 기반이다. 출처 증명(CoC), 평판(ARP), 계약(ASA), 책임(AJP), 수명주기(ALP), 매칭(AMP)은 제도적 인프라를 제공한다. CWEP는 경제적 인프라를 제공한다 — 에이전트가 상호 이해의 비용을 협상하고, 할당하고, 정산하는 메커니즘.

문제는 진정으로 새로운 것이다. 우리는 단순히 인간 상거래 모델을 에이전트 언어로 번역하지 않았다 — 우리는 근본적으로 새로운 경제적 원시 요소(이해의 비용)를 식별하고 이에 가격을 책정하기 위한 프로토콜을 구축했다. 에이전트 경제는 비용 구조에서 인간 경제와 유사하지 않을 것이다; CWEP는 유추를 통해 기대할 수 있는 경제가 아닌 실제로 등장하는 경제를 위해 설계되었다.


22. 참고문헌

[1] Anthropic. "Pricing." platform.claude.com. Accessed March 2026.

[2] Stevens Institute; Koombea. "Hidden Economics of AI Agents"; "LLM Cost Optimization." 2025.

[3] Coinbase. "Introducing x402." coinbase.com. May 2025. See also: Coinbase, "Welcome to x402," docs.cdp.coinbase.com, 2025.

[4] Stripe. "Introducing the Machine Payments Protocol." stripe.com/blog. March 18, 2026. See also: mpp.dev, Stripe MPP documentation, March 2026.

[5] Google. "Announcing AP2." cloud.google.com. September 2025. See also: Google, "A2A x402 Extension," cloud.google.com, 2025.

[6] FinOps Foundation. "FOCUS Specification v1.3." finops.org. Ratified December 5, 2025.

[7] Langfuse. "Token & Cost Tracking." langfuse.com. MIT License. 2025. See also: Langfuse, "Pricing Tiers for Accurate Model Cost Tracking," December 2025.

[8] BerriAI. "LiteLLM." GitHub. 2025. See also: LiteLLM, "Agent (A2A) Gateway with agent cost tracking," docs.litellm.ai, 2025.

[9] Portkey. "Tracking LLM Token Usage Across Providers, Teams and Workloads." portkey.ai. 2025.

[10] Shapley, L. S. "Notes on the n-Person Game — II: The Value of an n-Person Game." RAND Corporation, 1951. Published as: "A Value for n-Person Games," Contributions to the Theory of Games (H. W. Kuhn and A. W. Tucker, eds.), Annals of Mathematics Studies 28, Princeton University Press, 1953.

[11] Nash, J. "The Bargaining Problem." Econometrica 18(2), 1950.

[12] Green, J. and Laffont, J.-J. Incentives in Public Decision Making. North-Holland, 1979. See also: Moulin, H. and Shenker, S. "Strategyproof Sharing of Submodular Costs: Budget Balance versus Efficiency." Economic Theory 18(3), 2001.

[13] PCI Energy Solutions. "Understanding Locational Marginal Pricing (LMP)." 2025.

[14] iKangAI. "The LLM Cost Paradox: How Cheaper AI Models Are Breaking Budgets." 2025. See also: Holter, A. "AI Costs in 2025: Cheaper Tokens, Pricier Workflows." 2025.

[15] Zuplo. "Token-Based Rate Limiting for AI APIs." 2025. See also: TrueFoundry, Gartner Market Guide for AI Gateways, 2025.

[16] Kuldeep Paul. "Prompt Compression Techniques: LLMLingua." Medium, 2025.

[17] Agent Justice Protocol. AB Support LLC. 2026.

[18] arXiv:2603.04814. "Memory vs. Long-Context Cost Analysis." 2026.

[19] Agent Matchmaking Protocol. AB Support LLC. 2026.

[20] Agent Service Agreements Protocol. AB Support LLC. 2026.

[21] Agent Rating Protocol v2. AB Support LLC. 2026.

[22] Chain of Consciousness v3. AB Support LLC. 2026.

[23] Lightning Labs. "Lightning Agent Tools." February 12, 2026. See also: Bitcoin Magazine, Lightning Agent Tools coverage, February 2026.

[24] Superfluid. "ERC-8004 Agent Pool." superfluid.org. 2026. See also: Sablier Protocol, sablier.com, 2026.

[25] arXiv:2512.08296. "Towards a Science of Scaling Agent Systems." December 2025.

[26] MarkAICode. "LangGraph vs CrewAI: Multi-Agent Performance and Cost in Production 2026." 2026.

[27] a16z. "LLMflation: LLM Inference Cost." a16z.com. November 2024. See also: Epoch AI, "LLM Inference Price Trends," 2025.

[28] Internet Society. "Interconnection and Regulated Traffic Obligations." March 2025.

[29] FCC. "All-IP Future," WC Docket Nos. 25-311, Notice of Proposed Rulemaking. January 28, 2026.

[30] Google. "Gemini Developer API Pricing." ai.google.dev. Accessed March 2026.

[31] Maxim.ai. "Context Engineering for AI Agents: The 100:1 Input-Output Ratio." 2025.

[32] OpenAI. "Pricing." developers.openai.com. Accessed March 2026.

[33] Hardin, G. "The Tragedy of the Commons." Science 162(3859), 1968.

[34] Simon, H. A. "Designing Organizations for an Information-Rich World." Computers, Communications, and the Public Interest (M. Greenberger, ed.), Johns Hopkins Press, 1971.

[35] Anthropic. "Effective Context Engineering for AI Agents." 2025.

[36] Heitmayer, M. "Second Wave of Attention Economics." Interacting with Computers 37(1), 2024.

[37] Mem0. mem0.ai. 2025.

[38] Zep. zep.ai. 2025.

[39] Letta. letta.com. 2025.

[40] VentureBeat. "WEKA Augmented Memory Grid." 2025. See also: WEKA, "Token Warehousing," 2025.

[41] PCI Energy Solutions. "Negative LMP Events in SPP." 2025.

[42] Deng, X. and Papadimitriou, C. H. "On the Complexity of Cooperative Solution Concepts." Mathematics of Operations Research 19(2), 1994.

[43] Fast Approximation of Shapley Values Using Fractional Factorial Designs. Journal of the American Statistical Association (JASA), 2025.

[44] Lundberg, S. M. and Lee, S.-I. "A Unified Approach to Interpreting Model Predictions." NeurIPS, 2017.

[45] Wang, J. et al. "ShapleyFL: Robust Federated Learning Based on Shapley Value." KDD, 2023.

[46] VerFedSV. "Verified Federated Shapley Value." 2024.

[47] Schmeidler, D. "The Nucleolus of a Characteristic Function Game." SIAM Journal on Applied Mathematics 17(6), 1969.

[48] Kalai, E. "Nonsymmetric Nash Solutions and Replications of 2-Person Bargaining." International Journal of Game Theory 6(3), 1977.

[49] Rubinstein, A. "Perfect Equilibrium in a Bargaining Model." Econometrica 50(1), 1982.

[50] Moulin, H. "Incremental Cost Sharing: Characterization by Coalition Strategy-Proofness." Social Choice and Welfare 16(2), 1999.

[51] Vickrey, W. "Counterspeculation, Auctions, and Competitive Sealed Tenders." Journal of Finance 16(1), 1961. See also: Clarke, E. H. "Multipart Pricing of Public Goods." Public Choice 11(1), 1971; Groves, T. "Incentives in Teams." Econometrica 41(4), 1973.

[52] Internet Society. "South Korea Sender Pays Analysis." 2025.

[53] BEREC. "Preliminary Assessment of Payments from Large CAPs to ISPs." 2023.

[54] FERC. "Order 1920 Fact Sheet." May 13, 2024.

[55] State of FinOps Report. FinOps Foundation. 2025. See also: Datadog, container waste statistics, 2025.

[56] AG2. "Usage Tracking." docs.ag2.ai. 2025.

[57] Google. "A2A Agent Card Specification." 2025.

[58] Gartner. "Market Guide for AI Gateways." 2025. See also: TrueFoundry, Zuplo, 2025.

[59] VentureBeat. "xMemory: Four-Level Semantic Hierarchy." King College London / Alan Turing Institute. 2025.

[60] CoinDesk. "Coinbase-backed AI payments protocol wants to fix micropayment but demand is just not there yet." March 11, 2026.

[61] ScienceDirect. "Evolution of Energy Currencies: From ATP to Digital Money." October 2025.

[62] Mostafa, A. et al. "Biological Market Theory Applied to Microbial Communities." Microlife, 2024.

[63] PNAS. "Host-Symbiont Mutualisms and Employment Contract Theory." 2010.

[64] Introl. "Inference Unit Economics: True Cost Per Million Tokens Guide." 2025.

[65] DeepSeek. "DeepSeek R1 Pricing." deepseek.com. 2026.

[66] AB Support Trust Ecosystem Architecture. "Semantic Integrity Verification — Research Frontier." 2026.


Copyright 2026 AB Support LLC. Licensed under the Apache License, Version 2.0.

Chain of Consciousness anchor: Protocol whitepaper v1.0.0