احتمالاً برایتان پیش آمده که وسط یک مکالمه طولانی با کلاود هستید، دارید روی یک پروژه مهم کار میکنید، یا در کدنویسی با Claude Code، بعد از دو سه پرامپت ساده میبینید که سهمیه مصرف توکنهایتان بهشکل عجیبی خالی شده یا ناگهان محدودیت استفاده از کلاود به پایان میرسد و باید چندین ساعت منتظر بمانید تا بازنشانی شود.
اصلا نگران نباشید! مصرف توکن در Claude کاملاً قابل مدیریت است و با انجام چند راهکار ساده، میتوانید آن را کاهش دهید. این چکلیست را داشته باشید تا جلوتر مفصل درباره آنها توضیح بدهیم:
اگر کاربر معمولی Claude.ai هستید:
- مکالمهها را موضوعی نگه دارید.
- فایلهای غیرضروری را وارد context نکنید.
- از Projects برای کارهای مستمر استفاده کنید.
- دستورالعملهای ثابت را یکبار تعریف کنید.
- Promptهای دقیق و هدفمند بنویسید.
اگر با Claude Code کار میکنید:
- یک CLAUDE.md مختصر و کاربردی داشته باشید.
- با /context وضعیت context را بررسی کنید.
- بعد از پایان مراحل مهم از /compact استفاده کنید.
- برای پروژههای کاملاً متفاوت /clear را به کار ببرید.
- به جای Paste کردن فایلهای بزرگ، از ارجاع فایل استفاده کنید.
- ابزارها و MCPهای غیرضروری را مدیریت کنید.
و اگر توسعهدهنده Claude API هستید:
- Prompt Caching را برای contextهای تکراری بررسی کنید.
- بخش ثابت Prompt را از بخش متغیر جدا کنید.
- context را قبل از ارسال فیلتر و خلاصه کنید.
- مدل را بر اساس پیچیدگی task انتخاب کنید.
- برای پردازشهای غیرلحظهای، سراغ معماریهای batch بروید.
توکن Claude چیست؟
مدلهای زبانی هوش مصنوعی، متن را مثل ما آدمها کلمه به کلمه نمیخوانند؛ بلکه آن را به بخشهای کوچکتری به نام توکن تقسیم میکنند و بر اساس آنها، پردازش متن را انجام میدهند. پس منظور از توکن (Token) واحدی برای اندازهگیری مقدار متنی است که AI دریافت یا تولید میکند.
مثلاً جمله: «امروز هوا خیلی گرم است» برای من و شما یک جمله ۵ کلمهای است، ولی ممکن است مدلهای زبانی برای پردازش این جمله، آن را به ۸ توکن (مثلاً) تبدیل کنند.
یک توکن لزوماً معادل یک کلمه نیست؛ ممکن است هر یک توکن، بخشی از یک کلمه، یک کلمه کوتاه، عدد یا حتی یک علامت نگارشی باشد. در کل تعداد دقیق توکنها به زبان، کلمات و نحوه تقسیم متن توسط مدل بستگی دارد.
چرا مدیریت مصرف توکن در کلاود مهم است؟
چتباتهای هوش مصنوعی از جمله کلاود، معمولاً هزینه و محدودیت استفاده از ابزار را بر اساس تعداد توکنها محاسبه میکنند. پس هرچه متن بیشتری به مدل بدهید یا پاسخهای طولانیتری دریافت کنید، توکن بیشتری مصرف میشود.
مصرف توکن هم معمولاً شامل دو بخش است:
- توکن ورودی (Input Tokens): متنی که به مدل ارسال میکنید؛ مثل پرامپت، فایلها، کدها و تاریخچه گفتوگو و زمینه پیام.
- توکن خروجی (Output Tokens): متنی که مدل در پاسخ به شما تولید میکند.
بنابراین اگر پرامپتی که به کلاود میدهید شامل دستورالعملهای طولانی و فایلهای متعدد باشد، حتی اگر تعداد کلماتی که نوشتهاید کم باشد، مصرف توکن را افزایش میدهد.
مثلاً وقتی از Claude میخواهید یک پروژه کدنویسی را بررسی کند، فقط اجرای این درخواست توکن مصرف نمیکند؛ بلکه مواردی مثل:
- کدهای فایلهایی که Claude میخواند،
- نتایج ابزارهایی که استفاده میکند،
- پیامهای قبلی گفتگو،
- دستورالعملهای پروژه،
همگی وارد کانتکست میشوند و روی مصرف توکن تأثیر میگذارند.
ارتباط توکن با Context Window چیست؟
هر مدل هوش مصنوعی یک ظرفیت مشخص برای نگهداری اطلاعات در هر سشن دارد که به آن Context Window گفته میشود.
برای مثال، اگر یک مدل ظرفیت ۲۰۰ هزار توکن داشته باشد، مجموع مواردی مثل پیامهای شما، پاسخهای مدل، فایلهای ضمیمهشده، خروجی ابزارها و غیره، نباید از این مقدار بیشتر شود.
هرچه این فضا سریعتر پر شود، مدل مجبور میشود اطلاعات قدیمیتر را کنار بگذارد یا مصرف توکن شما را افزایش دهد.
به همین دلیل، مدیریت مصرف توکنها اهمیت زیادی دارد؛ چون در یک مکالمه طولانی، اطلاعات قبلی میتواند همچنان بخشی از زمینهای باشد که مدل برای ادامه کار به آن نیاز دارد. بنابراین بررسی فایلهای زیاد، نگه داشتن گفتوگوهای طولانی، ارسال دوباره تاریخچه مکالمه و در کل طولانیتر شدن یک conversation میتواند پردازش بیشتری ایجاد کند و حجم کانتکست و مصرف توکن را افزایش دهد.
البته موضوع محدودیت توکنها را نباید با محدودیت استفاده Claude یکی دانست؛ محدودیتهای کلاود به پلن و شرایط استفاده شما هم وابستهاند.
چه چیزهایی مصرف توکن Claude را افزایش میدهند؟
اینها مهمترین عواملی هستند که باعث افزایش مصرف توکن در کلاود میشوند:
| عامل | تأثیر روی مصرف |
| مکالمه بسیار طولانی | افزایش حجم context |
| فایلهای بزرگ | ورود داده بیشتر به context |
| خروجیهای بسیار طولانی | افزایش Output Token |
| پرامپتهای تکراری | پردازش دوباره اطلاعات ثابت |
| استفاده از مدل نامتناسب | افزایش هزینه بدون ضرورت |
| ابزارهای متعدد | اضافه شدن تعریف و خروجی ابزارها |
| Extended Thinking برای کارهای ساده | افزایش پردازش موردنیاز |
| ارسال نتایج خام ابزارها | ورود داده غیرضروری به context |
بنابراین فقط با نوشتن پرامپتهای کوتاتر نمیتوانید مصرف توکن را در کلاود کاهش دهید؛ مهندسی context، انتخاب مدل و استفاده درست از قابلیتهایی مثل Prompt Caching اهمیت بسیار بیشتری دارند.
| ⭐ محتوای مرتبط: 10 نکته درباره کار با هوش مصنوعی Claude که باید بدانید |
چطور مصرف توکن را در Claude کاهش دهیم؟
اگر از نسخه وب یا اپلیکیشن Claude برای تولید محتوا، تحقیق، ترجمه، تحلیل یا کارهای روزمره استفاده میکنید، با این راهکارها میتوانید مصرف توکن را مدیریت کنید:
۱. برای پروژههای ثابت از Projects استفاده کنید
اگر برای مدت طولانی و بهصورت مکرر روی یک پروژه یا موضوع مشخص کار میکنید، بهتر است بهجای اینکه هربار چت جدیدی بسازید و فایلهای مرجع و ثابتی را آپلود کنید، از قابلیت Projects کلاود استفاده کنید.
برای مثال فرض کنید در حال تولید محتوای یک وبسایت هستید و دائماً با فایلها و اطلاعاتی مثل راهنمای لحن برند، اطلاعات محصولات، پرسونای مخاطب، تقویم محتوایی، مستندات فنی و… سروکار دارید.
آپلود کردن مکرر این اطلاعات در هر مکالمه، روش مناسبی برای مدیریت context نیست و توکنهایتان را هدر میدهد.
با ایجاد یک پروژه میتوانید اطلاعات ثابت موردنیاز آن پروژه را نگه دارید و گفتوگوهای مرتبط را حول همان پروژه سازماندهی کنید.
۲. اطلاعات ثابت را یکبار تعریف کنید
اگر در ابتدای هر مکالمه با کلاود یکسری اطلاعات ثابت مثل اینکه:
- من تولیدکننده محتوا هستم،
- مخاطب من متخصصان حوزه فناوری هستند،
- لحن باید رسمی و ساده باشد،
- از عبارتهای کلیشهای استفاده نکن،
- و…
را تکرار میکنید، توکنهایتان را زودتر مصرف میکنید! بهتر است این مدل اطلاعات ثابت و عمومیتر را یکبار در قالب دستورالعملهای ثابت تنظیم کنید و در اختیار کلاود قرار دهید؛ نه اینکه در هر درخواست از نو آنها را بنویسید.
این کار علاوه بر کاهش مصرف توکن، باعث میشود پاسخهای Claude هم مفیدتر شوند.
۳. برای هر موضوع یک مکالمه جدا داشته باشید
یکی از اشتباهات رایجی که کاها رتکب میشویم، این است که در یک مکالمه یا چت، همه کارهایمان را انجام میدهیم؛ یعنی یک چت باز میکنیم و کارهایی مثل ترجمه، تولید مقاله، کدنویسی، تحقیق، ایمیل و غیره را در همان چت پیش میبریم.
با طولانی شدن این مکالمه، context پر از اطلاعاتی میشود که برای درخواست فعلی هیچ کاربردی ندارند و فقط باعث مصرف بیشتر توکن میشوند.
برای همین بهتر است مکالمهها را بر اساس موضوع جدا کنید و اگر موضوع کار عوض شده و اطلاعات قبلی دیگر کاربردی ندارند، یک مکالمه جدید بسازید. مثلاً:
- پروژه تولید محتوا
- پروژه برنامهنویسی
- تحقیق بازار
- ترجمه
- ایدهپردازی
۴. بهجای ارسال کل فایل، فقط بخش موردنیاز را بدهید
خیلی وقتها یک فایلهای متنی بزرگ (مثلاً یک داکیومنت ۱۰۰ صفحهای) دارید، اما فقط درباره جدول موجود در صفحه ۴۵ این فایل سوال دارید؛ در این مواقع لازم نیست کل داکیومنت را وارد context کنید.
هرچه context تمیزتر باشد، کلاود هم برای پیدا کردن اطلاعات موردنیاز زحمت کمتری میکشد و توکنهایتان کمتر خرج میشوند.
پس اگر امکانش وجود دارد، بهجای اینکه کل گزارشهای طولانی، کدهای حجیم و PDFهای بزرگ را به کلاود بدهید، فقط اطلاعات مرتبط را در اختیار آن قرار دهید.
۵. پرامپت کوتاه کافی نیست، دقیق بنویسید
شاید تصور کنید پرامپت هرچه کوتاهتر باشد، کلاود توکنهای کمتری برای پردازش و اجرای آن مصرف میکند؛ ولی اینطور نیست!
مثال میزنم تا بهتر متوجه شوید. فرض کنید یه تکه متن به کلاود میدهید و فقط میگویید: «این متن را بهتر کن.»
این درخواست کوتاه است، اما دقیق و شفاف و روشن منظورتان را نمیرساند؛ برای همین Claude مجبور میشود خودش حدس بزند شما دقیقا چه میخواهید و همین عملکردن بر اساس حدس و گمان احتمال تولید توضیحات اضافه را بیشتر میکند و باعث مصرف بیشتر توکن میشود.
در مقابل، اگر همین درخواست را به این شکل بیان کنید: «پاراگراف دوم را برای مدیران شرکتهای SaaS بازنویسی کن. لحن رسمی باشد، مفهوم اصلی تغییر نکند و متن حداکثر ۱۲۰ کلمه باشد.»، درست است که پرامپت طولانیتر است، اما هدف آن دقیق و واضح مشخص شده، کلاود کمتر بیراهه میرود، کانتکستهای غیرضروری کمتری ایجاد و توکنهای کمتری خرج میشود.
پس بهجای Prompt Minimization، بهتر است Context Optimization را اجرا کنید.
اگر از کلاود برای کدنویسی استفاده میکنید، راهکارهای تخصصیتر را در بخش بعدی دنبال کنید.
چطور مصرف توکن در Claude Code را کاهش دهیم؟
Claude Code برای برنامهنویسی طراحی شده و میتواند با فایلهای پروژه، ابزارها، دستورات ترمینال و ساختار کد کار کند.
در چنین محیطی، مدیریت context اهمیت بسیار بیشتری پیدا میکند؛ چون علاوه بر پیامهای شما، فایلها و نتایج ابزارها هم میتوانند وارد جریان کاری شوند و مصرف توکن را بالا ببرند.
برای مدیریت مصرف توکن در کلاود کد این راهکارها را پیشنهاد میدهیم:
۶. برای پروژه CLAUDE.md بسازید
یکی از مهمترین روشهای مدیریت context در Claude Code، استفاده از فایل CLAUDE.md است.
در این فایل میتوانید اطلاعاتی مانند موارد زیر را وارد کنید:
- ساختار پروژه
- تکنولوژیهای مورد استفاده
- قوانین کدنویسی
- دستورات تست
- نحوه اجرای پروژه
- محدودیتهای مهم
- استانداردهای نامگذاری
برای مثال این نمونه را ببینید:
# Project Instructions
– Use TypeScript.
– Run tests with npm test.
– Use ESLint before committing.
– Do not modify generated files.
– Keep API logic inside src/services.
اینطوری بهجای اینکه در هر پرامپت بنویسید «این پروژه با TypeScript است و تستها با npm test اجرا میشوند»، این اطلاعات یکبار به عنوان دستورالعمل پروژه ثبت و نگهداری میشوند و کلاود در مواقع مورد نیاز به همان رجوع میکند.
Anthropic هم CLAUDE.md را بهعنوان روشی برای ارائه context و دستورالعملهای پروژه به Claude Code معرفی میکند.
البته لازم است این را هم بگوییم که CLAUDE.md را بیش از حد بزرگ نکنید؛ CLAUDE.md نباید تبدیل به یک کتاب مستندات چندهزار کلمهای شود.
فقط اطلاعاتی را در آن قرار دهید که:
- واقعاً برای بیشتر کارهای پروژه لازم هستند؛
- ثابتاند؛
- و Claude باید مرتباً آنها را بداند.
مستندات طولانی، نمونهکدهای غیرضروری و اطلاعاتی که معمولاً لازم میشوند، بهتر است در فایلهای جداگانه قرار بگیرند.
۷. با /context وضعیت کانتکست را بررسی کنید
اگر از Claude Code استفاده میکنید، باید بدانید چه چیزی در context فعلی قرار دارد و آن را پر کرده است.
برای بررسی وضعیت context سشن میتوانید از دستور /context استفاده کنید
با اجرای این دستور میتوانید بفهمید چه اطلاعاتی در سشن باقی مانده و آیا حجم context بهدلیل فایلها، ابزارها یا تاریخچه مکالمه بیش از حد بزرگ شده است یا نه.
۸. از /compact در زمان مناسب استفاده کنید
وقتی یک سشن در کلاود طولانی میشود، لازم نیست همه مراحل را در همان سشن ادامه دهید. در Claude Code میتوانید از دستور /compact برای فشردهسازی context استفاده کنید.
بهترین زمان استفاده از آن معمولاً بعد از تمام شدن یک مرحله مشخص از پروژه است. مثلاً وقتی:
- معماری مشخص شد،
- فایلهای اصلی ساخته شدند،
- تستها اجرا شدند،
- باگها رفع شدند،
- و حالا میخواهید وارد مرحله بعد شوید.
در چنین نقطهای، خلاصهسازی context میتواند جایگزین مناسبی برای ادامه دادن یک سشن با تاریخچه خیلی طولانی باشد.
۹. وقتی موضوع تمام شد، /clear را فراموش نکنید
اگر پروژه یا task قبلی تمام شده است و میخواهید سراغ موضوعی کاملاً متفاوت بروید، ادامه همان session لزوماً انتخاب خوبی نیست.
برای مثال اگر پروژه قبلی ساخت داشبورد React و پروژه جدید توسعه افزونه WordPress است، دیگر اطلاعات پروژه قبلی در پروژه جدید لازم نیست و context قبلی فقط باعث شلوغی و از دست رفتن توکنهای بیشتر میشود.
در چنین شرایطی میتوانید دستور /clear را امتحان کنید.
۱۰. بهجای Paste کردن فایلهای بزرگ، از ارجاع فایل استفاده کنید
یکی از اشتباهات رایج در Claude Code این است که کل یک فایل بزرگ (مثلاً یک فایل ۲۰۰۰ خطی) را داخل پرامپت کپی کنید.
بهتر است اگر فقط یک تابع مشخص مشکل دارد یا درباره آن سوال دارید، کلاود را به همان فایل یا بخش موردنظر هدایت کنید.
در Claude Code میتوانید از ارجاع فایل مثل @src/components/dashboard.tsx استفاده کنید.
این رویکرد مخصوصاً در پروژههای بزرگ اهمیت دارد؛ چون هدف شما باید این باشد که Claude دقیقاً همان کانتکستی را دریافت کند که برای انجام task لازم است.
۱۱. ابزارها و MCPهای غیرضروری را غیرفعال کنید
هر ابزاری مثل GitHub، دیتابیس، سیستم فایل، سرویسهای داخلی، ابزارهای جستوجو یا ابزارهای مدیریت پروژه که به Claude متصل میکنید، میتواند اطلاعات بیشتری وارد Context کند.
حتی اگر Claude از یک ابزار استفاده نکند، تعریف و Schema آن میتواند بخشی از فضای Context را اشغال کند. بنابراین هرچه ابزارهای بیشتری به کلاود متصل باشند، بخشی از ظرفیت Context صرف نگهداری اطلاعات مربوط به همین ابزارها میشود.
به همین دلیل، بهتر است فقط ابزارهایی را که واقعاً برای تسک فعلی نیاز دارید فعال نگه دارید و ابزارهای غیرضروری را غیرفعال کنید.
این کار باعث میشود فضای بیشتری از Context برای خودِ کار اصلی باقی بماند و مصرف توکن هم بهتر مدیریت شود.
در workflowهایی که از ابزارهای مختلف استفاده میکنند، نحوه قرارگیری و Cache شدن ابزارها در Context هم میتواند روی میزان مصرف توکن تأثیر بگذارد.
۱۲. برای هر کار از قویترین مدل استفاده نکنید
یکی از سادهترین راهها برای کاهش مصرف توکن در کلاود، انتخاب مدل مناسب برای انجام هر تسک است. کلاود مدلها و نسخههای متنوعی دارد که هر کدام برای تسکهای مختلفی کاربرد دارند.
مثلاً مدل sonnet 5 بیشتر برای کارهای روزمره و سبک استفاده میشود، یا مدل haiku 4.5 به درد سوال و جوابهای سریع میخورد، یا مثلاً مدل opus 5 معمولاً برای کارهای پیچیدهتر مثل تحلیلهای عمیق مورد استفاده قرار میگیرد.
پس لازم نیست برای همه کارها از مدلهای قوی یا پرو استفاده کنید.
مثلاً برای یک کار ساده، مثل تغییر نام یک متغیر، استفاده از سنگینترین مدل موجود اصلا منطقی نیست.
از طرف دیگر، اگر برای یک مسئله پیچیده از مدل بیشازحد ضعیف استفاده کنید، ممکن است نتیجه مطلوبی نگیرید و مجبور شوید چند بار درخواست خود را تکرار کنید. در این حالت، صرفهجویی اولیه ممکن است در نهایت از بین برود.
بنابراین هدف این نیست که هزینه هر درخواست را تا جای ممکن پایین بیاورید؛ بلکه باید به دنبال این باشید که با کمترین هزینه و توکن، به نتیجه قابلقبول برسید.
| ⭐ محتوای مرتبط: API چیست؟ هر آنچه باید درباره API بدانید (به زبان ساده) |
چطور مصرف توکن در Claude API را کاهش دهیم؟
اگر از Claude API داخل یک نرمافزار، چتبات یا سیستمهای داخلی خودتان استفاده میکنید، مدیریت مصرف توکن اهمیت بیشتری پیدا میکند. چون در این حالت، هر بار که کاربر با هوش مصنوعی تعامل میکند، برای پردازش آن درخواست مقداری توکن مصرف میشود.
پس هرچه درخواستهای بیشتری به Claude ارسال شود، توکن بیشتری مصرف میشود و در نتیجه هزینه استفاده از هوش مصنوعی هم افزایش پیدا میکند.
برای کاهش توکن کلاود در Claude API این راهکارها را امتحان کنید:
۱۳. از Prompt Caching استفاده کنید
اگر در درخواستهای مختلف، بخش زیادی از Promptپرامپت شما ثابت است، Prompt Caching میتواند یکی از بهترین راهها برای کاهش مصرف توکن باشد.
فرض کنید در هر درخواست این اطلاعات را برای Claude ارسال میکنید:
- دستورالعملهای اصلی سیستم
- مستندات محصول
- قوانین کسبوکار
- تعریف ابزارها
- پیام کاربر
چهار مورد اول معمولاً تغییر زیادی نمیکنند؛ بنابراین منطقی نیست که Claude هر بار مجبور باشد تمام این اطلاعات را از اول پردازش کند.
Prompt Caching به Claude API اجازه میدهد بخشهای ثابت و قابلاستفاده مجدد پرامپت را ذخیره کند تا در درخواستهای بعدی بتوان از همان اطلاعات دوباره استفاده کرد.
طبق مستندات Anthropic، این قابلیت برای کارهhttps://www.anthropic.com/ایی که درخواستهای مشابه و اطلاعات ثابت زیادی دارند، طراحی شده و میتواند زمان پردازش و هزینه مصرف توکنهای ورودی را کاهش دهد. Prompt Caching را میتوان بهصورت خودکار یا با تعیین نقاط مشخصی برای Cache کردن استفاده کرد.
حالا چه چیزهایی را کش کنیم؟
معمولاً این موارد گزینههای خوبی برای Cache شدن هستند:
- System Prompt ثابت
- دستورالعملهای پروژه
- مستندات محصول
- اطلاعات پسزمینه
- نمونههای ثابت
- تعریف ابزارهایی که مرتب استفاده میشوند
در مقابل، بهتر است اطلاعاتی که در هر درخواست تغییر میکنند، در انتهای Prompt قرار بگیرند.
مثلاً:
اطلاعات ثابت:
- System Prompt
- مستندات محصول
- قوانین کسبوکار
- تعریف ابزارها
اطلاعات متغیر:
- سؤال کاربر
- تاریخ فعلی
- اطلاعات کاربر
این ساختار باعث میشود بخش ثابت Prompt راحتتر در درخواستهای بعدی دوباره استفاده شود.
بهطور کلی، بهتر است اطلاعات ثابت و قابلاستفاده مجدد را در ابتدای Prompt قرار دهید و اطلاعات متغیر را به انتهای آن منتقل کنید. همچنین برای اینکه Cache بهدرستی مورد استفاده قرار بگیرد، بخش cacheشده باید با درخواستهای بعدی مطابقت داشته باشد.
📌💡 یک نکته مهم درباره Prompt CachingPrompt Caching باعث کاهش Output Token نمیشود. این قابلیت بیشتر روی بخشهای ورودی Prompt تأثیر میگذارد. بنابراین اگر Claude در پاسخ به یک درخواست ۵۰۰۰ توکن تولید کند، فعال کردن Prompt Caching باعث نمیشود پاسخ کوتاهتر شود. به زبان سادهتر، Prompt Caching کمک میکند هزینه پردازش اطلاعات تکراری را کاهش دهید، نه اینکه تعداد توکنهای پاسخ Claude را کم کنید. |
۱۴. طول Context را مدیریت کنید
یکی از اشتباههای رایج در سیستمهای مبتنی بر LLM این است که تمام اطلاعات موجود را یکجا برای مدل ارسال میکنند:
- کل تاریخچه گفتگو
- تمام نتایج جستوجو
- همه فایلها
- خروجی خام ابزارها
- اطلاعات تکراری
- و در نهایت، Prompt جدید کاربر
این روش شاید در یک پروژه کوچک مشکلی ایجاد نکند، اما وقتی تعداد کاربران و درخواستها افزایش پیدا کند، میتواند مصرف توکن را بهشدت بالا ببرد.
راهحل بهتر این است که قبل از ارسال درخواست، Context را بررسی و فقط اطلاعات موردنیاز را انتخاب کنید. برای مثال:
- اطلاعات غیرمرتبط → حذف
- نتایج تکراری → حذف
- تاریخچه قدیمی → خلاصهسازی
- اطلاعات ضروری → ارسال به Claude
هدف این نیست که Context را تا جای ممکن کوچک کنیم؛ بلکه باید مطمئن شویم فقط اطلاعاتی که برای انجام کار فعلی لازم است، در اختیار مدل قرار میگیرد.
حالا این خلاصهسازی Context چه زمانی مفید است؟
فرض کنید یک کاربر در یک چتبات ۳۰ پیام ردوبدل کرده است. اما برای پاسخ جدید، فقط چند نکته اصلی از این مکالمه اهمیت دارد.
در این شرایط، بهجای ارسال تمام ۳۰ پیام، میتوانید اطلاعات مهم را به یک خلاصه کوتاه تبدیل کنید:
خلاصه مکالمه:
- کاربر قصد خرید محصول X را دارد.
- بودجه کاربر Y است.
- ویژگی Z برای او اهمیت دارد.
- کاربر قبلاً گزینه A را رد کرده است.
با این روش، Context بسیار کوچکتر میشود، اما اطلاعات مهم همچنان حفظ میشوند.
در نتیجه، مدل بهجای اینکه حجم زیادی از اطلاعات قدیمی و غیرضروری را پردازش کند، روی اطلاعات مرتبط با درخواست فعلی تمرکز میکند.
۱۵. برای کارهای غیرضروری از Batch API استفاده کنید
همه درخواستها به پاسخ فوری نیاز ندارند. بعضی کارها را میتوان در پسزمینه انجام داد و لازم نیست نتیجه آنها همان لحظه آماده شود.
برای مثال:
- دستهبندی ۱۰۰ هزار محصول
- تحلیل تعداد زیادی سند
- پردازش مجموعهای از ایمیلها
- خلاصهسازی دادههایی که هر شب جمعآوری میشوند
اگر انجام این کارها اولویت ندارد، میتوانید بهجای ارسال درخواستها بهصورت جداگانه و لحظهای، آنها را بهصورت Batch پردازش کنید.
در پردازش Batch، تعداد زیادی درخواست را برای پردازش به سرویس میسپارید و نتیجه آنها بعداً آماده میشود. این روش برای کارهای حجیم و غیرضروریِ فوری میتواند گزینه مناسبتری باشد.
البته قبل از استفاده، بهتر است قیمتگذاری و شرایط فعلی Batch API را در مستندات رسمی Anthropic بررسی کنید؛ چون هزینه و محدودیتهای این سرویس ممکن است بسته به مدل و پلتفرم تغییر کند.
جمعبندی
اگر بخواهیم کل این مقاله را در یک جمله جمعبندی کنیم، باید اینطور بگوییم که بهترین راه برای کاهش مصرف توکن در کلاود مدیریت کانتکستها، استفاده از مدل مناسب کلاود برای تسکهای مختلف و کشینگ برای پرامپتهای تکراری است.
اگر هنوز با خود Claude و قابلیتهای آن آشنا نیستید، پیشنهاد میکنیم مقاله «معرفی هوش مصنوعی کلود؛ آیا کلود ارزش استفاده دارد؟» را هم در لیموهاست بخوانید.
سوالات متداول
آیا کوتاهتر نوشتن پرامپت باعث مصرف کمتر توکن میشود؟
آیا شروع یک چت جدید باعث کاهش مصرف توکن میشود؟
بله، وقتی اطلاعات و تاریخچه چت قبلی دیگر برای task جدید لازم نیستند، شروع یک مکالمه جدید میتواند از انتقال context غیرضروری جلوگیری کند.
آیا Prompt Caching تعداد Output Token را کاهش میدهد؟
خیر. Prompt Caching برای استفاده مجدد از بخشهای کششده پرامپت و کاهش هزینه و زمان پردازش ورودی طراحی شده است و روی تعداد توکنهایی که Claude در پاسخ تولید میکند اثر مستقیمی ندارد.
چرا Claude Code در یک پروژه ناگهان context زیادی مصرف میکند؟
فایلهای پروژه، تاریخچه مکالمه، خروجی دستورات، ابزارهای متصل و دستورالعملهای پروژه همگی میتوانند در context نقش داشته باشند.




دیدگاه ها
اولین نفری باشید که دیدگاه خود را ثبت می کنید