Claude Fable 5.1 ਦੀ ਸ਼ੁਰੂਆਤ 1 ਸਤੰਬਰ 2026 ਨੂੰ ਹੋਈ। ਇਸਦਾ Terminal-Bench-Science ਸਕੋਰ 24.7% ਤੋਂ ਵਧ ਕੇ 52.6% ਹੋ ਗਿਆ—ਜੋ ਕਿ ਦੁੱਗਣੇ ਤੋਂ ਵੀ ਵੱਧ ਹੈ। ਇਸੇ ਸਮੇਂ, Anthropic ਨੇ cache-read ਫੀਸ ਨੂੰ $1.00 ਤੋਂ ਘਟਾ ਕੇ $0.25 ਪ੍ਰਤੀ ਮਿਲੀਅਨ ਟੋਕਨ ਕਰ ਦਿੱਤਾ ਹੈ, ਜੋ ਕਿ 75% ਦੀ ਗਿਰਾਵਟ ਹੈ। ਕਾਰਗੁਜ਼ਾਰੀ (performance) ਅਤੇ ਟੋਕਨ-ਲਾਗਤ (token-cost) ਵਿੱਚ ਇਹ ਦੋਹਰਾ ਬਦਲਾਅ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਇਹ ਫੈਸਲਾ ਲੈਣ ਲਈ ਮਜਬੂਰ ਕਰਦਾ ਹੈ ਕਿ ਕੀ ਨਵੇਂ ਮਾਡਲ ਦਾ agentic ਵਾਧਾ ਉਹਨਾਂ ਦੇ ਵਰਕਲੋਡਸ (workloads) ਲਈ ਕੀਮਤ ਦੇ ਬਦਲਾਅ ਨੂੰ ਜਾਇਜ਼ ਠਹਿਰਾਉਂਦਾ ਹੈ ਜਾਂ ਨਹੀਂ।

ਇਹ ਵਾਧਾ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

Anthropic ਦੀ “Fable” ਲਾਈਨ ਲੰਬੇ ਸਮੇਂ ਤੱਕ ਚੱਲਣ ਵਾਲੀਆਂ, ਸਵੈ-ਨਿਰਦੇਸ਼ਿਤ ਪ੍ਰਕਿਰਿਆਵਾਂ (self-directed processes) ਨੂੰ ਨਿਸ਼ਾਨਾ ਬਣਾਉਂਦੀ ਹੈ—ਜਿਵੇਂ ਕਿ ਅਟੋਨੋਮਸ ਏਜੰਟ (autonomous agents) ਜੋ ਡਾਟਾ ਇਕੱਠਾ ਕਰਦੇ ਹਨ, API calls ਨੂੰ ਲੜੀਵਾਰ ਜੋੜਦੇ ਹਨ, ਅਤੇ ਮਨੁੱਖੀ ਦਖਲਅੰਦਾਜ਼ੀ ਤੋਂ ਬਿਨਾਂ ਕੰਮ ਕਰਦੇ ਹਨ। Terminal-Bench-Science ਬੈਂਚਮਾਰਕ ਬਿਲਕੁਲ ਇਹੀ ਮਾਪਦਾ ਹੈ: ਇੱਕ ਮਾਡਲ ਦੀ ਬਹੁ-ਪੜਾਅ ਵਾਲੇ ਕੰਮਾਂ ਨੂੰ ਸਹੀ ਢੰਗ ਨਾਲ ਪੂਰਾ ਕਰਨ ਦੀ ਯੋਗਤਾ। ਸਕੋਰ ਦਾ ਦੁੱਗਣਾ ਹੋਣਾ ਤਰਕ ਦੀ ਡੂੰਘਾਈ (reasoning depth), ਯੋਜਨਾ ਲਾਗੂ ਕਰਨ (plan execution), ਅਤੇ ਗਲਤੀਆਂ ਨੂੰ ਸੰਭਾਲਣ (error handling) ਵਿੱਚ ਇੱਕ ਵੱਡੀ ਛਾਲ ਦਾ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ।

ਉਹਨਾਂ ਡਿਵੈਲਪਰਾਂ ਲਈ ਜੋ single-shot queries 'ਤੇ ਨਿਰਭਰ ਕਰਦੇ ਹਨ—ਜਿੱਥੇ ਇੱਕ ਉਪਭੋਗਤਾ ਇੱਕ ਔਖਾ ਸਵਾਲ ਪੁੱਛਦਾ ਹੈ ਅਤੇ ਜਵਾਬ ਦੀ ਉਮੀਦ ਕਰਦਾ ਹੈ—ਇਹ ਸੁਧਾਰ ਬਹੁਤ ਘੱਟ ਹੈ। ਬੈਂਚਮਾਰਕ ਸੁਇਟ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ Fable 5.1 ਇਕੱਲੇ ਪ੍ਰੋਂਪਟਸ (isolated prompts) 'ਤੇ Opus 5 ਤੋਂ ਬਹੁਤ ਹੀ ਮਾਮੂਲੀ ਜਿਹਾ ਅੱਗੇ ਨਿਕਲਿਆ ਹੈ। ਦੂਜੇ ਸ਼ਬਦਾਂ ਵਿੱਚ, ਮਾਡਲ ਦੀ ਨਵੀਂ ਤਾਕਤ "agentic" ਵਰਤੋਂ ਦੇ ਮਾਮਲੇ ਨਾਲ ਜੁੜੀ ਹੋਈ ਹੈ, ਨਾ ਕਿ ਆਮ ਚੈਟ ਜਾਂ Q&A ਨਾਲ।

ਲਾਗਤ ਦਾ ਹਿਸਾਬ-ਕਿਤਾਬ

ਇਨਪੁਟ ਅਤੇ ਆਉਟਪੁੱਟ ਟੋਕਨ ਦੀ ਕੀਮਤ ਉਹੀ ਰਹੀ ਹੈ, ਇਸ ਲਈ ਪ੍ਰਤੀ ਟੋਕਨ ਮੁੱਖ ਲਾਗਤ ਵਿੱਚ ਕੋਈ ਬਦਲਾਅ ਨਹੀਂ ਆਇਆ। ਅਸਲ ਬਚਤ cache-read ਡਿਸਕਾਊਂਟ ਤੋਂ ਹੁੰਦੀ ਹੈ। Caching ਕਿਸੇ ਦਿੱਤੇ ਗਏ ਪ੍ਰੋਂਪਟ ਦੇ ਮਾਡਲ ਦੇ ਜਵਾਬ ਨੂੰ ਸਟੋਰ ਕਰਦੀ ਹੈ ਅਤੇ ਜਦੋਂ ਉਹੀ ਪ੍ਰੋਂਪਟ ਦੁਬਾਰਾ ਆਉਂਦਾ ਹੈ ਤਾਂ ਉਸਦੀ ਦੁਬਾਰਾ ਵਰਤੋਂ ਕਰਦੀ ਹੈ, ਜਿਸ ਲਈ ਪੂਰੀ ਟੋਕਨ ਕੀਮਤ ਦਾ ਸਿਰਫ ਇੱਕ ਹਿੱਸਾ ਹੀ ਲਿਆ ਜਾਂਦਾ ਹੈ। Cache-read ਫੀਸ ਨੂੰ ਚੌਥਾਈ ਹਿੱਸੇ ਤੱਕ ਘਟਾਉਣ ਨਾਲ ਲੰਬੇ ਸਮੇਂ ਤੱਕ ਚੱਲਣ ਵਾਲੇ ਏਜੰਟ ਰਨ (agent runs) ਕਾਫ਼ੀ ਸਸਤੇ ਹੋ ਸਕਦੇ ਹਨ—ਜੇਕਰ cache hit rate ਉੱਚਾ ਰਹਿੰਦਾ ਹੈ।

ਹਾਲਾਂਕਿ, cache ਦੀ ਕੁਸ਼ਲਤਾ ਬਹੁਤ ਨਾਜ਼ੁਕ ਹੈ। ਇੱਕ ਵੀ ਬਦਲਾਅ—ਜਿਵੇਂ ਕਿ ਟਾਈਮਸਟੈਂਪ, ਦੁਬਾਰਾ ਵਿਵਸਥਿਤ ਕੀਤੀ ਗਈ ਸੂਚੀ, ਜਾਂ ਇੱਕ ਵਾਧੂ ਸਪੇਸ—ਸਟੋਰ ਕੀਤੀ ਗਈ ਐਂਟਰੀ ਨੂੰ ਅਵੈਧ ਕਰ ਦਿੰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਪੂਰੀ ਕੀਮਤ ਵਾਲੀ ਕਾਲ ਕਰਨੀ ਪੈਂਦੀ ਹੈ। ਉਹ ਡਿਵੈਲਪਰ ਜਿਨ੍ਹਾਂ ਨੇ ਪ੍ਰੋਂਪਟ ਪ੍ਰੀਫਿਕਸ (prompt prefixes) ਨੂੰ ਸਟੈਂਡਰਡ ਨਹੀਂ ਬਣਾਇਆ ਹੈ ਜਾਂ ਜੋ ਡਾਇਨਾਮਿਕ ਕੰਟੈਂਟ ਬਣਾਉਂਦੇ ਹਨ, ਉਹਨਾਂ ਦੀ cache-read ਵਾਲੀਮ ਜ਼ੀਰੋ ਹੋ ਜਾਵੇਗੀ, ਜਿਸ ਨਾਲ ਉਮੀਦ ਕੀਤੀ ਬਚਤ ਖਤਮ ਹੋ ਜਾਵੇਗੀ।

ਕੌਣ ਜਿੱਤਦਾ ਹੈ, ਕੌਣ ਹਾਰਦਾ ਹੈ

  • Agentic developers – ਅਟੋਨੋਮਸ ਅਸਿਸਟੈਂਟ, ਵਰਕਫਲੋ ਆਰਕੈਸਟ੍ਰੇਟਰ, ਜਾਂ ਬੈਕਗਰਾਊਂਡ ਬੋਟ ਬਣਾਉਣ ਵਾਲੀਆਂ ਟੀਮਾਂ ਨੂੰ ਪ੍ਰਦਰਸ਼ਨ (performance) ਅਤੇ ਲਾਗਤ ਦੋਵਾਂ ਵਿੱਚ ਫਾਇਦਾ ਹੁੰਦਾ ਹੈ।
  • Chat-oriented services – ਉਹ ਉਤਪਾਦ ਜੋ ਛੋਟੇ, ਮਨੁੱਖ ਦੁਆਰਾ ਪੁੱਛੇ ਗਏ ਸਵਾਲਾਂ ਦਾ ਜਵਾਬ ਦਿੰਦੇ ਹਨ, ਉਹਨਾਂ ਨੂੰ ਬਹੁਤ ਘੱਟ ਫਾਇਦਾ ਹੁੰਦਾ ਹੈ। Cache ਡਿਸਕਾਊਂਟ ਉਦੋਂ ਹੀ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦਾ ਹੈ ਜਦੋਂ ਪ੍ਰੋਂਪਟ ਦੁਬਾਰਾ ਆਉਂਦੇ ਹਨ, ਅਤੇ ਚੈਟ ਪ੍ਰੋਂਪਟ ਅਕਸਰ ਵਿਲੱਖਣ ਹੁੰਦੇ ਹਨ। Opus 5 ਦੀ ਵਰਤੋਂ ਜਾਰੀ ਰੱਖਣ ਨਾਲ ਤੁਲਨਾਤਮਕ ਜਵਾਬ ਦੀ ਗੁਣਵੱਤਾ ਮਿਲਦੀ ਰਹਿੰਦੀ ਹੈ ਅਤੇ ਖਰਚੇ ਵੀ ਅਨੁਮਾਨਿਤ ਰਹਿੰਦੇ ਹਨ।
  • Ops teams – Fable 5.1 ਇੱਕ ਨਵਾਂ refusal code ਜਾਰੀ ਕਰ ਸਕਦਾ ਹੈ। ਜੇਕਰ ਕੋਈ ਐਪਲੀਕੇਸ਼ਨ ਇਸ ਕੋਡ ਦੀ ਜਾਂਚ ਨਹੀਂ ਕਰਦੀ ਹੈ, ਤਾਂ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਖਾਲੀ ਜਵਾਬ (blank responses) ਦਿਖਾਈ ਦੇ ਸਕਦੇ ਹਨ। ਮਜ਼ਬੂਤ error-fallback ਲੌਜਿਕ ਵਾਲੀਆਂ ਟੀਮਾਂ ਜਲਦੀ ਅਨੁਕੂਲ ਹੋ ਜਾਣਗੀਆਂ; ਜਿਨ੍ਹਾਂ ਕੋਲ ਇਹ ਨਹੀਂ ਹੈ, ਉਹਨਾਂ ਨੂੰ ਆਪਣੇ ਪਾਈਪਲਾਈਨਾਂ (pipelines) ਨੂੰ ਪੈਚ ਕਰਨ ਦੀ ਲੋੜ ਪਵੇਗੀ।

ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਹੁਣ ਕੀ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ

  1. Cacheability ਲਈ ਆਪਣੇ ਪ੍ਰੋਂਪਟਾਂ ਦੀ ਜਾਂਚ ਕਰੋ – ਸਟੈਟਿਕ ਪ੍ਰੀਫਿਕਸ ਦੀ ਪਛਾਣ ਕਰੋ ਅਤੇ ਨਿਸ਼ਚਿਤ ਕ੍ਰਮ (deterministic ordering) ਲਾਗੂ ਕਰੋ। Cache ਡਿਸਕਾਊਂਟ ਦਾ ਲਾਭ ਲੈਣ ਲਈ ਸਾਰੀਆਂ ਕਾਲਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹੇ ਪ੍ਰੋਂਪਟ ਦੀ ਗਾਰੰਟੀ ਦਿਓ।
  2. ਸਾਈਡ-ਬਾਈ-ਸਾਈਡ ਟੈਸਟ ਚਲਾਓ – ਆਪਣੇ ਡੇਟਾ ਦੀ ਵਰਤੋਂ ਕਰਕੇ Fable 5.1 'ਤੇ "low-effort" ਸੈਟਿੰਗਾਂ ਦੀ ਤੁਲਨਾ Opus 5 'ਤੇ "high-effort" ਸੈਟਿੰਗਾਂ ਨਾਲ ਕਰੋ। ਬੈਂਚਮਾਰਕ ਮਦਦ ਕਰਦੇ ਹਨ, ਪਰ ਅਸਲ ਦੁਨੀਆ ਦੀ ਲੇਟੈਂਸੀ (latency), ਟੋਕਨ ਦੀ ਵਰਤੋਂ, ਅਤੇ