ABSeeker ਦਾ ਨਵਾਂ “Answer-Backtracked Credit Assignment” (ABC) ਤਰੀਕਾ ਲੰਬੇ ਸਮੇਂ ਤੱਕ ਚੱਲਣ ਵਾਲੇ ਸਰਚ ਏਜੰਟਾਂ (search agents) ਨੂੰ ਸਿਰਫ਼ ਅੰਤਮ ਜਵਾਬ ਦੀ ਬਜਾਏ ਹਰ ਇੱਕ ਵਿਅਕਤੀਗਤ ਕਦਮ ਲਈ ਕ੍ਰੈਡਿਟ ਕਮਾਉਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ, ਅਤੇ ਇਸ ਨਾਲ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ 4 ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲਾ ਮਾਡਲ ਪਹਿਲਾਂ ਹੀ ਬਹੁਤ ਵੱਡੇ ਮੁਕਾਬਲੇਬਾਜ਼ਾਂ ਦੇ ਬਰਾਬਰ ਜਾਂ ਉਨ੍ਹਾਂ ਤੋਂ ਅੱਗੇ ਨਿਕਲ ਸਕਦਾ ਹੈ।

ਇਹ ਕਾਢ ਇਸ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਿਉਂਕਿ ਮੌਜੂਦਾ ਏਜੰਟਾਂ ਦਾ ਮੁਲਾਂਕਣ ਸਿਰਫ਼ ਕੰਮ ਦੇ ਅੰਤ ਵਿੱਚ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। ਜੇਕਰ ਅੰਤਮ ਜਵਾਬ ਸਹੀ ਹੈ, ਤਾਂ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨੂੰ ਚੰਗਾ ਮੰਨਿਆ ਜਾਂਦਾ ਹੈ; ਜੇਕਰ ਇਹ ਗਲਤ ਹੈ, ਤਾਂ ਪੂਰੀ ਲੜੀ ਨੂੰ ਮਾੜਾ ਮੰਨਿਆ ਜਾਂਦਾ ਹੈ। ਇਹ 'ਸਭ ਕੁਝ ਜਾਂ ਕੁਝ ਵੀ ਨਹੀਂ' (all-or-nothing) ਵਾਲਾ ਫੀਡਬੈਕ ਅਸਲ ਸਿੱਖਣ ਦੇ ਸੰਕੇਤ ਨੂੰ ਛੁਪਾ ਦਿੰਦਾ ਹੈ—ਜਿਵੇਂ ਕਿ ਉਹ ਚੰਗੇ ਕਦਮ ਜੋ ਅਚਾਨਕ ਕਿਸੇ ਗਲਤੀ ਨਾਲ ਖਤਮ ਹੋ ਗਏ, ਜਾਂ ਉਹ ਬੇਕਾਰ ਕਲਿੱਕ ਜੋ ਕਿਸੇ ਕਿਸਮਤ ਨਾਲ ਸਹੀ ਨਤੀਜੇ ਵੱਲ ਲੈ ਗਏ। ABSeeker ਦਾ ਤਰੀਕਾ ਉਸ ਨਿਯਮ ਨੂੰ ਬਦਲ ਦਿੰਦਾ ਹੈ।

ਪੁਰਾਣਾ ਤਰੀਕਾ ਕਿਉਂ ਅਸਫਲ ਰਹਿੰਦਾ ਹੈ

ਜਦੋਂ ਕੋਈ ਏਜੰਟ ਸਰਚ ਕਰਦਾ ਹੈ, ਕੋਡ ਲਿਖਦਾ ਹੈ, ਜਾਂ ਸਬੂਤ ਇਕੱਠਾ ਕਰਦਾ ਹੈ, ਤਾਂ ਉਹ ਆਮ ਤੌਰ 'ਤੇ ਕਈ ਕਾਰਵਾਈਆਂ ਕਰਦਾ ਹੈ: ਕੁਐਰੀਆਂ (queries) ਜਾਰੀ ਕਰਨਾ, ਪੇਜ ਖੋਲ੍ਹਣਾ, ਕਮਾਂਡਾਂ ਚਲਾਉਣਾ, ਸਿਸਟਮ ਦੀ ਸਥਿਤੀ ਦੀ ਜਾਂਚ ਕਰਨਾ, ਅਤੇ ਹੋਰ ਬਹੁਤ ਕੁਝ। ਪੰਦਰਾਂ-ਕਦਮਾਂ ਵਾਲੀ ਇੱਕ ਪ੍ਰਕਿਰਿਆ ਵਿੱਚ, ਇੱਕ ਵੀ ਗਲਤੀ ਅੰਤਮ ਜਵਾਬ ਨੂੰ ਖਰਾਬ ਕਰ ਸਕਦੀ ਹੈ, ਭਾਵੇਂ ਪਿਛਲੇ ਕਦਮ ਸਹੀ ਸਨ। ਇਸ ਦੇ ਉਲਟ, ਇੱਕ ਅਜਿਹੀ ਪ੍ਰਕਿਰਿਆ ਜੋ ਸਹੀ ਜਵਾਬ ਨਾਲ ਖਤਮ ਹੁੰਦੀ ਹੈ, ਉਹ ਸਿਰਫ਼ ਕਿਸਮਤ 'ਤੇ ਨਿਰਭਰ ਹੋ ਸਕਦੀ ਹੈ, ਜਿਸ ਵਿੱਚ ਜ਼ਿਆਦਾਤਰ ਕਦਮਾਂ ਦਾ ਕੋਈ ਮੁੱਲ ਨਹੀਂ ਹੁੰਦਾ। ਸਿਰਫ਼ ਅੰਤਮ ਨਤੀਜੇ 'ਤੇ ਸਿਖਲਾਈ ਦੇਣ ਨਾਲ ਮਾਡਲ ਨੂੰ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨੂੰ ਇੱਕ ਸਿੰਗਲ ਬਲੈਕ ਬਾਕਸ ਵਜੋਂ ਦੇਖਣ ਲਈ ਮਜਬੂਰ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਇਹ ਸਿੱਖਣਾ ਮੁਸ਼ਕਲ ਹੋ ਜਾਂਦਾ ਹੈ ਕਿ ਕਿਹੜੇ ਉਪ-ਵਿਹਾਰ (sub-behaviors) ਅਸਲ ਵਿੱਚ ਉਪਯੋਗੀ ਹਨ।

ਇਹ ਸਥਿਤੀ ਸੌਫਟਵੇਅਰ ਇੰਜੀਨੀਅਰਿੰਗ ਵਿੱਚ ਡੀਬੱਗਿੰਗ (debugging) ਵਰਗੀ ਹੈ। ਡਿਵੈਲਪਰ ਹਰ ਲਾਈਨ ਦੀ ਜਾਂਚ ਕਰਦੇ ਹਨ, ਫੇਲ ਹੋਣ ਵਾਲੀ ਕਾਲ ਨੂੰ ਵੱਖਰਾ ਕਰਦੇ ਹਨ, ਅਤੇ ਉਸਨੂੰ ਠੀਕ ਕਰਦੇ ਹਨ। ਹਾਲਾਂਕਿ, ਏਜੰਟਾਂ ਨੂੰ ਉਨ੍ਹਾਂ ਦੇ ਅੰਦਰੂਨੀ ਕੰਮ ਦਾ ਅਜਿਹਾ ਕੋਈ "ਰਸੀਦ" (receipt) ਨਹੀਂ ਦਿੱਤਾ ਗਿਆ ਹੈ। ਉਸ ਆਡਿਟ ਟ੍ਰੇਲ (audit trail) ਤੋਂ ਬਿਨਾਂ, ਡਿਵੈਲਪਰ ਇਹ ਨਹੀਂ ਦੱਸ ਸਕਦੇ ਕਿ ਸੁਧਾਰ ਬਿਹਤਰ ਤਰਕ ਕਾਰਨ ਹੋਇਆ ਹੈ ਜਾਂ ਸਿਰਫ਼ ਇਤਫ਼ਾਕ ਨਾਲ, ਅਤੇ ਉਹ ਮਾੜੀਆਂ ਆਦਤਾਂ ਨੂੰ ਵਿਵਸਥਿਤ ਤਰੀਕੇ ਨਾਲ ਸੁਧਾਰ ਨਹੀਂ ਸਕਦੇ।

ABC ਕ੍ਰੈਡਿਟ ਅਸਾਈਨਮੈਂਟ ਨੂੰ ਕਿਵੇਂ ਬਦਲਦਾ ਹੈ

Answer-Backtracked Credit Assignment ਸਹੀ ਅੰਤਮ ਜਵਾਬ ਤੋਂ ਪਿੱਛੇ ਵੱਲ ਕੰਮ ਕਰਦਾ ਹੈ। ਇਹ ਪਹਿਲਾਂ ਉਹ ਜ਼ਰੂਰੀ ਸੁਰਾਗ ਕੱਢਦਾ ਹੈ ਜਿਨ੍ਹਾਂ 'ਤੇ ਜਵਾਬ ਨਿਰਭਰ ਕਰਦਾ ਹੈ—ਜਿਵੇਂ ਕਿ ਸਬੂਤ ਦੇ ਖਾਸ ਹਿੱਸੇ, ਵਿਚਕਾਰਲੇ ਨਤੀਜੇ, ਜਾਂ ਸਟੇਟ ਚੈੱਕ। ਫਿਰ ਇਹ ਰਿਕਾਰਡ ਕੀਤੇ ਟ੍ਰੇਸ (trace) ਰਾਹੀਂ ਪਿੱਛੇ ਜਾਂਦਾ ਹੈ ਅਤੇ ਉਨ੍ਹਾਂ ਸੁਰਾਗਾਂ ਦੇ ਆਧਾਰ 'ਤੇ ਹਰ ਕਾਰਵਾਈ ਨੂੰ ਸਕੋਰ ਦਿੰਦਾ ਹੈ। ਉਹ ਕਾਰਵਾਈ ਜੋ ਲੋੜੀਂਦੇ ਸੁਰਾਗ ਵਿੱਚ ਸਿੱਧਾ ਯੋਗਦਾਨ ਪਾਉਂਦੀ ਹੈ, ਉਸਨੂੰ ਸਕਾਰਾਤਮਕ ਕ੍ਰੈਡਿਟ ਮਿਲਦਾ ਹੈ; ਇੱਕ ਅਪ੍ਰਸੰਗਿਕ ਜਾਂ ਨੁਕਸਾਨਦੇਹ ਕਾਰਵਾਈ ਨੂੰ ਨਕਾਰਾਤਮਕ ਜਾਂ ਜ਼ੀਰੋ ਸਕੋਰ ਮਿਲਦਾ ਹੈ।

ਦੋ ਸਿਖਲਾਈ ਪ੍ਰਣਾਲੀਆਂ ਇਸ ਸਕੋਰਿੰਗ 'ਤੇ ਅਧਾਰਤ ਹਨ:

  • ABC-SFT (Supervised Fine-Tuning) ਲਾਸ ਫੰਕਸ਼ਨ (loss function) ਨੂੰ ਦੁਬਾਰਾ ਵੇਟ (re-weight) ਕਰਦਾ ਹੈ ਤਾਂ ਜੋ ਉੱਚੇ ਕ੍ਰੈਡਿਟ ਵਾਲੇ ਕਦਮ ਮਾਡਲ ਨੂੰ ਵਧੇਰੇ ਪ੍ਰਭਾਵਿਤ ਕਰਨ। ਮਾਡਲ ਉਨ੍ਹਾਂ ਕਾਰਵਾਈਆਂ ਨੂੰ ਪਹਿਲ ਦੇਣਾ ਸਿੱਖਦਾ ਹੈ ਜੋ ਇਤਿਹਾਸਕ ਤੌਰ 'ਤੇ ਉਪਯੋਗੀ ਸੁਰਾਗਾਂ ਵੱਲ ਲੈ ਕੇ ਗਈਆਂ ਸਨ।
  • ABC-GRPO (Gradient-based Reward Policy Optimization) ਪ੍ਰਤੀ-ਕਦਮ ਸਕੋਰਾਂ ਨੂੰ ਰੀਇਨਫੋਰਸਮੈਂਟ ਲਰਨਿੰਗ (reinforcement learning) ਲਈ ਇੱਕ ਰਿਵਾਰਡ ਸਿਗਨਲ ਵਜੋਂ ਵਰਤਦਾ ਹੈ, ਜੋ ਸਰਚ ਦੇ ਉਨ੍ਹਾਂ ਖਾਸ ਹਿੱਸਿਆਂ ਨੂੰ ਮਜ਼ਬੂਤ ਕਰਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੇ ਜਵਾਬ ਲੱਭਣ ਵਿੱਚ ਮਦਦ ਕੀਤੀ।

ਬਾਈਨਰੀ ਪਾਸ/ਫੇਲ ਲੇਬਲ ਨੂੰ ਯੋਗਦਾਨ ਦੇ ਇੱਕ ਵਿਸਤ੍ਰਿਤ ਨਕਸ਼ੇ ਵਿੱਚ ਬਦਲ ਕੇ, ABC ਮਾਡਲ ਨੂੰ ਬਹੁਤ ਅਮੀਰ ਸਿੱਖਣ ਦਾ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ।

ਸ਼ੁਰੂਆਤੀ ਨਤੀਜੇ ਬਹੁਤ ਕੁਝ ਕਹਿੰਦੇ ਹਨ

ਖੋਜਕਰਤਾਵਾਂ ਨੇ ABC ਨੂੰ ਇੱਕ ਮਾਮੂਲੀ 4 ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲੇ ਮਾਡਲ 'ਤੇ ਲਾਗੂ ਕੀਤਾ, ਜੋ ਇੱਕ ਕੰਟੈਕਸਟ-ਮੈਨੇਜਮੈਂਟ ਲੇਅਰ (context-management layer) ਨਾਲ ਲੈਸ ਹੈ ਜੋ ਬਦਲਦੀ ਹੋਈ ਸਰਚ ਸਟੇਟ ਦਾ ਰਿਕਾਰਡ ਰੱਖਦੀ ਹੈ। ਬੈਂਚਮਾਰਕ ਟਾਸਕਾਂ ਵਿੱਚ, ਜੋ ਰਵਾਇਤੀ ਤੌਰ 'ਤੇ ਬਹੁਤ ਵੱਡੇ ਏਜੰਟਾਂ ਦੇ ਪੱਖ ਵਿੱਚ ਹੁੰਦੇ ਹਨ, ABC-ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਮਾਡਲ ਨੇ ਜਾਂ ਤਾਂ ਉਨ੍ਹਾਂ ਵੱਡੇ ਸਿਸਟਮਾਂ ਦੇ ਬਰਾਬਰ ਪ੍ਰਦਰਸ਼ਨ ਕੀਤਾ ਜਾਂ ਉਨ੍ਹਾਂ ਤੋਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕੀਤਾ। ਉਹ ਪ੍ਰਦਰਸ਼ਨ ਵਾਧਾ ਮਾਡਲ ਦਾ ਆਕਾਰ ਵਧਾਏ ਬਿਨਾਂ ਹੋਇਆ, ਜੋ ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਬਿਹਤਰ ਕ੍ਰੈਡਿਟ ਅਸਾਈਨਮੈਂਟ ਕੱਚੇ ਪੈਰਾਮੀਟਰਾਂ ਦੀ ਗਿਣਤੀ ਦਾ ਬਦਲ ਹੋ ਸਕਦਾ ਹੈ।

ਮੁੱਖ ਗੱਲ ਸਧਾਰਨ ਹੈ: ਮਾਡਲ ਨੂੰ ਇਸ ਗੱਲ ਦੀ ਸਪਸ਼ਟ ਰਸੀਦ ਦਿਓ ਕਿ ਕੀ ਕੰਮ ਕਰ ਗਿਆ, ਅਤੇ ਇਹ ਉਹੀ ਸਿਖਲਾਈ ਡੇਟਾ ਤੋਂ ਵਧੇਰੇ ਮੁੱਲ ਕੱਢ ਸਕਦਾ ਹੈ।

ਅਸਲ ਦੁਨੀਆ ਦੇ ਏਜੰਟਾਂ ਲਈ ਇਸਦਾ ਕੀ ਮਤਲਬ ਹੈ

ਕੋਈ ਵੀ ਏਜੰਟ ਜੋ ਬਹੁ-ਕਦਮਾਂ ਵਾਲਾ ਕੰਮ ਕਰਦਾ ਹੈ—ਜਿਵੇਂ ਕੋਡਿੰਗ ਸਹਾਇਕ, ਸਾਹਿਤ-ਸਮੀਖਿਆ ਬੋਟਸ (literature-review bots), ਗਾਹਕ-ਸਹਾਇਤਾ ਟੂਲ—ਉਹ ਆਪਣੀਆਂ ਕਾਰਵਾਈਆਂ ਦੇ ਟ੍ਰੇਸ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ। ABC ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਉਸ ਟ੍ਰੇਸ ਨੂੰ ਸੰਭਾਲਣਾ ਅਤੇ ਮੁਲਾਂਕਣ ਕਰਨਾ ਸਿਰਫ਼ ਇੱਕ ਵਾਧੂ ਸੁਵਿਧਾ ਨਹੀਂ ਹੈ; ਇਹ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਸਿੱਖਣ ਲਈ ਜ਼ਰੂਰੀ ਹੈ।

  • Coding agents ਨੂੰ ਯੋਜਨਾ, ਜਾਰੀ ਕੀਤੀ ਗਈ ਹਰ ਕਮਾਂਡ, ਅਤੇ ਕੋਡ ਦੀ ਪੁਸ਼ਟੀ ਕਰਨ ਵਾਲੇ ਟੈਸਟ ਨਤੀਜਿਆਂ ਦਾ ਲੌਗ (log) ਰੱਖਣ ਦੀ ਲੋੜ ਹੈ।
  • Research agents ਨੂੰ ਉਹ ਕੁਐਰੀਆਂ ਜੋ ਉਨ੍ਹਾਂ ਨੇ ਭੇਜੀਆਂ ਸਨ, ਉਹ ਸਰੋਤ ਜੋ ਉਨ੍ਹਾਂ ਨੇ ਖੋਲ੍ਹੇ ਸਨ, ਅਤੇ ਉਹ ਸਬੂਤ ਜੋ ਉਨ੍ਹਾਂ ਨੇ ਕੱਢੇ ਸਨ, ਉਹ ਸੰਭਾਲ ਕੇ ਰੱਖਣੇ ਚਾਹੀਦੇ ਹਨ।
  • Support agents ਨੂੰ ਹਰ ਸਟੇਟ ਚੈੱਕ ਅਤੇ ਫੈਸਲੇ ਦੇ ਬਿੰਦੂ ਨੂੰ ਰਿਕਾਰਡ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ ਜੋ ਹੱਲ ਵੱਲ ਲੈ ਕੇ ਗਿਆ।

ਜਦੋਂ ਇਹ ਟ੍ਰੇਸ ਉਪਲਬਧ ਹੁੰਦੇ ਹਨ, ਤਾਂ ABC ਸਹੀ ਤਰੀਕੇ ਨਾਲ ਕ੍ਰੈਡਿਟ ਅਸਾਈਨ ਕਰ ਸਕਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਮਾਡਲ ਨੂੰ ਚੰਗੀਆਂ ਆਦਤਾਂ ਨੂੰ ਮਜ਼ਬੂਤ ਕਰਨ ਅਤੇ ਉਨ੍ਹਾਂ ਕਿਸਮਤ ਵਾਲੇ ਸ਼ਾਰਟਕੱਟਾਂ ਨੂੰ ਤਿਆਗਣ ਦੀ ਇਜਾਜ਼ਤ ਮਿਲਦੀ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਹੋਰਨਾਂ ਹਾਲਤਾਂ ਵਿੱਚ ਹੁਨਰ ਸਮਝਿਆ ਜਾ ਸਕਦਾ ਸੀ।

ਵਿਰੋਧੀ ਨੁਕਤੇ ਅਤੇ ਵਿਵਹਾਰਕ ਰੁਕਾਵਟਾਂ

ABC ਦੇ ਫਾਇਦੇ ਵਾਧੂ ਗੁੰਝਲਤਾ ਦੇ ਨਾਲ ਆਉਂਦੇ ਹਨ।

ਨਿਚੋੜ

Answer-Backtracked Credit Assignment ਉਸ ਤਰੀਕੇ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਬਦਲ ਦਿੰਦਾ ਹੈ ਜਿਸ ਨਾਲ ਅਸੀਂ ਏਜੰਟਸ ਨੂੰ ਖੋਜ ਕਰਨ, ਕੋਡ ਲਿਖਣ ਅਤੇ ਤਰਕ ਕਰਨ ਦੀ ਸਿਖਲਾਈ ਦਿੰਦੇ ਹਾਂ। ਸਿਰਫ਼ ਅੰਤਮ ਮੰਜ਼ਿਲ ਦੀ ਬਜਾਏ, ਰਸਤੇ ਵਿੱਚ ਕੀਤੇ ਗਏ ਸਹੀ ਕਦਮਾਂ ਨੂੰ ਇਨਾਮ ਦੇ ਕੇ, ਇਹ ਇੱਕ ਮੱਧਮ ਆਕਾਰ ਦੇ ਮਾਡਲ ਨੂੰ ਬਹੁਤ ਵੱਡੇ ਮਾਡਲਾਂ ਵਾਂਗ ਹੀ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਢੰਗ ਨਾਲ ਸਿੱਖਣ ਦੀ ਸਮਰੱਥਾ ਦਿੰਦਾ ਹੈ। ਉਹ ਕੋਈ ਵੀ ਵਿਅਕਤੀ ਜੋ ਅਜਿਹੇ ਏਜੰਟਸ ਬਣਾ ਰਿਹਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਬਹੁ-ਪੜਾਅ ਵਾਲੇ ਕੰਮ ਕਰਨੇ ਪੈਂਦੇ ਹਨ, ਉਸ ਲਈ ਇੱਕ ਟ੍ਰੇਸ-ਕੇਂਦ੍ਰਿਤ ਸਿਖਲਾਈ ਪ੍ਰਣਾਲੀ ਅਪਣਾਉਣਾ ਕੋਈ ਵਿਕਲਪ ਨਹੀਂ ਹੈ—ਇਹ ਭਰੋਸੇਯੋਗ, ਆਡਿਟ ਕਰਨ ਯੋਗ, ਅਤੇ ਅੰਤ ਵਿੱਚ ਸਮਾਰਟ AI ਵੱਲ ਜਾਣ ਵਾਲਾ ਰਸਤਾ ਹੈ।