165 KiB
165 KiB
| 1 | f131bf1908b8c5dd1f49d7ae7f616506fc471666 | 33d96dae28e17208ef61a71dba40cda3c04f135a | 2026-05-27T09:38:51+08:00 | wangbomeng | fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE | |
|---|---|---|---|---|---|---|
| 2 | ebce9e1a548c2329aa97f53b8b2ad50d968088dc | e850ff4de25ad1221abc9bf3bb30df252ccd9c36 | 2026-05-27T09:38:00+08:00 | Yunzhe Jia | origin/runtime_replace | Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling |
| 3 | 38ca6895815671a87ceec86b4aa4eb976580ce76 | ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 | 2026-05-20T16:37:13+08:00 | Yunzhe Jia | Add support for cal-llm profile dumping to JSONL file | |
| 4 | 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 | b35bda124ccd4ed581dd6088d3ffa4931c2809b6 | 2026-05-18T08:40:54+08:00 | Yunzhe Jia | fix n_ctx_slot error by adding runtime capacity loading for cal-llm | |
| 5 | 3b14ed556c15529fe1f94b649f49db7156dfaf67 | dde8b8228081769c8d8f1e0751d47fa7875f8423 | 2026-05-14T14:34:25+08:00 | Yunzhe Jia | - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features. | |
| 6 | 99dd308adb8488fa869bb669e3335e646a938eff | 06c7852e99e34c71e24e3ef6001cb54c72970e4d | 2026-04-21T15:50:01+08:00 | wangbomeng | tag: v0.2.1 | server: fix max_seq_len |
| 7 | ed62eb33447f993d578e156a3c7e38c91b420ece | 015e988a271573a7c11e2a4b45084e1219d69d50 | 2026-04-21T15:05:22+08:00 | wangbomeng | try server-test:not success | |
| 8 | d8b2aaa00049978cebac15041f960d75b552f97b | b6f29ec8140028619efaa50aa6e73146cecf631d | 2026-04-13T11:23:44+08:00 | wangbomeng | server: fix context-shift | |
| 9 | b6f29ec8140028619efaa50aa6e73146cecf631d | 6d55eae7e76b768acfcec045b8e84cded8ae3b55 | 2026-04-13T11:23:31+08:00 | wangbomeng | server: fix context-shift | |
| 10 | a2d5bf362d6c9a546f9deadf4f8975605a915d33 | bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 | 2026-04-09T21:01:46+08:00 | Bomeng Wang | server: comment fixed time | |
| 11 | b8153b6b8f244b223c9f4c2940ae1f212634519e | 82842cfc3fa3d5c004c4540aeff8a81f38509bee | 2026-04-09T15:07:02+08:00 | wangbomeng | server: fix limit tokens to max_seq_len | |
| 12 | 82842cfc3fa3d5c004c4540aeff8a81f38509bee | 622a22991089c6debd5f4b57738f3df3a0bda8b5 | 2026-04-09T15:06:26+08:00 | wangbomeng | server: fix limit tokens to max_seq_len | |
| 13 | 622a22991089c6debd5f4b57738f3df3a0bda8b5 | 5f47a738ba56a37d0ff281a16212f41979568e35 | 2026-04-09T10:36:31+08:00 | wangbomeng | server: comment circle print | |
| 14 | ecf01a17651cd7b1e8b85fd6075e83831463ee23 | 99d2078e89305035d87d966cee7987c7d50b3925 | 2026-04-09T09:47:55+08:00 | Yunzhe Jia | fix n_parallel problem | |
| 15 | 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 | bbee06d6d851e3f84f75b578047967d7e0e4a8dc | 2026-04-08T13:55:52+08:00 | wangbomeng | server : reset inference time | |
| 16 | 398ecf71f5f574037ce33f84dd1576fa164909ad | 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 | 2026-03-27T02:01:23+08:00 | wangbomeng | rm llama-server_old.cpp | |
| 17 | 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 | e4eaab700333490e80ebefc8d023f6c1adfcc312 | 2026-03-27T00:57:11+08:00 | wangbomeng | server: printf calrt commit ID | |
| 18 | 41e6636ea1fb3884e41fb2023f92b0e7262ef09b | d0a1b2c758440720d42fa108b3444f54593daa73 | 2026-03-12T16:36:07+08:00 | Bomeng Wang | tag: v0.0.1 | server: correct the max_seq_len judgment |
| 19 | 583c387efaf7bc030574e554088de79d09a27fbd | 0edc14a60a2d5596f71d728c655e3523da924d89 | 2026-02-27T02:24:56+08:00 | wangbomeng | caserver: lim generated tokens to n_ctx_per_seq | |
| 20 | 0edc14a60a2d5596f71d728c655e3523da924d89 | aa0a17d719326a63e0d6fea60aa0ced44e7abc33 | 2026-02-27T01:57:39+08:00 | wangbomeng | caserver: limit generated tokens to n_ctx_per_seq | |
| 21 | d81d7b190ff5f21325167936496dfe5ab48b922e | e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 | 2025-11-04T14:43:32+08:00 | Yunzhe Jia | Merge branch 'master' into dev | |
| 22 | 48bd26501b08a3f0bff1249db47f313641f7bebb | 622cd010ff4a65bef67edbf2f9bf4707c01f98f7 | 2025-11-03T15:38:23+02:00 | Georgi Gerganov | server : add props.model_alias (#16943) | |
| 23 | cd5e3b57541ecc52421130742f4d89acbcf77cd4 | 87c9efc3b297b8a498716b1db3d061842e6fc85b | 2025-11-02T18:14:04+02:00 | Georgi Gerganov | server : support unified cache across slots (#16736) | |
| 24 | 2f68ce7cfd20e9e7098514bf730e5389b7bba908 | e4a71599e5846110159955dec0008eb4aa24222b | 2025-11-01T19:49:51+01:00 | Pascal | webui: auto-refresh /props on inference start to resync model metadata (#16784) | |
| 25 | e4a71599e5846110159955dec0008eb4aa24222b | dd5e8cab512c7752392b6e51a6f118f348fb3f16 | 2025-11-01T17:14:54+01:00 | Pascal | webui: add HTML/JS preview support to MarkdownContent with sandboxed iframe (#16757) | |
| 26 | c22473b580807929fd9e3a3344a48e8cfbe6c88f | 0f715b4e759acceccb9f437cfd2a988fff85514a | 2025-10-31T10:54:19+02:00 | Georgi Gerganov | server : don't print user inputs to console (#16871) | |
| 27 | 0f715b4e759acceccb9f437cfd2a988fff85514a | d2d931f173b8a736b08999436e9259aafddec718 | 2025-10-31T09:51:26+01:00 | Daniel Bevenius | server : fix typos in server.cpp comments [no ci] (#16883) | |
| 28 | 16724b5b6836a2d4b8936a5824d2ff27c52b4517 | b52edd25586fabb70f0c21b274473b307cf14499 | 2025-10-30T14:22:23-04:00 | chansikpark | server : bump request URI max length to 32768 (#16862) | |
| 29 | b52edd25586fabb70f0c21b274473b307cf14499 | 517b7170e1a4d733583c4b07c5b7a49acc05911c | 2025-10-30T18:42:57+02:00 | Georgi Gerganov | server : remove n_past (#16818) | |
| 30 | 8b11deea4663f29d3e042ce1056ba643264cd5f1 | b9ce94017729465895402cbcfffb51fa926c15e3 | 2025-10-30T04:34:15+01:00 | Oliver Simons | Hide latency of bias and gate-loading (#16847) | |
| 31 | 3eb2be1ca5f37480aeb16102970d9e65f43347fe | e41bcce8f0b53032a1fed275cd253e931c041cf6 | 2025-10-29T06:29:12-07:00 | Max Krasnyansky | Hexagon Op queue & dispatch optimizations (#16820) | |
| 32 | 338074c383c81366320d176d83b94b0a567ee0c2 | 851553ea6b24cb39fd5fd188b437d777cb411de8 | 2025-10-29T08:14:39+02:00 | YaelLogic | sycl: add RMS_NORM_BACK operation support (#16808) | |
| 33 | 85a7d8677bf2200981e52f744a21d5267964ffcf | a8ca18b4b815a2abdbecb958ee5f4c542d69aac7 | 2025-10-28T20:19:44+02:00 | Georgi Gerganov | memory : remove KV cache size padding (#16812) | |
| 34 | ad8d36beffd791db10c94eb9e964afb891e3ca55 | c053e18a66dd95dc340aa61317877c2a41d4e3cf | 2025-10-28T03:50:33+02:00 | tamarPal | sycl: add SSM_CONV operation support (#16800) | |
| 35 | 5a4ff43e7dd049e35942bc3d12361dab2f155544 | 10640e31aab0819f31c1e1f2d008b019ee737232 | 2025-10-27T13:51:28-07:00 | Diego Devesa | llama : disable pipeline parallelism if compute buffer allocation fails (#16748) | |
| 36 | 0bf47a1dbba4d36f2aff4e8c34b06210ba34e688 | dd62dcfab97e420949519fd0eac9fca7bf97e635 | 2025-10-23T21:30:17+02:00 | Johannes Gäßler | server: add memory breakdown print (#16740) | |
| 37 | 8cf6b42d467d05fa7d9776d2bcc69974ecce6900 | 9de9672adb0f4ca4e39483ac3ffed52b3f70a55d | 2025-10-23T11:32:24+02:00 | matteo | server : send partial stop string when <EOG> is reached (#15007) | |
| 38 | 63d2fc46e17a06be5b4b5823a5ada088317f1f0a | a2e0088d9242bd9e57f8b852b05a6e47843b5a45 | 2025-10-22T13:47:09-07:00 | Max Krasnyansky | Add experimental ggml-hexagon backend for the Hexagon NPU (#16547) | |
| 39 | 9b9201f65a22c02cee8e300f58f480a588591227 | 19a5a3edfd306516cc419679d69d6435943b6816 | 2025-10-22T16:58:23+02:00 | Pascal | webui: introduce OpenAI-compatible model selector in JSON payload (#16562) | |
| 40 | 13f2cfad4170c096c51a02c24a6a158cb47f1480 | 06332e28672356b964d6dfc2ba4657e20581cd43 | 2025-10-20T12:41:13+02:00 | Aleksander Grygier | Enable per-conversation loading states to allow having parallel conversations (#16327) | |
| 41 | 41386cf365d894134ee0813d15e2f5d76f6a4d8e | 3d4e86bbeb15f487d6da6174ba6191b7c212cc25 | 2025-10-17T18:02:52+03:00 | Radoslav Gerganov | rpc : report actual free memory (#16616) | |
| 42 | 466c1911ab736f0b7366127edee99f8ee5687417 | 0cb7a0683b0529172472d74d21f05470a607f297 | 2025-10-15T22:24:51+03:00 | safranowith | cpu : add FLOOR, CEIL, ROUND and TRUNC unary operators (#16083) | |
| 43 | f9fb33f2630b4b4ba9081ce9c0c921f8cd8ba4eb | f4ce81c45e7bd910e36bf44c253fc5255c49b1e4 | 2025-10-15T16:22:20+02:00 | Aleksander Grygier | Add server-driven parameter defaults and syncing (#16515) | |
| 44 | 17304cbcc1dd24de7741cbe57925d58e90a98ac1 | 3e3cb19f6449f9168a128eaeae01f8f41b049acc | 2025-10-15T16:53:12+03:00 | Georgi Gerganov | server : fix img token logs (#16595) | |
| 45 | 554fd578a5ed78a10f371f5850c6a69aa83df15a | fa882fd2b1bcb663de23af06fdc391489d05b007 | 2025-10-15T12:51:27+03:00 | Georgi Gerganov | server : fix mtmd checkpoints (#16591) | |
| 46 | 7ea15bb64c81e3813eb0babf9a57e1bc5697f569 | 9c7185dd28416cf67f5e3b268381f311b5e3da56 | 2025-10-14T07:51:36-05:00 | Jeff Bolz | vulkan: Improve build time for MSVC (#16545) | |
| 47 | bc07349a7f87ba6eb31ed4b0ea9d9a7352185213 | e60f241eacec42d3bd7c9edd37d236ebf35132a8 | 2025-10-14T08:48:50+03:00 | Georgi Gerganov | server : dynamic token limit for prompt cache (#16560) | |
| 48 | 81d54bbfd599811b354c39f04550888168be7780 | c7be9febcbafa9af7d1b9443f86475c59c9c5f87 | 2025-10-12T18:06:41+02:00 | Pascal | webui: remove client-side context pre-check and rely on backend for limits (#16506) | |
| 49 | 31d0ff1869aa2ea31f4e96d5877d0343e9a2171b | 97870e64975b26c5e06a3540a8dc0ff601351e86 | 2025-10-11T21:39:04+08:00 | Yann Follet | server / ranking : add sorting and management of top_n (#16403) | |
| 50 | e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e | 81086cd6a3ca1252f0dc0f938171648399179c53 | 2025-10-10T22:15:05+03:00 | Georgi Gerganov | server : fix division by zero when reporting stats (#16501) | |
| 51 | 68ee98ae181a5c83a5cc6261daeee69a1f588c15 | cdb6da468cc33323955a523738d2e1675aeb5e9a | 2025-10-10T17:11:07+03:00 | Radoslav Gerganov | server : return HTTP 400 if prompt exceeds context length (#16486) | |
| 52 | cdb6da468cc33323955a523738d2e1675aeb5e9a | 6d69ab3f262eca3f0c6ad0ce075d2c80b9924d0e | 2025-10-10T13:22:27+03:00 | Radoslav Gerganov | server : log requests to /v1/completions (#16495) | |
| 53 | 1faa13a1187051af66b0fd9f0d6effe4c77f0b3e | 1deee0f8d494981c32597dca8b5f8696d399b0f2 | 2025-10-09T22:54:57+02:00 | Pascal | webui: updated the chat service to only include max_tokens in the req… (#16489) | |
| 54 | d00cbea63c671cd85a57adaa50abf60b3b87d86f | 8328fd4bae76fc027f8ca0e9a05acd3788dabe3f | 2025-10-09T18:54:51+03:00 | Georgi Gerganov | server : host-memory prompt caching (#16391) | |
| 55 | 12bbc3fa50b6df03318a4451c9a2210200a0b28d | 9d0882840e6c3fb62965d03af0e22880ea90e012 | 2025-10-08T22:18:41+02:00 | Pascal | refactor: centralize CoT parsing in backend for streaming mode (#16394) | |
| 56 | d2ee056e1df0fdf646270fb5621e9f92084b59a7 | b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e | 2025-10-08T17:20:18+09:00 | issixx | server : fix cancel pending task (#16467) | |
| 57 | 7fdd16b432d247121fe5fe7b21f8805f85266c85 | 74b8fc17f92ada295a648e3c5eb28f46bca7d892 | 2025-10-08T10:57:29+03:00 | Georgi Gerganov | server : improve context checkpoint logic (#16440) | |
| 58 | df1b612e29ba97a2e67db339b1e8c7465702b7e8 | 4e0388aa8a1f4ef1065701dc9c3947aea0a1b9a5 | 2025-10-07T15:57:14+03:00 | Georgi Gerganov | server : add `/v1/health` endpoint (#16461) | |
| 59 | c61ae20d05bd4fdd8551311325a2845336449426 | 0123ff38f53d34752f29239a29d0e40a6dc4110f | 2025-10-07T09:59:13+03:00 | Radoslav Gerganov | rpc : update documentation (#16441) | |
| 60 | c5fef0fcea3b978a2318b1af170209ecec7c37b4 | ca71fb9b368e3db96e028f80c4c9df6b6b370edd | 2025-10-06T03:53:31-04:00 | Oleksandr Kuvshynov | server: update readme to mention n_past_max metric (#16436) | |
| 61 | 898acba6816ad23b6a9491347d30e7570bffadfd | e29acf74fea996014380d59d31aa504ae8964258 | 2025-10-04T12:49:16+03:00 | Radoslav Gerganov | rpc : add support for multiple devices (#16276) | |
| 62 | f6dcda390004b627ef30af378d0c01ad2519289e | 606a73f53175077429484b23dcf799f69a31d0bd | 2025-10-03T13:34:51-05:00 | ddh0 | server : context checkpointing for hybrid and recurrent models (#16382) | |
| 63 | ad126479c25cf983a0f994a08ba0911cf49ed62b | 77233277c912d495d1069543ca540c21a2f9e5b4 | 2025-10-03T11:45:16+02:00 | Daniel Bevenius | ci : change macos-13 to macos-15-intel (#16401) | |
| 64 | 77233277c912d495d1069543ca540c21a2f9e5b4 | e308efda8e54e3f07578937a45a5d83624eb7970 | 2025-10-03T11:30:39+02:00 | Aleksander Grygier | Capture model name only after first token (streaming) or completed request (#16405) | |
| 65 | 136bda78c5679b266362b39c58338fff46fd2592 | 5113efd34ceda709292de26c72716c49e024fb32 | 2025-10-03T09:11:34+02:00 | Aleksander Grygier | webui : Fix messages payload sent to chat completions (#16402) | |
| 66 | 2be72c2b121ee99f33927149265ce6073ade9e59 | 95ce0985449c52fb9d6849b95563f7cf933ea0e3 | 2025-10-02T15:16:25+08:00 | Neo Zhang Jianyu | SYCL: Update to oneAPI 2025.2 (#16371) | |
| 67 | aa9538a63aef35f0224b2502f13b19d650a8ce04 | e74c92e84236b2bab3f3c77bee4ead94928be360 | 2025-10-01T07:40:26+02:00 | Aleksander Grygier | webui: Remove running `llama-server` within WebUI `dev.sh` script (#16363) | |
| 68 | 16b0ca0d2e63fc1a0a43795f8552f9cb61d9f7a5 | 8d78cd2613ccdeb3cc86f59bc8f9ddd31cfbd3ed | 2025-09-30T19:18:54+02:00 | Pascal | Chatapi ignore empty sampling (#16330) | |
| 69 | 98c8269abefdfa8fde47dfb2769ceebc8b704e86 | 2790ecc304e384d9075c55d0628d8bf440025dc4 | 2025-09-30T17:42:57+08:00 | Yunzhe Jia | server: adapt to calrt | |
| 70 | 2811c65286ae954bec87049f75b86dc022006dcc | d8359f5fde480da030bf75c7711573c7c4d993ba | 2025-09-28T12:04:46+01:00 | Imad Saddik | Fixed a few typos in the README of the LLaMA.cpp HTTP Server [no ci] (#16297) | |
| 71 | 234e2ff8ed09716fb553437596779399bee31b11 | 3f81b4e91c1d5f098148af117e3f13cf4b077f52 | 2025-09-27T18:17:08+02:00 | Adrien Gallouët | server : remove old LLAMA_SERVER_SSL (#16290) | |
| 72 | 1a189278944d030211f336e103e96b65f976c361 | e0539eb6aed346d4b25a6ea019044e88771e7690 | 2025-09-26T18:35:42+02:00 | Aleksander Grygier | Allow viewing conversations even when llama server is down (#16255) | |
| 73 | d0991da39d3c39b3980c24cdfccb9a4c95a46870 | aa719c2f886c445b78113bf1e5849f1fce4124a7 | 2025-09-25T11:36:47+02:00 | Daniel Bevenius | server : add support for external server for tests (#16243) | |
| 74 | c498fc82fe5b83fc8c6e1627286bdc1f93caddbf | e7a5130a20cf45a3358308356c249734ca982143 | 2025-09-25T10:20:02+03:00 | Radoslav Gerganov | rpc : use ggml logging facilities | |
| 75 | 4b9f4cb0f89a88de4bdf97727d0457b0c648804c | 85e72271ba1ce78adf34fd8997803c991e617ca6 | 2025-09-23T13:59:34+08:00 | Aaron Teo | devops: add s390x containers (#15915) | |
| 76 | 5c6106a696af2b00ce01d14ba525979d5a32b199 | ec65fb52f0cc890e5085a6c5995ab08a156265fb | 2025-09-22T10:58:02+03:00 | Georgi Gerganov | contrib : update roles (#16113) | |
| 77 | 1eeb523c3e0c7ffbd59469f5463dcbdecba3535e | 5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 | 2025-09-21T08:31:55+02:00 | Giuseppe Scrivano | vulkan: optimize UMA buffer operations and fix driver hangs (#16059) | |
| 78 | 459c0c2c1a400f960d7b8e8d94d31a8426f80986 | be79d9fdd95ab8955527c4aaa67b90e8b9516718 | 2025-09-20T07:56:30+02:00 | Benni | server: fix SSE and OpenAI compatibility for error messages when streaming (#16109) | |
| 79 | be79d9fdd95ab8955527c4aaa67b90e8b9516718 | f432d8d83e7407073634c5e4fd81a3d23a10827f | 2025-09-19T15:15:21-07:00 | ssweens | llama-bench: add --devices and --list-devices support (#16039) | |
| 80 | 246c0d9c795fb25da8268625d597580155a3672f | 3edd87cd055a45d885fa914d879d36d33ecfc3e1 | 2025-09-18T23:07:18+02:00 | Adrien Gallouët | cmake : fix static linking for OpenMP on Unix-like systems (#16031) | |
| 81 | 4ca088b036313c2d8e682f4cfeb7c29edd85d0b9 | 703f9e32c4eb3166f8d63007c26e31a1466c21af | 2025-09-18T16:22:50+01:00 | Eric Curtin | Add resumable downloads for llama-server model loading (#15963) | |
| 82 | 2b6b55a59f590a1e1eb2dcd09d5b8b6feb9cc748 | e58174cecbc45bf79bf653cd2c984395940c6ef4 | 2025-09-18T13:36:57+03:00 | Radoslav Gerganov | server : include usage statistics only when user request them (#16052) | |
| 83 | 0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 | a7a98e0fffed794396b3fbad4dcdbbc184963645 | 2025-09-17T20:38:12+03:00 | Georgi Gerganov | metal : refactor + optimize v2 (#15995) | |
| 84 | 8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 | 77475530b8bbea3bf578632507e1284cdfe2c8c0 | 2025-09-16T16:17:08+02:00 | jacekpoplawski | llama-bench: add --n-cpu-moe support (#15952) | |
| 85 | b907255f4bd169b0dc7dca9553b4c54af5170865 | 28c39da7c645185ade5436767929d7ec33006033 | 2025-09-15T19:51:35+03:00 | yael-works | SYCL: Add COUNT_EQUAL operator support (#15991) | |
| 86 | 6c019cb04e86e2dacfe62ce7666c64e9717dde1f | 9dcd200d57bc6f05a59a6a8df361d5d183af4124 | 2025-09-14T21:17:04+02:00 | Sigbjørn Skjæret | server : only attempt to enable thinking if using jinja (#15967) | |
| 87 | 50f4281a6f5c3a5d68bdeb12f904fa01e0e2ba91 | 55758b00cae1451a0d789c50a5eb8c9bee42b9a0 | 2025-09-13T07:49:49-07:00 | Diego Devesa | llama : allow using iGPUs with --device (#15951) | |
| 88 | 4bf5549269d99bac936a65892da2312cc71b2421 | f4e664f838cc65d89fa845c48c372e43852112e4 | 2025-09-12T16:31:50+01:00 | Eric Curtin | Add docker protocol support for llama-server model loading (#15790) | |
| 89 | f088b6a84f6aed0abb619dbb9d375e726fc888a6 | 304ac5693d1e2124f83e0584bc5eea6311d3d3b4 | 2025-09-12T17:02:55+03:00 | Georgi Gerganov | server : adjust prompt similarity thold + add logs (#15913) | |
| 90 | 304ac5693d1e2124f83e0584bc5eea6311d3d3b4 | 6c88ad8fa741a2182a2dcf8c5353ae4b5c66e656 | 2025-09-12T13:24:21+02:00 | Ruben Ortlam | Vulkan iGPU device selection overhaul and PCI ID API support (#15947) | |
| 91 | e68aa10d8f3d26fdad5b912540362d79de5460e3 | 0a16bf52e6874369cb4fd2bdc4863ef984b688e7 | 2025-09-08T13:10:07-05:00 | Jeff Bolz | vulkan: sort graph to allow more parallel execution (#15850) | |
| 92 | 88021565f08e0b7c4e07ac089a15ec16fae9166c | 56920f56651908d5cce7a310dabf54ac4f6fbb7f | 2025-09-08T10:59:48-04:00 | Jesse | chat : Deepseek V3.1 reasoning and tool calling support (OpenAI Style) (#15533) | |
| 93 | 56920f56651908d5cce7a310dabf54ac4f6fbb7f | b0d52998b962bd2681c34bf52af993af79f178b8 | 2025-09-08T21:50:05+07:00 | Xuan-Son Nguyen | server : bring back timings_per_token (#15879) | |
| 94 | 3b15924d71237a43bb5ad71f5b885ee66a821342 | 79bc429262268ad2ac8a364cfe6c2d6b9c5f008a | 2025-09-07T10:19:45+02:00 | Daniel Bevenius | ggml WebGPU: remove userdata from request adapter callback (#15527) | |
| 95 | 3c3635d2f20424d557b5b0605a2a356214ffe048 | 61bdfd5298a78593be649a1035ee2a120b13c4f0 | 2025-09-06T19:45:24+07:00 | Xuan-Son Nguyen | server : speed up tests (#15836) | |
| 96 | 61bdfd5298a78593be649a1035ee2a120b13c4f0 | 01806e77714ae8a78130d432945b959a0956c56f | 2025-09-06T18:35:04+07:00 | Xuan-Son Nguyen | server : implement prompt processing progress report in stream mode (#15827) | |
| 97 | fd621880f3fd908424e675a41715a2dc760247a2 | 4281c7b315f8a904549fe527039b976e08098d1a | 2025-09-05T17:32:39-06:00 | Gabe Goodhart | aLoRA Support (#15327) | |
| 98 | 5fac79cbc77b6d12c9feb5f34fc63586b35fd561 | 408ff524b40baf4f51a81d42a9828200dd4fcb6b | 2025-09-05T14:31:24-06:00 | Gabe Goodhart | Thinking model disabled assistant prefill (#15404) | |
| 99 | dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 | 87932ec016f0ec81e98a13ce5212851f8c12458a | 2025-09-05T14:34:07+08:00 | Yunzhe Jia | add calrt API used in server side | |
| 100 | 5d6688de08e73acc2532d668380801ed79d704eb | 4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 | 2025-09-05T04:36:23+02:00 | Daniel Bevenius | model-conversion : add --embeddings flag to modelcard.template [no ci] (#15801) | |
| 101 | c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 | a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c | 2025-09-04T20:20:14+08:00 | Chenguang Li | CANN: Refactor ND to NZ workspace to be per-device (#15763) | |
| 102 | a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c | badb80cadbc40e047b30c43611aba575fc8d6845 | 2025-09-04T11:50:23+02:00 | Xuan-Son Nguyen | server: add exceed_context_size_error type (#15780) | |
| 103 | 8c3fdf44ecf08335942f2ba558955f55e88c7991 | f6da8cb86a28f0319b40d9d2a957a26a7d875f8c | 2025-09-03T09:48:35+02:00 | Daniel Bevenius | model-conversion : add missing curl script [no ci] (#15761) | |
| 104 | 0d161f021aa33ec0e90cce96f5d1a88925557327 | 4efd5a83163ff383285b3a4c2106feabf5c69557 | 2025-08-31T20:11:58+03:00 | Georgi Gerganov | server : enable /slots by default and make it secure (#15630) | |
| 105 | d82f6aa34a216f5df1945cdfe121ba5e6cd80be0 | 3d16b29c3bb1ec816ac0e782f20d169097063919 | 2025-08-30T00:12:53+02:00 | Sergey Alirzaev | server : removed obsolete doc (#15670) | |
| 106 | 792b44f2ed9668cce7f267ff0ae4950ed9b4a5de | 81017865ee444cf49ce0136f2be1e41a0270ff91 | 2025-08-29T19:25:40+02:00 | ExtReMLapin | server : add documentation for `parallel_tool_calls` param (#15647) | |
| 107 | c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a | 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 | 2025-08-28T17:09:05+03:00 | Georgi Gerganov | kv-cache : fix find_slot to not search for continuous slot (#15638) | |
| 108 | 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 | 55042b3692cb1467c9ee15c62c4a9fbf180f89e3 | 2025-08-28T15:49:50+02:00 | Sigbjørn Skjæret | model : jina-embeddings-v3 support (#13693) | |
| 109 | fbef0fad7a7c765939f6c9e322fa05cd52cf0c15 | da54f9f1a2db07aaae390024ac466e7867685d94 | 2025-08-27T20:58:09+02:00 | Johannes Gäßler | server: higher timeout for tests (#15621) | |
| 110 | 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb | 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e | 2025-08-26T15:19:56+08:00 | Yunzhe Jia | Merge branch 'master' into dev | |
| 111 | 5a6bc6b1a6cb665a944426c2055794950e524bf5 | 6b64f74b55628e4193f4fb00313f07dbd8556528 | 2025-08-25T14:25:25+02:00 | Daniel Bevenius | model-conversion : add model card template for embeddings [no ci] (#15557) | |
| 112 | 611f419cff11e4952228162a1c44cb35dff2274a | b1afcab804e3281867a5471fbd701e32eb32e512 | 2025-08-23T13:16:17-05:00 | Jeff Bolz | vulkan: optimize rms_norm, and allow the work to spread across multiple SMs (#15281) | |
| 113 | 4afb0a746f22abaa545b3ebdb76a400d7da3a713 | e288693669cf9d0a71e2f2b8bd57305f06340257 | 2025-08-22T08:10:14Z | 65a | server : Support multimodal completion and embeddings prompts in JSON format (#15108) | |
| 114 | cd36b5e5c7fed2a3ac671dd542d579ca40b48b54 | 3f196be84b1376945737163e35a91e29e3e24d2f | 2025-08-21T19:13:45+03:00 | Georgi Gerganov | llama : remove deprecated llama_kv_self API (#15472) | |
| 115 | 245be739df942861ddc52331b095b40f18e2a3f1 | b2caf67db1208fd38a0570785c39f7370d906d8a | 2025-08-21T11:47:52+02:00 | Copilot | ci : add copilot-instructions.md (#15286) | |
| 116 | 1b0db8f6e08951969e2447c2d18bf638effb8f75 | 29f538ac630d6544406a0702476e36808a6bd1b3 | 2025-08-21T07:19:22+02:00 | stduhpf | server : fix webui (#15462) | |
| 117 | 1bc664a26a1d93a48baf2483a7ff95291ca8bcb8 | 13aeb7aef284daed4ad07dc14b4b3e2a42b5ea97 | 2025-08-21T07:10:08+09:00 | teo | server: fix OpenAI API compatibility for usage statistics in chat streams (#15444) | |
| 118 | 1a99c2d948209d9ea5eac8b6dc0a297107244540 | 37f10f955f70e0158d50343d0b9a3f92d194daae | 2025-08-20T18:32:05+08:00 | xiaobing318 | cmake : fix target include directories (#15450) | |
| 119 | d2fcd91cf96b46f4485ce46b4e3a32bf0df37715 | a6d3cfe7fa6ea1fb0e1ba8243b731db22ddc0b49 | 2025-08-19T16:46:37+03:00 | Georgi Gerganov | server : disable context shift by default (#15416) | |
| 120 | 9d262f4bad0d37838100133537aaf0a83835ed12 | f0d3c7405c323784a60f14ddddfbac3f7404d417 | 2025-08-19T08:45:26+03:00 | Georgi Gerganov | server : remove swa_full warning (#15399) | |
| 121 | d1d82416006e7ff41780cb0e9b5f28d30a267497 | 618575c5825d7d4f170e686e772178d2aae148ae | 2025-08-18T16:51:42+02:00 | davidef | server : fix incoming tasks not process in order (#15395) | |
| 122 | e5155e698645242d4f019267ecc40ea9bad81b09 | 21c17b5befc5f6be5992bc87fc1ba99d388561df | 2025-08-17T18:28:58-04:00 | Oleksandr Kuvshynov | server : export max observed n_past value (#15361) | |
| 123 | de2192794f4e8e04f2e8167ef2424905145e88fc | 2e2b22ba6607414a5d619ac6d2f034b5b02214e5 | 2025-08-16T04:18:31-05:00 | Jeff Bolz | vulkan: Support mul_mat_id with f32 accumulators (#15337) | |
| 124 | ff27f80a74bbe5303acd511a6781a1de6d619b3c | d3248d9b6557c75d59954c594bb53cf517591e91 | 2025-08-15T21:11:22+08:00 | Aaron Teo | ggml: initial IBM zDNN backend (#14975) | |
| 125 | 5ba36f61033d2819be27e2abb70e9a3bd20c0fde | b204a5a234f4cf0b3f449476da639a5510c6d157 | 2025-08-14T16:23:56+02:00 | uvos | HIP: Cleanup hipification header (#15285) | |
| 126 | b204a5a234f4cf0b3f449476da639a5510c6d157 | 646944cfa8961afd914dd6637739b3cda9a72e11 | 2025-08-14T09:23:11-05:00 | Aldehir Rojas | gpt-oss: implement harmony parsing (#15181) | |
| 127 | d32e03f4495d3efa1c5126f53b449f1d429c5664 | 3973163bff40f7f5161b0f08a0011729e2b0406a | 2025-08-14T14:59:50+03:00 | Georgi Gerganov | server : add SWA checkpoints (#15293) | |
| 128 | b3e16665e14032d1276f9d0263acef8321b6f518 | c24f4e26883a91219af5acfaf1471ca7ef582683 | 2025-08-13T15:43:00+02:00 | Sigbjørn Skjæret | server : enable -td and -tbd parameters (#15172) | |
| 129 | e885445bc1719d2e289a9b2e11714e0f994e68be | 648ebcdb739abfb5a9be14f4c5c0fd19ff268ef0 | 2025-08-13T05:28:21-05:00 | Aldehir Rojas | server : filter out harmony thought messages (#15278) | |
| 130 | 07aa869a91837d95fcb5612c65a188763ac38647 | 00f35d509e5367bf19ccaf4b4adddc38db4811c6 | 2025-08-13T11:30:45+02:00 | Sigbjørn Skjæret | ci : add more python requirements to copilot-setup-steps (#15289) | |
| 131 | 6028bf74351d35a06bd98498624f8c2f029f7d1a | bc5182272c373267352bc689e5fca276934bea2d | 2025-08-13T10:04:46+02:00 | Oliver Simons | CUDA: Optimize `reduce_rows_f32` kernel, leading up to 25x perf improvement on kernel-level and 10% perf increase for Gemma3n (#15132) | |
| 132 | 53d0a1265826f40c5dbc01d06aeab9e14fcbd69b | 27093afe78912494073eb043fec93a007e49653c | 2025-08-11T14:48:41+02:00 | Xuan-Son Nguyen | server : allow specifying reasoning_format in HTTP request (#15238) | |
| 133 | cd3069dfcbeee8e0e96cffb93b0ebb9e595e273a | 50e81bdf5db563ab57a9a722b08f96fa8a76c927 | 2025-08-11T11:21:19+02:00 | Daniel Bevenius | kv-cache : log (debug) all streams in find_slot (#15176) | |
| 134 | 4850b52aedceeb70bb4fe49f2d7cd1df6ee98682 | cd6983d56d2cce94ecb86bb114ae8379a609073c | 2025-08-08T23:04:36+02:00 | Johannes Gäßler | server-bench: external OAI servers, sqlite (#15179) | |
| 135 | 36d3f00e142696f708ab297b9f8f1c825594712d | 5fd160bbd9d70b94b5b11b0001fd7f477005e4a0 | 2025-08-07T05:31:48+02:00 | Daniel Bevenius | requirements : fix PyTorch uint64 compatibility (#15134) | |
| 136 | c42293848dd9f03eba9a6c1b85a600b398f06541 | 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 | 2025-08-06T15:46:06+08:00 | Yunzhe Jia | sync with calrt API | |
| 137 | f906275537d14c8fc7c6976d944233771fd6672c | a9f7541ec25c4c8547daf5ff48700ad2836e2b7d | 2025-08-02T10:12:41+02:00 | Johannes Gäßler | server: enable token array inputs for OAI API (#15001) | |
| 138 | 94933c8c2eeaa9a7983e3f6c08af76bd86724094 | c1dacaa99b4ead6edbac928cd2da59436573f6b0 | 2025-07-31T05:25:23-07:00 | g2mt | server : implement universal assisted decoding (#12635) | |
| 139 | a9f77a8be348deeb11fb3d54d412bf583003c90d | 8a4a85627702b569d7d2810f2de06a4321656e9d | 2025-07-31T14:08:23+02:00 | Lukas Straub | server : add openai-style logit_bias support (#14946) | |
| 140 | 41e78c567e9a8c652e405f4f909deb598deecd31 | ad4a700117d1746799d2d6599e526e2c3a7938d2 | 2025-07-30T18:07:11+02:00 | Daniel Bevenius | server : add support for `embd_normalize` parameter (#14964) | |
| 141 | 00131d6eaf4df029e1ec84de868c2c5957503007 | 1e15bfd42c3938506e0da5939bf7f42780965f01 | 2025-07-30T15:12:02+03:00 | Georgi Gerganov | tests : update for LLAMA_SET_ROWS=1 (#14961) | |
| 142 | bbd0f917797e9d524680f1b30d34a46eb06d7651 | 0a5036bee9cfb946870689db4400e9e0d17844c9 | 2025-07-29T10:40:50+02:00 | Johannes Gäßler | server-bench: make seed choice configurable (#14929) | |
| 143 | c556418b600ad5792440942079d93e393595688b | db16e2831c0f344f041af3d067db81c42b16eb22 | 2025-07-28T18:59:04+03:00 | Radoslav Gerganov | llama-bench : use local GPUs along with RPC servers (#14917) | |
| 144 | f1a4e72de5950ab7136aeadddd675caf30dd6b3f | 4762ad7316dcdec20016ab5985fb46a27902204d | 2025-07-27T04:05:34-05:00 | Jeff Bolz | vulkan: skip empty set_rows to avoid invalid API usage (#14860) | |
| 145 | 793c0d7f46384001738c337d7afa46b45ae32745 | ce111d39d666f4a3b6a561ad020f6feb8cc67790 | 2025-07-25T10:47:39-06:00 | Gabe Goodhart | metal: SSM_SCAN performance (#14743) | |
| 146 | c12bbde37258c6d053322d1cedd4a9672109ae58 | 3f4fc97f1d745f1d5d3c853949503136d419e6de | 2025-07-25T01:07:26-07:00 | Diego Devesa | sched : fix multiple evaluations of the same graph with pipeline parallelism (#14855) | |
| 147 | 3f4fc97f1d745f1d5d3c853949503136d419e6de | 2df255da3cea108de0ae9b302ffdd31674b6d88d | 2025-07-25T03:05:37+08:00 | R0CKSTAR | musa: upgrade musa sdk to rc4.2.0 (#14498) | |
| 148 | adef81781a15083f218eae6c488b95cdad781971 | 48b86c4fdb1b1246d9fe17d2d53e3a1c2a0c3245 | 2025-07-22T09:24:22+08:00 | Molly Sophia | server : allow setting `--reverse-prompt` arg (#14799) | |
| 149 | b4efd77f8ab407836ca73a5176f041650c5b2411 | 2be60cbc2707359241c2784f9d2e30d8fc7cdabb | 2025-07-21T09:24:51+02:00 | IsaacDynamo | server : add parse_special option to /tokenize endpoint (#14783) | |
| 150 | 2adf8d83acdb9b1bf58db6c9729ac9dc6847a58b | 021cc28bef4dd7d0bf9c91dbbd0803caa6cb15f2 | 2025-07-18T17:33:41+03:00 | Georgi Gerganov | parallel : add option for different RNG seeds (#14757) | |
| 151 | 086cf81e88fb75287b71ff19c08a206b7bc2e02f | d9b691081c04ec5fb0daa9d2b979f915c142963d | 2025-07-17T09:22:11+02:00 | Tarek Dakhran | llama : fix parallel processing for lfm2 (#14705) | |
| 152 | 225e7a1438f4ea85eaa7b5ef3ab3b266ee4d9c06 | ab140198211385b85eeeb0abd549a4bbe259e10d | 2025-07-16T16:35:42+03:00 | Georgi Gerganov | llama : add high-throughput mode (#14363) | |
| 153 | 6ffd4e9c442e99afac3d138543ebf86d5fc5ee03 | e4841d24d3485ea4af54f8b65a19ec3123f0ff3c | 2025-07-16T14:04:12+03:00 | Georgi Gerganov | server : pre-calculate EOG logit biases (#14721) | |
| 154 | e4841d24d3485ea4af54f8b65a19ec3123f0ff3c | 538cc77f7f44dfa047dba6a06d90c86dda69cf1d | 2025-07-16T19:12:22+09:00 | Shunta Saito | llama : fix parallel processing for plamo2 (#14716) | |
| 155 | 538cc77f7f44dfa047dba6a06d90c86dda69cf1d | 5cae76654113160f691f581930b69fc5535e8159 | 2025-07-16T12:13:57+03:00 | Georgi Gerganov | server : fix handling of the ignore_eos flag (#14710) | |
| 156 | 5cae76654113160f691f581930b69fc5535e8159 | 4b91d6f71f14040979bcdb7b6729b3bca93ec1c1 | 2025-07-16T09:33:28+02:00 | Johannes Gäßler | scripts: synthetic prompt mode for server-bench.py (#14695) | |
| 157 | 79e0b68c178656bb0632cb8602d2940b755077f8 | c81f4192f91a1e209c1eec7a84fe5371ef9175da | 2025-07-16T12:00:42+08:00 | Min-Hua | llama: add LLAMA_API to deprecated llama_kv_self_seq_div (#14708) | |
| 158 | 494c5899cb76859f32ddd913534f2685fd684a3d | 0f4c6ec0f1a9607ba67071f8a02c69b0afc2f91e | 2025-07-14T13:14:30+02:00 | Johannes Gäßler | scripts: benchmark for HTTP server throughput (#14668) | |
| 159 | 0c1df14b5f8d992805cb22d0b77b44092a18aeab | b3ad3a0191994d6c47b2bd389d5c7431526ecd2c | 2025-07-12T06:21:02-04:00 | Douglas Hanley | server : fix pooled embedding output (#14645) | |
| 160 | 0aedae00e6fb48680324a5ac5da9cba0e35de6b5 | 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 | 2025-07-10T18:20:13-06:00 | Gabe Goodhart | model : Granite Four (#13550) | |
| 161 | 4a5686da22057867c23bd4a6be941ddc8c51e585 | 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a | 2025-07-09T14:59:57-04:00 | compilade | llama : support Jamba hybrid Transformer-Mamba models (#7531) | |
| 162 | 04655063c47af6cbced295c8c7ad369402b15300 | 20b7bf8a32259ad9189a4797fd3e3a859c537b99 | 2025-07-09T12:03:49+04:00 | ibrahim khadraoui | model : add support for Falcon-H1 family (#14534) | |
| 163 | 17a1f0d2d407040ee242e18dd79be8bb212cfcef | 8f22dc0a53338c629c1ef8fa878d8e39bfe627c9 | 2025-07-08T11:47:33+03:00 | Alawode Oluwandabira | server: Add ability to mount server at prefix (#14544) | |
| 164 | ddef99522d1ba74193b7394e803fab8db5c78bae | 668168814601d2aef6161ce49ab186bc74177ae7 | 2025-07-05T09:17:14+02:00 | Sigbjørn Skjæret | server : fix assistant prefilling when content is an array (#14360) | |
| 165 | a70c8a0c4b4c1606cd9a0ba889ce61aa88610095 | 9067487c4411efb20400103fcccfdd389c80d428 | 2025-07-03T10:53:35+03:00 | Georgi Gerganov | kv-cache : use ggml_set_rows (#14285) | |
| 166 | c839a2da1a0d4275c3a98f70c3a7627487573a46 | e9b6350e61d592634263a14b3d77ecbf6c1fb096 | 2025-06-30T17:48:24+08:00 | xiaobing318 | cmake : Remove redundant include path in CMakeLists.txt (#14452) | |
| 167 | caf5681fcb47dfe9bafee94ef9aa8f669ac986c7 | 83790b0e7e09ab17238b16452a33053a71dbdfad | 2025-06-29T20:02:53+02:00 | matteo | server : support jinja extra template kwargs (Qwen3 enable_thinking feature), from command line and from client (#13196) | |
| 168 | 83790b0e7e09ab17238b16452a33053a71dbdfad | f47c1d7106e49062279bcc57fc1077c0db61e278 | 2025-06-29T19:29:57+02:00 | Renat | server : fix appearance of the chats list context menu for Safari (#14322) | |
| 169 | bd9c981d7226107f18deb8344c3301450311bb8b | 27208bf657cfe7262791df473927225e48efe482 | 2025-06-29T02:43:36-05:00 | Jeff Bolz | vulkan: Add fusion support for RMS_NORM+MUL (#14366) | |
| 170 | 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 | d2f325130c4ed77a3dcff2c23a926587fb08e2cc | 2025-06-26T15:10:45+08:00 | Yunzhe Jia | Squashed commit of the following: | |
| 171 | 1b809cee225222094a0ff5be8467240487ce4ae4 | abf241045d09cad70dc797b0fba393ad09ee2cbe | 2025-06-24T08:59:11Z | Nigel Bosch | server : move no API key doc to /health (#14352) | |
| 172 | 901e20bbe571fbde48d13eb188f4e7cdc7562fb6 | 0142961a2e67909e33cdf410274b56c08c5dce7a | 2025-06-24T02:17:58-04:00 | Bartowski | jinja : Add Mistral-Small-3.2-24B-Instruct-2506.jinja (#14349) | |
| 173 | 8308f98c7fb778e54bf75538f5234d8bd20915e9 | 6369be07359d03723f38c0a4a014ff0f698a0738 | 2025-06-20T15:07:21+02:00 | Nicolò Scipione | sycl: add usage of enqueue_functions extension (#14244) | |
| 174 | d67341dc18fc5cc63362880ab2f8f9ecfc7932e7 | 456af35eb70177b8dd5779b6d4c21bb020f9cebd | 2025-06-19T16:01:03+03:00 | aa956 | server : add server parameters for draft model cache type (#13782) | |
| 175 | edc4a29effe716956fdfd2bc5b9cba2a6d8492f8 | ed3290ab34493fd3d2e0f925f816a401da4f2dfd | 2025-06-19T00:08:14-05:00 | Gabe Goodhart | memory : Hybrid recurrent cache (#13979) | |
| 176 | 89fea80d298184d1cd93564f48e060d9f541f4b4 | 6adc3c3ebc029af058ac950a8e2a825fdf18ecc6 | 2025-06-16T22:33:27+03:00 | Georgi Gerganov | server : fix incorrect usage of llama_get_embeddings() (#14225) | |
| 177 | d3e64b9f490cee41b7b9aa275dae2f6568ae3054 | 3ba0d843c6bd3faea5cf5e53dc7f3c82be20bffb | 2025-06-16T14:14:00+03:00 | Georgi Gerganov | llama : rework embeddings logic (#14208) | |
| 178 | cd355eda7df1898d25d433b4bdaa4b4b479e0bad | 30e5b01de2a0bcddc7c063c8ef0802703a958417 | 2025-06-15T23:36:22+02:00 | Eric Curtin | server : When listening on a unix domain socket don't print http:// and port (#14180) | |
| 179 | c311ac664d68d10781a3e7b9f02d9d9520837d80 | b9912ac570de8945ae9383c9ca8291027bf287dd | 2025-06-15T10:08:58+03:00 | Georgi Gerganov | cparams : rename LLAMA_MAX_PARALLEL_SEQUENCES to LLAMA_MAX_SEQ (#14188) | |
| 180 | 3cb203c89f60483e349f841684173446ed23c28f | 2e42be42bd6bf1dcc643d6ac4e77419bfe5dd24f | 2025-06-14T18:25:15+02:00 | Piotr | llama-chat : Do not throw when tool parsing fails (#14012) | |
| 181 | ffad04397399ea1650fda6560c7c753059804876 | 0889eba570126f8a2f5a0e88fde776bbc91cca66 | 2025-06-13T11:18:25+03:00 | Georgi Gerganov | server : fix SWA condition for full context reprocess (#14163) | |
| 182 | c61285e7396c8e526fe7794c19e8d4f1c99bfc51 | 09cf2c7c655c90e53e100f29b830a788bab0653d | 2025-06-13T08:45:37+01:00 | Ewan Crawford | SYCL: Bump oneMath commit (#14152) | |
| 183 | 7d516443dd7766569110b38e6374649bee6eb1c4 | f6e1a7aa8787b5c00acba6370cb70a0beff48b1e | 2025-06-12T11:51:38+03:00 | Georgi Gerganov | server : re-enable SWA speculative decoding (#14131) | |
| 184 | 2baf07727f921d9a4a1b63a2eff941e95d0488ed | 7ae2932116a4de3141cbc8c488f7f6e4e06d8171 | 2025-06-11T06:43:43-04:00 | Taylor | server : pass default --keep argument (#14120) | |
| 185 | 1f7d50b2936023b26eb218e944e62834b80a2ce0 | 4c763c8d1b4d4de20bf364ec1837430783cba984 | 2025-06-11T00:19:25-05:00 | Jeff Bolz | vulkan: Track descriptor pools/sets per-context (#14109) | |
| 186 | dad5c44398b78467943ed0a603ea427fe9f6fc62 | 55f6b9fa6563f6ae49113f9abdc980c12348cc1c | 2025-06-10T18:20:14-04:00 | compilade | kv-cache : avoid modifying recurrent cells when setting inputs (#13834) | |
| 187 | 2bb0467043258bdc58dbaefb33786f1731b38937 | b8e2194efc529378be45ab9b27d6648a5b81458a | 2025-06-10T02:41:01-04:00 | Isaac McFadyen | rpc : nicer error messages for RPC server crash (#14076) | |
| 188 | 87d34b381d5868e75586210ec17b5ef5deddc276 | b460d16ae858c6624fd37aec316622a4060ca325 | 2025-06-09T12:57:58+03:00 | Georgi Gerganov | server : fix LRU check (#14079) | |
| 189 | 228f34c9ceefa3ea4f4d6933edd858121e8106cb | 0974ad7a7cd4bca846b15c484ff3be890135a52c | 2025-06-07T18:58:20+05:30 | Akarshan Biswas | SYCL: Implement few same quantized type copy kernels (#13739) | |
| 190 | 745aa5319b9930068aff5e87cf5e9eef7227339b | 487a5e0401423bba02cd6e97e4d45131bb20b22b | 2025-06-06T14:11:15+03:00 | Georgi Gerganov | llama : deprecate llama_kv_self_ API (#14030) | |
| 191 | 7f37b6cf1e2c1b90bf0d9c8d91904b4b6c512748 | 3a077146a4761fdbd24bdd8eb098f46b8adc4dda | 2025-06-05T15:29:22+03:00 | Georgi Gerganov | memory : migrate from llama_kv_cache to more generic llama_memory (#14006) | |
| 192 | 363757628848a27a435bbf22ff9476e9aeda5f40 | ea394d7ab1f8101716d48ce9421c94c71b93a00f | 2025-06-02T21:34:40+03:00 | Georgi Gerganov | server : disable speculative decoding for SWA models (#13970) | |
| 193 | c9bbc77931d223ed7e7cbcf1cb057bc02fd0db19 | bfd322796cd838f906535ff3352624fc46338894 | 2025-06-02T10:15:44-07:00 | Olivier Chafik | `server`: update deepseek reasoning format (pass reasoning_content as diffs) (#13933) | |
| 194 | c04621711a893cbd09cff6c927cb005bc6749e36 | 0fc16b42e8793364918e830c234c1f3caec29dae | 2025-06-01T11:42:16+03:00 | Georgi Gerganov | parallel : fix n_junk == 0 (#13952) | |
| 195 | e15898d1c7e87f1b3d14e0a3c385eeb424b085fe | 803f8baf4f741d2f0465c46c33f285886b97a071 | 2025-05-31T08:26:10-07:00 | Olivier Chafik | server: allow unclosed thinking tags (#13931) | |
| 196 | 12d0188c0dc6146ffde6d277a93f232ccbe699f8 | eb3949938e82a128855bc0676220bb2ce6e4228d | 2025-05-31T10:24:04+03:00 | Georgi Gerganov | kv-cache : refactor + add llama_memory_state_i (#13746) | |
| 197 | dd665cc9d4b378626cde11ea0c4c91f514fdc994 | df0c0c7d02f951dc639d48fd536f79200460ac83 | 2025-05-30T19:38:07+03:00 | Georgi Gerganov | parallel : increase the variability of the prompt lengths (#13927) | |
| 198 | 53f925074de02c5304b00c14b4d6d8910c58667d | db38704f0133be7832123495fa8fc2601ea999d4 | 2025-05-30T16:25:45+03:00 | Georgi Gerganov | sync : vendor (#13901) | |
| 199 | 10961339b26bd2eff01d5479e8879f435da261b7 | d98f2a35fcf4a8d3e660ad48cd19e2a1f3d5b2ef | 2025-05-28T22:35:22+02:00 | Xuan-Son Nguyen | mtmd : move helpers to dedicated library (⚠️ breaking change) (#13866) | |
| 200 | c962ae3382a1e759c8517a229549ee53685313a1 | a3938fb53d0b5183db4f5a6db21fd9122a0e4780 | 2025-05-28T22:33:54+08:00 | Sky | server: fix remove 'image_url'/'input_audio' json-object effectlly for 'llama_params' in multimodal-model-mode (#13853) | |
| 201 | 952f3953c1b61cc70e79e536c42ddce6a5ea5ea7 | 81713121ee56755ba4a147d1a1e3fa248ec31a66 | 2025-05-27T04:05:18-07:00 | Diego Devesa | ggml : allow CUDA graphs when using pipeline parallelism (#13814) | |
| 202 | cdf94a18023c92f41808ec874ba577d914674717 | a26c4cc11ec7c6574e3691e90ecdbd67deeea35b | 2025-05-26T14:34:27-07:00 | Olivier Chafik | server: --offline mode (#13804) | |
| 203 | 03f582ae8fccecff225c30a2802461b44761e822 | 88c125f2acce0e25e5fc8481ab0681415fc64a10 | 2025-05-26T08:03:57-07:00 | Olivier Chafik | server: fix streaming crashes (#13786) | |
| 204 | d74e94c1b3ac02db01e47008e1f8d371029d81ac | f13847cfb560d92492b480cca2c5d6aa9473cde3 | 2025-05-26T06:56:49-07:00 | Olivier Chafik | `server`: fix format of streamed tool call deltas (diff name, fix id location) (#13800) | |
| 205 | f13847cfb560d92492b480cca2c5d6aa9473cde3 | 79c137f77677b3c8ee3c60a7da033721b938399a | 2025-05-26T06:16:37-07:00 | Olivier Chafik | server: fix regression on streamed non-chat completion w/ stops (#13785) | |
| 206 | e121edc4324a640be11b7e567edd39b721b0f8e4 | 2f099b510f460374acd52742b494595e3e3442d3 | 2025-05-26T00:30:51+01:00 | Olivier Chafik | `server`: add `--reasoning-budget 0` to disable thinking (incl. qwen3 w/ enable_thinking:false) (#13771) | |
| 207 | de2ef53a4b2c0d703749a309d19fe68fd8f1b9ac | c508256db2de2b032e19c8ed833f4683c827c9a1 | 2025-05-25T16:34:36+03:00 | Georgi Gerganov | kv-cache : rework kv_cell (#13706) | |
| 208 | d785f9c1fd1a1929c6d0e2a0b12cae5db867908b | 4032ca406632212b075e3c61c2a4476128321410 | 2025-05-25T10:45:49+01:00 | Olivier Chafik | server: fix/test add_generation_prompt (#13770) | |
| 209 | f5cd27b71da3ac375a04a41643d14fc779a8057b | a2d02d5793fd9af7a7224773456501691b95fd02 | 2025-05-25T01:48:08+01:00 | Olivier Chafik | `server`: streaming of tool calls and thoughts when `--jinja` is on (#12379) | |
| 210 | 9ecf3e66a38f20e41d221f62f05b17f70d040839 | faaaff5f947064d13ef8b98659d81a1384c3e57b | 2025-05-23T11:03:47+02:00 | Xuan-Son Nguyen | server : support audio input (#13714) | |
| 211 | 797990c4bca0dca5be295c63e3fb2800dc0a69c2 | ab86335760ebb441574eb47f886fa1ee302e2131 | 2025-05-22T20:42:48+02:00 | Xuan-Son Nguyen | mtmd : add ultravox audio input (#13623) | |
| 212 | cc74d5be990e37f201591fd868a92e64abdbf902 | 5be24af73d77ea23d399726f1d2a01a70ee86331 | 2025-05-22T16:33:39+03:00 | Georgi Gerganov | server : pad small embedding batches (#13692) | |
| 213 | 5fbfe384d4659f81c47a477eb8ee97692c7ffef9 | c76532e7ba128bb097bf6836bf0f5592e1b56b76 | 2025-05-21T19:46:56+03:00 | Georgi Gerganov | server : improve error reporting (#13680) | |
| 214 | c76532e7ba128bb097bf6836bf0f5592e1b56b76 | 2aa777d86d3f7bb80b93e226f1c25e47825f6a83 | 2025-05-21T19:40:35+03:00 | antichristHater | convert : add qwen2vl support for unsloth merges (#13686) | |
| 215 | 0d5c74216170ef97e5e7511563837263f2d1a496 | 42158ae2e8ead667a83f07247321ce85f32ace66 | 2025-05-21T15:15:27+02:00 | Robin Davidsson | server : Add the endpoints /api/tags and /api/chat (#13659) | |
| 216 | 42158ae2e8ead667a83f07247321ce85f32ace66 | 797f2ac0625b22edeff03cc30e0f988da6b6b068 | 2025-05-21T16:07:57+03:00 | Dorin-Andrei Geman | server : fix first message identification (#13634) | |
| 217 | a4090d1174aed22dde5cacce2a4c27656b987a2f | b69f1647f9953cb3773266d2c83a92fd0e7e6d66 | 2025-05-20T16:13:16+03:00 | Georgi Gerganov | llama : remove llama_kv_cache_view API + remove deprecated (#13653) | |
| 218 | e298d2fbd082a52c0f6ed02729f94e9bf630cf17 | f0adb80bf7c2c0d80abb04f4533b5513622d9964 | 2025-05-20T08:05:46+03:00 | Georgi Gerganov | kv-cache : add SWA support (#13194) | |
| 219 | f71f40a2847d4c9f57b86cd206e0a27b2bfb6d1c | d30cb5a7fa17362c47e94a023276f169916e0d03 | 2025-05-19T11:46:09+01:00 | Alberto Cabrera Pérez | ci : upgraded oneAPI version in SYCL workflows and dockerfile (#13532) | |
| 220 | 6a2bc8bfb7cd502e5ebc72e36c97a6f848c21c2c | e3a7cf6c5bf6a0a24217f88607b06e4405a2b5d9 | 2025-05-17T17:59:48-04:00 | Isaac McFadyen | server : added --no-prefill-assistant flag (#13608) | |
| 221 | 518329b2d4434d0683c30b741b4f4cf5734b5f99 | 2f5a4e1e09567e09be8b84a5f976334de9539d17 | 2025-05-17T12:58:55+03:00 | Georgi Gerganov | parallel : add option for non-shared and larger prompts (#13598) | |
| 222 | 6aa892ec2aa7fe0c93e87c4b970d83a942fb9454 | aea9f8b4e73876739bf88fb705502f291294e469 | 2025-05-16T21:50:00+02:00 | Xuan-Son Nguyen | server : do not return error out of context (with ctx shift disabled) (#13577) | |
| 223 | 3cc1f1f1d24472a6558c942b1c78989ff4b0e569 | c753d7bed0dc2cc2d5c42dfa9806cba91748392e | 2025-05-15T14:24:50+02:00 | Xuan-Son Nguyen | webui : handle PDF input (as text or image) + convert pasted long content to file (#13562) | |
| 224 | c753d7bed0dc2cc2d5c42dfa9806cba91748392e | b2838049ccf50859cea4c390e81405c2fb01e820 | 2025-05-15T08:40:58+02:00 | Piotr Wilkin (ilintar) | server : proper error handling for missing elements in messages array (OpenAI compatible backend) (#13540) | |
| 225 | aa48e373f256df9608395ee6881e7010840d6202 | e3a9421b78da5c810d812e6348a405f5acc39f34 | 2025-05-15T02:39:51+01:00 | Olivier Chafik | `server`: inject date_string in llama 3.x template + fix date for firefunction v2 (#12802) | |
| 226 | 053174436f3b3cbb01077f26ff17809537b832c7 | 360a9c98e13d35f322b4c5b1309aab0cc90ed82b | 2025-05-14T15:42:10+03:00 | Georgi Gerganov | server : passthrough the /models endpoint during loading (#13535) | |
| 227 | 360a9c98e13d35f322b4c5b1309aab0cc90ed82b | 09d13d94fb169093095416ac6323551c37b75339 | 2025-05-14T13:35:07+02:00 | Xuan-Son Nguyen | server : fix cache_tokens bug with no cache_prompt (#13533) | |
| 228 | d486dd3e8ecfba0170f8632a1530540de560f4a3 | 21ca987fba504d273ea28ebc4d3e5b3736a11c8e | 2025-05-14T10:07:31+02:00 | Luca Stefani | webui: Allow pasting file from clipboard (#13526) | |
| 229 | 71bdbdb58757d508557e6d8b387f666cdfb25c5e | f0995d28ce3d15095b6845d94ce4465e46575873 | 2025-05-13T17:07:21+02:00 | Xuan-Son Nguyen | clip : clip.h become private API (⚠️ breaking change) (#13510) | |
| 230 | 91159ee9df84edb72ccf874e353d2414f3a8c60d | 22cdab343b63edd0906f1c132616746085f81983 | 2025-05-12T18:56:42+07:00 | Anudit Nagar | server : allow content to be null in oaicompat_completion_params_parse (#13477) | |
| 231 | 9a390c4829cd3058d26a2e2c09d16e3fd12bf1b1 | 09232370fc6426aa5dd9be01a8271b9c28f5af3a | 2025-05-11T11:08:26-04:00 | Anthony Umfer | tools : fix uninitialized llama_batch in server (#13436) | |
| 232 | 3b24d26c22b9d92b5aa39930988700c84e524cf4 | 43dfd741a5da77982e0a94d1e522a2481dfb914d | 2025-05-10T18:44:49+02:00 | Xuan-Son Nguyen | server : update docs (#13432) | |
| 233 | 33eff4024084d1f0c8441b79f7208a52fad79858 | 17512a94d636c4b6c1332370acb3e5af3ca70918 | 2025-05-09T19:29:37+02:00 | Xuan-Son Nguyen | server : vision support via libmtmd (#12898) | |
| 234 | b486ba05bf973aae3652b3fd593e0b257d3a41d4 | 02115dcd9a6d0c03b527d5bee8c1493ab819ddbd | 2025-05-09T10:31:07+03:00 | Radoslav Gerganov | rpc : add rpc_msg_set_tensor_hash_req (#13353) | |
| 235 | d9c4accaff30926e8a5fd8a2429e549158a845e0 | 15e03282bb432631193464100c2237a3b6bcfe4c | 2025-05-09T09:06:37+02:00 | Xuan-Son Nguyen | server : (webui) rename has_multimodal --> modalities (#13393) | |
| 236 | ee01d71e585f4a17ae83ec55d77acfdcf0bfa798 | 8c83449cb780c201839653812681c3a4cf17feed | 2025-05-08T18:51:45+02:00 | Xuan-Son Nguyen | server : (webui) fix a very small misalignment (#13387) | |
| 237 | 8c83449cb780c201839653812681c3a4cf17feed | 1a844be132dbe865358e1de81136920c1d35ac73 | 2025-05-08T15:37:29+02:00 | Xuan-Son Nguyen | server : (webui) revamp the input area, plus many small UI improvements (#13365) | |
| 238 | 233461f8121455f957a47e6a22a77b3bc88277b0 | b34c859146630dff136943abc9852ca173a7c9d6 | 2025-05-05T17:12:19-03:00 | oobabooga | sampling : Integrate Top-nσ into main sampling chain (and add it to the server) (#13264) | |
| 239 | b34c859146630dff136943abc9852ca173a7c9d6 | 9b61acf06041dcbaff6afa5f28940e93297f8520 | 2025-05-05T17:03:31+03:00 | igardev | server : Webui - change setText command from parent window to also send the message. (#13309) | |
| 240 | 27aa2595321c4d9cc4086a8e67bdea204b8309b0 | 9fdfcdaeddd1ef57c6d041b89cd8fb7048a0f028 | 2025-05-04T23:43:42+02:00 | Xuan-Son Nguyen | mtmd : add C public API (#13184) | |
| 241 | fab647e8842c5f80da7e8f2c625dab6a0e19e5d4 | dcf886007de4b8e5200f461a13233315f897fb9d | 2025-05-02T09:48:31+03:00 | Georgi Gerganov | server : add cache reuse card link to help (#13230) | |
| 242 | e2e1ddb93a01ce282e304431b37e60b3cddb6114 | d9d398f84f96d16c308d4976f5e90222ecc2a492 | 2025-04-29T20:33:10+02:00 | matteo | server : Prefilling assistant message in openai compatible API (#13174) | |
| 243 | 43ddab6eeeaab5a04fe5a364af0bafb0e4d35065 | 1831f538f720d1d99fba146f24f0a8e970838cc4 | 2025-04-28T21:00:20+03:00 | Ville Vesilehto | fix(rpc): Improve input validation and error handling (#13069) | |
| 244 | 77d5e9a76a7b4a8a7c5bf9cf6ebef91860123cba | d5fe4e81bd447124836ecfb47d794f8768665b9f | 2025-04-26T22:05:31+08:00 | SXX | ggml: move fp16/bf16 conversion optimizations to CPU backend + export conversion APIs (#13107) | |
| 245 | ab47dec3d37aa1927c2ec590e166b76141374ed3 | 7b53389c24a507564be39e1ea82746a39749059b | 2025-04-22T16:16:10+03:00 | Georgi Gerganov | security : add note about RPC and server functionality (#13061) | |
| 246 | 35370ba94593c3abc9550328377d461fc4f822b7 | 8d6600576318dfc6b091fca744b0fd36a5e5255f | 2025-04-18T19:58:12+02:00 | Xuan-Son Nguyen | server : use std::move whenever possible (#12936) | |
| 247 | b9154ecff93ff54dc554411eb844a2a654be49f2 | 2db9ba1464f3de0aceb2b5289963e69fc369cb66 | 2025-04-18T10:04:51+02:00 | Xuan-Son Nguyen | mtmd : add methods to access `mtmd_image_tokens` (#12906) | |
| 248 | 2db9ba1464f3de0aceb2b5289963e69fc369cb66 | 2f74c354c0f752ed9aabf7d3a350e6edebd7e744 | 2025-04-18T10:13:42+03:00 | Radoslav Gerganov | rpc : add RPC_CMD_HELLO (#12955) | |
| 249 | c94085df2871d2cad11f6411304d7798d7dd4cdd | e8a62631b3b05bcf2ad0e0c686881a9f3e3f03ca | 2025-04-11T23:37:41+03:00 | Georgi Gerganov | server : add VSCode's Github Copilot Chat support (#12896) | |
| 250 | e8a62631b3b05bcf2ad0e0c686881a9f3e3f03ca | b6930ebc421e20399663bbd3bc7b7266d5236d06 | 2025-04-11T13:04:14-07:00 | yuri@FreeBSD | rpc : Set cache directory in rpc-server.cpp on FreeBSD (#12903) | |
| 251 | 578754b3157d662c2fdd51eaa62b6c1f43d3172c | b2034c2b55b36b2192bdefb3b295db2a911370f5 | 2025-04-11T15:32:14+02:00 | Ewan Crawford | sycl: Support sycl_ext_oneapi_limited_graph (#12873) | |
| 252 | 8b9cc7cdd8a0dcf0176c60c755322c95b5965299 | 64eda5deb9859e87a020e56bab5d2f9ca956f1de | 2025-04-10T22:57:16+02:00 | Xuan-Son Nguyen | llava : introduce libmtmd (#12849) | |
| 253 | 64eda5deb9859e87a020e56bab5d2f9ca956f1de | fe5b78c89670b2f37ecb216306bed3e677b49d9f | 2025-04-10T17:24:44+02:00 | Xuan-Son Nguyen | convert : ability to lazy-load safetensors remotely without downloading to disk (#12820) | |
| 254 | a19b5cef16d885c44c635da4a5c97113c1577de8 | 78a1ba0a4f2bfed5b8b8e312592143d22e531698 | 2025-04-08T19:54:51+03:00 | Georgi Gerganov | llama : fix FA when KV cache is not used (i.e. embeddings) (#12825) | |
| 255 | 78a1ba0a4f2bfed5b8b8e312592143d22e531698 | 2dabf759e7c8c827d38cdd18d0792070e6a4f4e1 | 2025-04-08T18:37:06+02:00 | Xuan-Son Nguyen | server : fix thread.join() on exit (#12831) | |
| 256 | 8ca6e1c3a4deb6bb27ee294bfd5706098d94ae88 | 656babd6c21a3b9b3622324cfcc80a2ab78da25b | 2025-04-08T14:14:59+05:00 | characharm | server : webui : Improve Chat Input with Auto-Sizing Textarea (#12785) | |
| 257 | b7723942970b70412793f1926a35cfb93d5c157c | 23106f94ea2bc3da929afb7330655fd5515d08dc | 2025-04-04T09:09:52-05:00 | Nauful Shaikh | server : webui : Upgrade daisyui, tailwindcss. (#12735) | |
| 258 | a10b36c91a091f4606710fba4e9327fd71e0e738 | 83a88bd6affbe148a622ac730952ac5b8b585979 | 2025-04-02T14:32:59+03:00 | Georgi Gerganov | llama : refactor kv cache guard (#12695) | |
| 259 | 3891e183c61c1e25c2c61afe68d7b95019ea3f89 | af6ae1efb27a9a7c3f7f7f84639d2243f7303ac1 | 2025-03-20T07:02:18+01:00 | Daniel Bevenius | examples : command.wasm updates (whisper/2904) | |
| 260 | 5d01670266859444366e4f333ade5e0e5e2ae63d | ef03229ff423dd1991f4f44ef1352f03334d86eb | 2025-03-28T01:05:44-07:00 | Benson Wong | server : include speculative decoding stats when timings_per_token is enabled (#12603) | |
| 261 | 2099a9d5dbdcd2841d02dd396a71d0de70bf4490 | 296901983700f3c37449bcb555d85d27150a679d | 2025-03-27T23:41:04+01:00 | Piotr | server : Support listening on a unix socket (#12613) | |
| 262 | 77f9c6bbe55fccd9ea567794024cb80943947901 | 18b663d8e4ef352a9a15ff15d695fc3258801d60 | 2025-03-23T19:30:26+01:00 | Marius Gerdes | server : Add verbose output to OAI compatible chat endpoint. (#12246) | |
| 263 | 517b5ddbf002b91fd6d6daf5d8db8c88a0173039 | a9b59288e222f39fc0311dc66944ed5a86c815fa | 2025-03-20T01:22:06+05:30 | Gaurav Garg | CUDA: Improve flash decoding kernel GPU occupancy for BS=1 case (#12183) | |
| 264 | 810e0af3f50379682dd46b7967c4aadf3f8286f6 | eba92d64c3f6d86de2e6b4dd3a540d2805a22b0c | 2025-03-18T12:05:42+02:00 | Georgi Gerganov | server : fix warmup draft cache type (#12446) | |
| 265 | 7dfad387e3f6ac98d383ded2d175eb59736a3993 | 60c902926c928f9c2cd6390ce411876f92feeaf3 | 2025-03-18T07:27:50+08:00 | Molly Sophia | llama: Add support for RWKV v7 architecture (#12412) | |
| 266 | b1b132efcba216c873715c483809730bb253f4a1 | 01e8f2138b2e40902afe2983ecbf503a08d74b1d | 2025-03-17T23:55:13+05:30 | Gaurav Garg | cuda : enable CUDA Graph on CUDA Toolkit < 12.x (#12394) | |
| 267 | 8fcb563613e20a04dd9791f0a9b8a41086428c09 | add2a3aa5a1571211aa5c7303b8e80c8d1824b91 | 2025-03-14T13:47:05+01:00 | fairydreaming | Load all MoE experts during warmup (#11571) | |
| 268 | 2048b5913d51beab82dfe29955f9008130b936c0 | f08f4b3187b691bb08a8884ed39ebaa94e956707 | 2025-03-13T06:10:05-04:00 | Ishaan Gandhi | server : fix crash when using verbose output with input tokens that are not in printable range (#12178) (#12338) | |
| 269 | 4e39a3c332f84b890e91353ec448502cb8373a6f | be421fc429795d135786f5a0e489709220a9c43a | 2025-03-10T10:59:03Z | Olivier Chafik | `server`: extract <think> tags from qwq outputs (#12297) | |
| 270 | 1e2f78a00450593e2dfa458796fcdd9987300dfc | 0fd7ca7a210bd4abc995cd728491043491dbdef7 | 2025-03-09T19:08:20+02:00 | Georgi Gerganov | server : add speculative decoding presets for FIM (#12287) | |
| 271 | 7ab364390f92b0b8d83f69821a536b424838f3f8 | 7c7f3b7f435f41f2508e0e3010f0013cd8335156 | 2025-03-07T20:54:30+02:00 | Georgi Gerganov | server : infill gen ends on new line (#12254) | |
| 272 | 8fad3c7a7c54a25a1ca38dfb08244df55288e675 | 7cf64f6beecf54c6ac71503181f154667fd4228a | 2025-03-07T11:15:33+01:00 | Sigbjørn Skjæret | server : Log original chat template parsing error (#12233) | |
| 273 | 06a92a193a07afe445929607be9d5e4d033956fb | a057897ad4e48e3df0354256e0cc80dadcb57595 | 2025-03-05T15:25:45+08:00 | Clauszy | server : fix cache reuse logic (#12161) | |
| 274 | 1a24c4621f0280306b0d53a4fa474fc65d3f1b2e | becade5de77674696539163dfbaf5c041a1a8e97 | 2025-03-04T06:24:07Z | Olivier Chafik | `server`: fix deadly typo in response_format.json_schema.schema handling (#12168) | |
| 275 | 2679c3b55d1c9c3fed56dea00fea713622e42594 | c43af9276b119dae7436b7878d59671d0f6b1a97 | 2025-03-03T16:17:36+01:00 | Daniel Bevenius | ci : set GITHUB_ACTION env var for server tests (#12162) | |
| 276 | 9660ffef582ca275092b621c87085a6eea136a90 | c950a1f69269bff416d74349a82d78181ce6f0f8 | 2025-03-03T20:54:08+08:00 | ag2s20150909 | ggml : fix kleidiai build (#12159) | |
| 277 | 70680c48e5f77d2d3138712a6582bd8c1e548922 | c43a3e7996e585e2addde1e44057a4f3cdbadef8 | 2025-02-28T05:41:47-08:00 | William Tambellini | ggml : upgrade init_tensor API to return a ggml_status (#11854) | |
| 278 | d7cfe1ffe0f435d0048a6058d529daf76e072d9c | a82c9e7c23ef6db48cebfa194dc9cebbc4ac3552 | 2025-02-25T18:52:56Z | Olivier Chafik | docs: add docs/function-calling.md to lighten server/README.md's plight (#12069) | |
| 279 | 401af80b546005a06854827b732e3b46979ae028 | c132239bfbc1aae3a96dfee3350afcb491f64ade | 2025-02-25T11:52:52Z | rhjdvsgsgks | server: handle echo=false on /v1/completions (#12060) | |
| 280 | 0b52745649062c04b546aab662cfdb220f4f0621 | 4d1051a40ffc2fdff80bc532eea5b9568b85c156 | 2025-02-25T10:40:22Z | Olivier Chafik | server: support add_generation_prompt query param (#12062) | |
| 281 | 3e9a2860e996657fc10db8393cf65adc40703082 | 58d07a8043a1395177cf77b3e4f388e34182ae64 | 2025-02-25T01:29:33-08:00 | Vitali Lovich | llama : expose llama_model_n_head_kv in the API (#11997) | |
| 282 | 7a2c913e66353362d7f28d612fd3c9d51a831eda | 08d5986290cc42d2c52739e046642b8252f97e4b | 2025-02-24T09:09:51-07:00 | Alex Brooks | llava : Add Granite Vision Support (#11794) | |
| 283 | cf756d6e0a314e0fe25ff944341d79ea8c94cc96 | d70908421ff22b013e8209f2d12e5c750663c620 | 2025-02-22T12:46:31+02:00 | Georgi Gerganov | server : disable Nagle's algorithm (#12020) | |
| 284 | c392e5094deaf2d1a7c18683214f007fad3fe42b | c5d91a74006c49376590ef2b67420bc7ce206397 | 2025-02-21T03:43:22+09:00 | momonga | server (webui): Fix Premature Submission During IME Conversion (#11971) | |
| 285 | d07c621393fab6cf32f3add2aa65e4d5331d4a67 | abd4d0bc4f1a9a0e429bc8ee0d5ece2a394a0a39 | 2025-02-19T12:29:52+01:00 | Daniel Bevenius | common : add llama.vim preset for Qwen2.5 Coder (#11945) | |
| 286 | b58934c1836b5ea51dbacbe899eee125775e77c9 | 63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d | 2025-02-19T00:01:44+02:00 | igardev | server : (webui) Enable communication with parent html (if webui is in iframe) (#11940) | |
| 287 | 63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d | 63ac12856303108ee46635e6c9e751f81415ee64 | 2025-02-18T18:03:23Z | Olivier Chafik | tool-call: refactor common chat / tool-call api (+ tests / fixes) (#11900) | |
| 288 | 63ac12856303108ee46635e6c9e751f81415ee64 | 5137da7b8c3eaa090476a632888ca178ba109f8a | 2025-02-18T14:21:41+01:00 | Xuan-Son Nguyen | server : add TEI API format for /rerank endpoint (#11942) | |
| 289 | 09aaf4f1f5b69b5173b7fcd24eab96729f6b242a | 73e2ed3ce3492d3ed70193dd09ae8aa44779651d | 2025-02-18T17:12:49+08:00 | xiaobing318 | docs : Fix duplicated file extension in test command (#11935) | |
| 290 | c4d29baf3236b011730b6ccaae6852e781fb1b91 | 2eea03d86a2d132c8245468c26290ce07a27a8e8 | 2025-02-17T11:25:12+01:00 | Antoine Viallon | server : fix divide-by-zero in metrics reporting (#11915) | |
| 291 | 0f2bbe656473177538956d22b6842bcaa0449fab | fe163d5bf3fb8e99c96ff6d21775fa3d1daee3cf | 2025-02-16T18:11:22+01:00 | Xuan-Son Nguyen | server : bump httplib to 0.19.0 (#11908) | |
| 292 | f3552296924e704c11ca936907b9cad7873db8e2 | fc1b0d0936e4dfc52a81f38e7420c7d23f6caa88 | 2025-02-15T10:11:36Z | Olivier Chafik | server: fix type promotion typo causing crashes w/ --jinja w/o tools (#11880) | |
| 293 | c1f958c0381e797135b7d42a677542133264193c | c48f630d1c1942fce08aa7cb18a53ace443cd611 | 2025-02-13T17:22:44+01:00 | Reza Rahemtola | server : (docs) Update wrong tool calling example (#11809) | |
| 294 | c48f630d1c1942fce08aa7cb18a53ace443cd611 | bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c1 | 2025-02-13T14:46:59+01:00 | Daniel Bevenius | llama : add --completion-bash option (#11846) | |
| 295 | c7f460ab882065ec5696e3d51e24dbf67b539287 | 27e8a23300e30cd6ff6107ce262acf832ca60597 | 2025-02-13T10:05:16Z | Olivier Chafik | `server`: fix tool-call of DeepSeek R1 Qwen, return reasoning_content (Command 7RB & DeepSeek R1) unless `--reasoning-format none` (#11607) | |
| 296 | e4376270d971cff7992bdb6c5412a739195b1459 | 3e693197724c31d53a9b69018c2f1bd0b93ebab2 | 2025-02-13T01:25:34-05:00 | Oleksandr Kuvshynov | llama.cpp: fix warning message (#11839) | |
| 297 | a394039db004c6ee00098250d160b5aa018c2314 | be3bbd62153820ff6d358c817360927f429105c4 | 2025-02-13T01:02:38+01:00 | Diego Devesa | ggml-cpu : add chunking support to mul_mat_id (#11666) | |
| 298 | 31afcbee0eebbc998ab311aa314e389d60aa2127 | 5c4284d57bbc613121e90de5271f1cbc95d55872 | 2025-02-12T22:47:11Z | Woof Dog | server : (webui) Give copy button back to all message bubbles (#11814) | |
| 299 | a18f481f99962638092d6f1c98b1d34d3e3256de | b9ab0a4d0b2ed19effec130921d05fb5c30b68c5 | 2025-02-11T14:06:45+01:00 | Daniel Bevenius | server : use common_token_to_piece instead of common_detokenize (#11740) | |
| 300 | 507f9174fe856772b6c7c17e81be442de7ee6d1e | 19b392d58dc08c366d0b29bd3b9c6991fa4e1662 | 2025-02-10T21:23:17+01:00 | Xuan-Son Nguyen | server : (webui) introduce conversation branching + idb storage (#11792) | |
| 301 | 0893e0114e934bdd0eba0ff69d9ef8c59343cbc3 | d7b31a9d84297b493a61c9a8ee3a458e7ccc64a7 | 2025-02-10T18:03:28+01:00 | Xuan-Son Nguyen | server : correct signal handler (#11795) | |
| 302 | 55ac8c7791ff44aeb82bd7fe3ca2041844fc77f1 | e6e658319952f7ad269dc11275b9edddc721fc6d | 2025-02-08T21:54:50+01:00 | Xuan-Son Nguyen | server : (webui) revamp Settings dialog, add Pyodide interpreter (#11759) | |
| 303 | e6e658319952f7ad269dc11275b9edddc721fc6d | aaa55053076f3d5d7da4d9a877cb77e112dabed4 | 2025-02-08T19:09:55Z | Woof Dog | server : (webui) increase edit textarea size (#11763) | |
| 304 | aaa55053076f3d5d7da4d9a877cb77e112dabed4 | bdcf8b6a56f4d49d3420ae5b21cdf9a116040551 | 2025-02-08T18:08:43+02:00 | Georgi Gerganov | server : minor log updates (#11760) | |
| 305 | 0cf867160ca9d492e06c0bc688b337cffd1eb187 | d2fe216fb2fb7ca8627618c9ea3a2e7886325780 | 2025-02-08T10:42:34+01:00 | Xuan-Son Nguyen | server : (webui) fix numeric settings being saved as string (#11739) | |
| 306 | 2d219b389e8c8c40bce547b08c8aa7add60fde1f | 333820d7491cd31c707a340ff23b984a84e40154 | 2025-02-07T08:55:47-05:00 | Christian Fillion | vocab : ignore invalid UTF-8 input in the BPE tokenizer (#11729) | |
| 307 | 7ee953a64a40c09438b2064539becdbc577cefd0 | ec3bc8270bc67b58955748d40a3e558a05b2d8f2 | 2025-02-07T04:33:27-05:00 | Christian Fillion | llama : add llama_sampler_init for safe usage of llama_sampler_free (#11727) | |
| 308 | b7552cfcbc7defccd8bdefd0a7b9c47d145ed3d7 | 225bbbfa39930cda38a2e5d1f3e5b38226732009 | 2025-02-07T09:15:22+01:00 | Daniel Bevenius | common : add default embeddings presets (#11677) | |
| 309 | 1d20e53c40c3cc848ba2b95f5bf7c075eeec8b19 | 2fb3c32a1634488a5265d1304ab37628eeb5480d | 2025-02-06T09:29:13-05:00 | Patrick Peng | rpc: fix known RCE in rpc-server (ggml/1103) | |
| 310 | 2fb3c32a1634488a5265d1304ab37628eeb5480d | 9ab42dc722ad19a12af80f38a06474d498f96da3 | 2025-02-06T17:32:29+01:00 | Xuan-Son Nguyen | server : (webui) migrate project to ReactJS with typescript (#11688) | |
| 311 | 902368a06b915b860236cfc97ff885b2aceae256 | c3db0480bb820e120249014b380e1f4badf2a1c1 | 2025-02-05T19:52:31-06:00 | Charles Duffy | metal : avoid breaking build when metal API predates TARGET_OS_VISION (#11690) | |
| 312 | 3962fc1a7956dd0afacfbce10fd1a3ffd3ad857e | 1bef571f6a23c36a26dabacba631763f9a893b83 | 2025-02-04T18:25:42+01:00 | Xuan-Son Nguyen | server : add try..catch to places not covered by set_exception_handler (#11620) | |
| 313 | db288b60cb49eab69703f995379b8d75c18bf5b3 | 106045e7bb8db481bb2ebbc60e3b53cb27ada117 | 2025-02-04T15:48:53Z | Olivier Chafik | `tool-call`: command r7b fix for normal responses (#11608) | |
| 314 | f117d84b48104992ba16961b35a96fa93efbb355 | 534c46b53c23613628d72e93c63ea01ea4d1e2ac | 2025-02-04T19:15:24+08:00 | Jhen-Jie Hong | swift : fix llama-vocab api usage (#11645) | |
| 315 | b3451785aca16fbf4214eeba7e4612676cdf8ccb | 1d1e6a90bcf485ad2dee309c31cf19bd802465e5 | 2025-02-04T00:10:52+01:00 | Xuan-Son Nguyen | server : (webui) revert hacky solution from #11626 (#11634) | |
| 316 | 1d1e6a90bcf485ad2dee309c31cf19bd802465e5 | 5598f475be3e31430fbe17ebb85654ec90dc201e | 2025-02-03T22:16:27Z | Woof Dog | server : (webui) allow typing and submitting during llm response (#11626) | |
| 317 | 5598f475be3e31430fbe17ebb85654ec90dc201e | 8ec05832fa8409c49b3bbd13f957c6ae8486e618 | 2025-02-03T16:45:38+01:00 | Daniel Bevenius | server : remove CPPHTTPLIB_NO_EXCEPTIONS define (#11622) | |
| 318 | d92cb67e37abc23b1c6f7b0ef27a9889da8537e3 | 6eecde3cc8fda44da7794042e3668de4af3c32c6 | 2025-02-03T09:42:55Z | mashdragon | server : (webui) Fix Shift+Enter handling (#11609) | |
| 319 | ff227703d6d6e1888bdc7af6138514092ffcdb96 | 0cec062a638700495673f5494d200b74340538be | 2025-02-01T23:55:32-08:00 | Michał Moskal | sampling : support for llguidance grammars (#10224) | |
| 320 | a83f528688324a21484a97af1d1be5e1bc8d4c8e | b1bcd309fc8ac929cbd4a6207b3a19886bda031f | 2025-01-31T14:15:25Z | Olivier Chafik | `tool-call`: fix llama 3.x and functionary 3.2, play nice w/ pydantic_ai package, update readme (#11539) | |
| 321 | 4a2b196d03d52da31236390e9f5694a88d43d11d | 1bd3047a939e561adfb3c7dd2e17c4cc7a4e4e6f | 2025-01-31T08:12:40Z | Olivier Chafik | server : fix --jinja when there's no tools or schema (typo was forcing JSON) (#11531) | |
| 322 | a2df2787b32e0846205f7151dfad88ceab592beb | 553f1e46e9e864514bbd6bf4009146db66be0541 | 2025-01-31T06:04:53+01:00 | Daniel Bevenius | server : update help metrics processing/deferred (#11512) | |
| 323 | 4314e56c4f8c5091f45732f39bd94c0c6c323798 | 496e5bf46bab757d05e18227cb4e17055ae42f42 | 2025-01-30T11:05:00+01:00 | Daniel Bevenius | server : use lambda instead of std::bind (#11507) | |
| 324 | 496e5bf46bab757d05e18227cb4e17055ae42f42 | 7919256c57f05c09b0b50ec9abb37ff62dab7251 | 2025-01-30T04:11:53-05:00 | Isaac McFadyen | server : (docs) added response format for /apply-template [no ci] (#11503) | |
| 325 | e0449763a4f335cca374254a72892141f41eaa59 | eb7cf15a808d4d7a71eef89cc6a9b96fe82989dc | 2025-01-30T05:48:14+01:00 | Daniel Bevenius | server : update json snippets in README.md [no ci] (#11492) | |
| 326 | eb7cf15a808d4d7a71eef89cc6a9b96fe82989dc | 66ee4f297cff3c7ce98b31dbc0ce909d41b9e408 | 2025-01-29T12:45:44-06:00 | Nigel Bosch | server : add /apply-template endpoint for additional use cases of Minja functionality (#11489) | |
| 327 | e51c47b401f8cb5f21630a05171e2529cde4d186 | 2711d0215ff6a1ecb2202ac8c1f135bceed7057b | 2025-01-29T16:34:18+01:00 | Daniel Bevenius | server : update auto gen files comments [no ci] (#11484) | |
| 328 | cf8cc856d7d02165bd08593b4757e1256a62d501 | d0c08040b6c8bebeade7b8d5764df6cf901678d5 | 2025-01-28T16:03:42-07:00 | peidaqi | server : Fixed wrong function name in llamacpp server unit test (#11473) | |
| 329 | 49b0e3cec4b67dc9f4debe3a16acd4c819f751d6 | 20a758155bc5f37290b20ea44d76ba99c4e7f2cb | 2025-01-25T16:36:44+01:00 | Xuan Son Nguyen | server : fix cleaning up stream task (#11418) | |
| 330 | c07e87f38bd0c22ec6dbc852ae50aaa1c64632d4 | 564804b79b78df1469ec8646869972de5e885ec4 | 2025-01-24T09:02:38+01:00 | stduhpf | server : (webui) put DeepSeek R1 CoT in a collapsible <details> element (#11364) | |
| 331 | 58456616408c828a1ce6d2481940fd1c97bce3b5 | f211d1dc10332b7e89a4abd1041903fa63bfed27 | 2025-01-23T13:56:05+01:00 | Xuan Son Nguyen | server : add more clean up when cancel_tasks is called (#11340) | |
| 332 | 12c2bdf2de34f747d13b270fc9d3b52490bf194f | c64d2becb13f2a7c0145b516a05f028d949a046b | 2025-01-22T17:44:40+01:00 | Diego Devesa | server : fix draft context not being released (#11354) | |
| 333 | 6171c9d25820ccf676b243c172868819d882848f | e28245f35f2faaf249dd352998b3693a8cc28c51 | 2025-01-21T13:18:51Z | Olivier Chafik | Add Jinja template support (#11016) | |
| 334 | f30f099228f774209aa3010b78dfbe5d262e69aa | f26c87417999209e7f4576b4f3ecf7a5b9c66a29 | 2025-01-18T14:12:05+01:00 | Xuan Son Nguyen | server : implement cancellable request (#11285) | |
| 335 | 0ccd7f3eb2debe477ffe3c44d5353cc388c9418d | f446c2cf6a56a750b67c967505e717a996d2f2fd | 2025-01-15T05:44:38+01:00 | Daniel Bevenius | examples : add embd_to_audio to tts-outetts.py [no ci] (#11235) | |
| 336 | c5bf0d1bd7eb8762edca47e0a95f64e6fbfaf5b1 | 091592d758cb55af7bfadd6c397f61db387aa8f3 | 2025-01-14T14:09:33+03:30 | ebraminio | server : Improve code snippets direction between RTL text (#11221) | |
| 337 | 504af20ee4eae72080a56d59d744f6774f7901ce | 84a44815f704aaed8e8edec7a39e846a975c7ba9 | 2025-01-13T22:53:31+03:30 | ebraminio | server : (UI) Improve messages bubble shape in RTL (#11220) | |
| 338 | 437e05f714cdd67757405221578d3f95f8228b63 | ca001f6656c1c3d29ef479b3aa5d669453e63be5 | 2025-01-13T17:16:39+03:30 | ebraminio | server : (UI) Support for RTL text as models input or output (#11208) | |
| 339 | afa8a9ec9b520137bbd1ca6838cda93ee39baf20 | c05e8c9934f94fde49bc1bc9dc51eed282605150 | 2025-01-12T11:32:42+02:00 | Georgi Gerganov | llama : add `llama_vocab`, functions -> methods, naming (#11110) | |
| 340 | 8eceb888d7b7f5e93d20a4f85ca6511022b87040 | f8feb4b01af374ad2fce302fd5790529c615710b | 2025-01-09T11:28:29+01:00 | Daniel Bevenius | server : add tooltips to settings and themes btn (#11154) | |
| 341 | 53ff6b9b9fb25ed0ec0a213e05534fe7c3d0040f | 017cc5f446863316d05522a87f25ec48713a9492 | 2025-01-07T18:01:58+01:00 | Johannes Gäßler | GGUF: C++ refactor, backend support, misc fixes (#11030) | |
| 342 | e6e7c75d94adf4d39e846d30807c531ff22865e7 | 09186fabbe05236f2b9446ba6c643cb737540d10 | 2025-01-06T15:36:08+02:00 | Georgi Gerganov | server : fix extra BOS in infill endpoint (#11106) | |
| 343 | 6369f867a410416239d9f20ec27c2b1d6a9fee52 | 47182dd03fe04a4ffda5d7f4c8a109ae0056cf56 | 2025-01-06T10:28:17+01:00 | Daniel Bevenius | llama : rename missed batch params/vars to ubatch (#10059) | |
| 344 | 47182dd03fe04a4ffda5d7f4c8a109ae0056cf56 | 3e6e7a6bc2c4b980a0cf0fcb5cb3b79a965b5f14 | 2025-01-06T10:55:18+02:00 | Georgi Gerganov | llama : update llama_model API names (#11063) | |
| 345 | 2f0ee84b9b02d2a98742308026f060ebdc2423f1 | 0da5d860266c6928b8c9408efbd264ae59fedda6 | 2025-01-02T18:06:12+01:00 | Pierrick Hymbert | server: bench: minor fixes (#10765) | |
| 346 | 0da5d860266c6928b8c9408efbd264ae59fedda6 | a45433ba209ee0b33d02c7dc4c31f29894ad83a6 | 2025-01-02T15:05:18+01:00 | Xuan Son Nguyen | server : allow using LoRA adapters per-request (#10994) | |
| 347 | 45095a61bfd164e87563a0dc0fbd7b0e9891590b | 5896c65232c7dc87d78426956b16f63fbf58dcf6 | 2024-12-31T15:22:01+01:00 | Xuan Son Nguyen | server : clean up built-in template detection (#11026) | |
| 348 | 5896c65232c7dc87d78426956b16f63fbf58dcf6 | bc7b1f86324279a3dabb705c04ad754a2b27df16 | 2024-12-31T12:34:13+01:00 | Xuan Son Nguyen | server : add OAI compat for /v1/completions (#10974) | |
| 349 | f865ea149d71ef883e3780fced8a20a1464eccf4 | 16cdce7b68218959e0658e2f95b4572573d5008e | 2024-12-28T10:09:19-05:00 | Isaac McFadyen | server: added more docs for response_fields field (#10995) | |
| 350 | 16cdce7b68218959e0658e2f95b4572573d5008e | d79d8f39b4da6deca4aea8bf130c6034c482b320 | 2024-12-28T15:08:54Z | Alexey Parfenov | server : fix token duplication when streaming with stop strings (#10997) | |
| 351 | 09fe2e76137dde850b13313f720e7ffa17efdefa | 30caac3a68a54de8396b21e20ba972554c587230 | 2024-12-24T19:39:49+03:00 | NeverLucky | server: allow filtering llama server response fields (#10940) | |
| 352 | 14b699ecde8f1e9e251ebff9eca39ebc5603b83b | 485dc01214f266afff7004bc702498b491abc404 | 2024-12-23T12:52:25+01:00 | Xuan Son Nguyen | server : fix missing model id in /model endpoint (#10957) | |
| 353 | 485dc01214f266afff7004bc702498b491abc404 | 86bf31cfe684849157f0875b4f0ebccac7034547 | 2024-12-23T12:02:44+01:00 | Xuan Son Nguyen | server : add system_fingerprint to chat/completion (#10917) | |
| 354 | 86bf31cfe684849157f0875b4f0ebccac7034547 | b92a14a841fb4dfaf27b29d982ec8ba5289a3bff | 2024-12-23T10:39:30+02:00 | Radoslav Gerganov | rpc-server : add support for the SYCL backend (#10934) | |
| 355 | 0ca416c91aea4549d9c77e3efeca403e15aa6c75 | 21ae3b9be83820565d1a720999b7f63ce95b4920 | 2024-12-20T14:12:06+01:00 | Xuan Son Nguyen | server : (UI) fix copy to clipboard function (#10916) | |
| 356 | 57bb2c40cd94c5a09f5210ed8264cc93b21c4b7e | a3c33b1dce2d4f25040b75f66629104bd1e40128 | 2024-12-19T15:40:08+01:00 | Xuan Son Nguyen | server : fix logprobs, make it OAI-compatible (#10783) | |
| 357 | 0bf2d10c5514ff61b99897a4a5054f846e384e1e | 7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec | 2024-12-18T19:27:21+02:00 | Georgi Gerganov | tts : add OuteTTS support (#10784) | |
| 358 | 7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec | 152610eda91217ac409342cd976d05f5114ad39f | 2024-12-18T04:00:07-10:00 | Gaetan Bisson | server: avoid overwriting Authorization header (#10878) | |
| 359 | 152610eda91217ac409342cd976d05f5114ad39f | 0e70ba686e6c717a0aa41d88284e2a392c2bd0cd | 2024-12-18T13:01:41+02:00 | Georgi Gerganov | server : output embeddings for all tokens when pooling = none (#10861) | |
| 360 | d62b532c52e0118323277eaa5f442e11ce6505ed | 081b29bd2a3d91e7772e3910ce223dd63b8d7d26 | 2024-12-17T17:24:22-05:00 | DAN™ | Use model->gguf_kv for loading the template instead of using the C API. (#10868) | |
| 361 | 05c3a444b8b017b01b366b725ba22c740aae6b38 | 382bc7f2e8ffd0b89f23e840d097e21f301197ba | 2024-12-17T16:00:24Z | krystiancha | server : fill usage info in embeddings and rerank responses (#10852) | |
| 362 | 227d7c5a7f4cc7734fde8a4ef4382d613486d3c8 | 7b1ec53f56bb72c49e4c8434157895f94d3709c2 | 2024-12-17T09:52:09+01:00 | Xuan Son Nguyen | server : (UI) fix missing async generator on safari (#10857) | |
| 363 | 5478bbcd173e7027af7689493c7421719f5c43df | b5ae1ddff93403300fc79c7ab5ee73b8cfbb3457 | 2024-12-15T05:55:54-06:00 | Vinesh Janarthanan | server: (UI) add syntax highlighting and latex math rendering (#10808) | |
| 364 | 89d604f2c87af9db657d8a27a1528bc4b7579c29 | e52aba537a34d51a65cddec6bc6dafc9031edc63 | 2024-12-14T22:29:45Z | Michelle Tan | server: Fix `has_next_line` in JSON response (#10818) | |
| 365 | a76c56fa1a3d27467eb97468d8c3b2fe1243b61a | c27ac678dd393af0da9b8acf10266e760c8a0912 | 2024-12-13T12:23:52-08:00 | lhez | Introducing experimental OpenCL backend with support for Qualcomm Adreno GPUs (#10693) | |
| 366 | 5555c0c1f66d766c544c30699190dec0285bcbfc | 973f328b1e92a6406030442dfd15b29449e89747 | 2024-12-11T22:40:40Z | CentricStorm | docs: update server streaming mode documentation (#9519) | |
| 367 | 973f328b1e92a6406030442dfd15b29449e89747 | 235f6e14bf0ed0211c51aeff14139038ae1000aa fb18934a97425c42c8b32a1baaa94f0080eb051d | 2024-12-11T23:14:46+02:00 | Georgi Gerganov | Merge pull request #10788 from ggerganov/gg/gguf-py-0.11.0 | |
| 368 | 235f6e14bf0ed0211c51aeff14139038ae1000aa | 1a31d0dc00ba946d448e16ecc915ce5e8355994e | 2024-12-11T20:52:14+01:00 | Xuan Son Nguyen | server : (UI) add tok/s, get rid of completion.js (#10786) | |
| 369 | 4b4d92b0986e3b627b9a9ef4782973108bf47691 | 43041d2eb32623d5b6ca734313327abe96f73146 | 2024-12-11T10:47:43Z | CentricStorm | docs: fix server documentation formatting (#10776) | |
| 370 | b685daf3867c54e42a9db484d7b92619021d4510 | dafae66cc242eb766797194d3c85c5e502625623 | 2024-12-10T14:23:17-06:00 | Jeff Bolz | vulkan: request round-to-even for fp16 in im2col/rope_head (#10767) | |
| 371 | 750cb3e246f7e544124cf18cb0c5e0c8b7e38738 | a86ad841f103e471ac0fd7ee8852d1eb5015ce89 | 2024-12-10T18:23:24+01:00 | Andreas Kieslinger | CUDA: rename macros to avoid conflicts with WinAPI (#10736) | |
| 372 | a86ad841f103e471ac0fd7ee8852d1eb5015ce89 | a05e2afcc241c1ecd38ec5cb4c579d90cdf3f918 | 2024-12-10T17:22:34Z | Yüg | server : add flag to disable the web-ui (#10762) (#10751) | |
| 373 | ce8784bdb153ff7794dde5a50b0ebfa51baa6171 | e52522b8694ae73abf12feb18d29168674aa1c1b | 2024-12-08T23:04:29+01:00 | Xuan Son Nguyen | server : fix format_infill (#10724) | |
| 374 | e52522b8694ae73abf12feb18d29168674aa1c1b | 06d70147e6480c021e493c442ae0f0d83ae366de | 2024-12-08T20:38:51+01:00 | Xuan Son Nguyen | server : bring back info of final chunk in stream mode (#10722) | |
| 375 | 3573fa8e7b7f0865638b52b4e9b4d2006f0558a2 | d9c3ba2b7749c00df477599aa141a98b4521aa2c | 2024-12-07T20:21:09+01:00 | Xuan Son Nguyen | server : (refactor) no more json in server_task input (#10691) | |
| 376 | ce4a7b849388b67d45ad420bdd82d5efcd55647a | 19d8762ab61df8286367588a80b9c7db4cb568db | 2024-12-07T18:02:05+02:00 | Georgi Gerganov | server : various fixes (#10704) | |
| 377 | 19d8762ab61df8286367588a80b9c7db4cb568db | c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b | 2024-12-07T13:37:50+01:00 | Djip007 | ggml : refactor online repacking (#10446) | |
| 378 | c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b | 3df784b3050f657ea681f804187ce5bddb433e88 | 2024-12-07T11:52:44+02:00 | Georgi Gerganov | server : fix free of spec context and batch (#10651) | |
| 379 | f162d45a21b27f7613f14539f9a4932d6ff3ca48 | 6c5bc0625fae6909cb40def15bc4bb45db6f7f4d | 2024-12-06T13:29:05+01:00 | Xuan Son Nguyen | common : bring back --no-warmup to server (#10686) | |
| 380 | 6c5bc0625fae6909cb40def15bc4bb45db6f7f4d | 7736837d62efed1dbebfe579472fca041eda12d6 | 2024-12-06T11:14:32+01:00 | Xuan Son Nguyen | server : (refactoring) do not rely on JSON internally (#10643) | |
| 381 | 7736837d62efed1dbebfe579472fca041eda12d6 | c9c6e01daedac542b174c235872569fce5385982 | 2024-12-05T23:36:41+02:00 | Plamen Minev | fix(server) : not show alert when DONE is received (#10674) | |
| 382 | 1da7b765692764a8b33b08da61cbee63812a7bd9 | 59f4db10883a4f3e855cffbf2c3ab68430e95272 | 2024-12-04T22:38:20+02:00 | Georgi Gerganov | server : fix speculative decoding with context shift (#10641) | |
| 383 | 91c36c269bca75b2d08119c653512cd20b4ea2ba | 1cd3df46bd49a0c1c78da8b68c956448a73b7476 | 2024-12-03T19:38:44+01:00 | Xuan Son Nguyen | server : (web ui) Various improvements, now use vite as bundler (#10599) | |
| 384 | efb6ae963031709fc331e6e48cc4606ac8f9c3a7 | 667d70d1704dfa6977505f5d01d4638669b90dce | 2024-12-02T19:27:24+01:00 | PAB | feat: add `GGML_UNARY_OP_ARGMAX` Metal kernel (ggml/1019) | |
| 385 | 3b4f2e33e2cbfca621e623c4b92b88da57a8c2f4 | 82bca2257b3cec72676abb26011f1b99fcdab29d | 2024-12-03T12:54:30+01:00 | Xuan Son Nguyen | llama : add missing LLAMA_API for llama_chat_builtin_templates (#10636) | |
| 386 | 70b98fadbc8c07a0144f3b50a4d7ab7e2aeff878 | 642330ac7cea11dc1f9d3df2b8f3dbd10b5e3f3e | 2024-12-03T11:20:00+02:00 | Georgi Gerganov | server : fix default draft model parameters (#10586) | |
| 387 | 642330ac7cea11dc1f9d3df2b8f3dbd10b5e3f3e | 8648c521010620c2daccfa1d26015c668ba2c717 | 2024-12-02T22:10:19+01:00 | Xuan Son Nguyen | llama : add enum for built-in chat templates (#10623) | |
| 388 | 86dc11c5bcf34db2749d8bd8d4fa07a542c94f84 | 6acce3971098772a8aacb10fe8550b4119110581 | 2024-12-01T12:33:12+01:00 | alek3y | server : bind to any port when specified (#10590) | |
| 389 | b782e5c7d453b3f1fa8dc6c34cde7e2fa946af93 | 3a8e9af402f7893423bdab444aa16c5d9a2d429a | 2024-11-29T21:48:56+01:00 | Xuan Son Nguyen | server : add more test cases (#10569) | |
| 390 | f095a649ec390e04dfab1b04e646ae8549dafaef | 678d7994f4da0af3d29046be99950ac999ee9762 | 2024-11-29T00:18:02-06:00 | Jeff Bolz | vulkan: get the first command buffer submitted sooner (#10499) | |
| 391 | 6c595676899013102fdb0aa4b06a49954300c94a | 890719311b6535e572f15965c6d7ec4ac2537f60 | 2024-11-28T19:17:49+01:00 | Xuan Son Nguyen | server : (tests) don't use thread for capturing stdout/stderr, bump openai client library (#10568) | |
| 392 | 45abe0f74ee281aea6e5283c1e738061256cfcae | 0bbd2262a3263f37385297b30de37941836e57f7 | 2024-11-26T16:20:18+01:00 | Xuan Son Nguyen | server : replace behave with pytest (#10416) | |
| 393 | 7db3846a94ce7683b3e8120abe427457edf840c9 | c6807b3f28cc3dbfda3ec390bcb87e69fb5634e2 | 2024-11-26T13:05:20+01:00 | Diego Devesa | ci : publish the docker images created during scheduled runs (#10515) | |
| 394 | 84e1c33cde9e0a7aafcda2d4f21ba51c300482d7 | 811872a59daefb25fc0c4326bcb6d8ae893c2f7c | 2024-11-26T13:36:40+02:00 | Georgi Gerganov | server : fix parallel speculative decoding (#10513) | |
| 395 | 9fd8c2687f5aa2f095ac6e12a376e1c0583888e8 | 47f931c8f9a26c072d71224bc8013cc66ea9e445 | 2024-11-25T22:28:27+02:00 | Georgi Gerganov | server : add more information about error (#10455) | |
| 396 | 47f931c8f9a26c072d71224bc8013cc66ea9e445 | 106964e3d266740f571b5aad7b57545b4a901ac9 | 2024-11-25T21:50:07+02:00 | Georgi Gerganov | server : enable cache_prompt by default (#10501) | |
| 397 | a9a678a6b2264e5895533217b0cf8f250534cc58 | 9ca2e677626fce759d5d95c407c03677b9c87a26 | 2024-11-25T08:11:55-08:00 | brucepro | Add download chat feature to server chat (#10481) | |
| 398 | 9ca2e677626fce759d5d95c407c03677b9c87a26 | 5931c1f233c616083d64e41a228249d58e039aa5 | 2024-11-25T16:31:38+02:00 | Georgi Gerganov | server : add speculative decoding support (#10455) | |
| 399 | 5a8987793f3e7c1fbfa6806bfcd17d578071b6c9 | d9d54e498d38ec99bbc0031022f9c92711e97bbc | 2024-11-25T17:31:10+08:00 | Neo Zhang Jianyu | [SYCL] Fix building Win package for oneAPI 2025.0 update (#10483) | |
| 400 | 6dfcfef0787e9902df29f510b63621f60a09a50b | 599b3e0cd40432cd1975a8906f3db70bbe53b627 | 2024-11-22T17:44:08+08:00 | 蕭澧邦 | ci: Update oneAPI runtime dll packaging (#10428) | |
| 401 | bcdb7a23862b61aa307fc462fadfe1e2e653d010 | f245cc28d4eb900efad0bc740145f58d713c6e4f | 2024-11-16T18:26:54+05:00 | MaggotHATE | server: (web UI) Add samplers sequence customization (#10255) | |
| 402 | 9901068ac78838745e604fffb4601d315a610456 | 231f9360d94446cd083b6b116f63991b1328c484 | 2024-11-15T05:48:49-04:00 | Xuan Son Nguyen | server : (web UI) add copy button for code block, fix api key (#10242) | |
| 403 | 5a54af4d4f588f109f31e456483fdf77096399d9 | 1607a5e5b08f4e55f118af3d7de325949d8f1835 | 2024-11-15T04:09:12+01:00 | Romain Biessy | sycl: Use syclcompat::dp4a (#10267) | |
| 404 | fb4a0ec0833c71cff5a1a367ba375447ce6106eb | 5ea926dad7f62ebccff7b24784bd1e01a06d13ae | 2024-11-13T20:00:35+02:00 | Michael Podvitskiy | llama : propagate the results of `graph_compute` (#9525) | |
| 405 | ff7fb670d0a62897c5662536aeb53422c549fbe8 | 0e712a5acbbdd1593e5aeb86d4f6b896a11b438c | 2024-11-13T11:16:30Z | Alexey Parfenov | server : add missing docs (#10269) | |
| 406 | 0e712a5acbbdd1593e5aeb86d4f6b896a11b438c | a0ec17b32ec6077f5ca22fe833ebdc9b86795a4d | 2024-11-13T19:15:23+08:00 | Jhen-Jie Hong | server : fix incorrect res in validate_model_chat_template (#10272) | |
| 407 | b141e5f6efbab3a00633df88c4f9425bfe8b78ab | 4b3a9212b602be3d4e2e3ca26efd796cef13c55e | 2024-11-11T08:38:43+02:00 | Georgi Gerganov | server : enable KV cache defrag by default (#10233) | |
| 408 | 505f33274d60676320216b662a97672a76ec600e | 160687b3ed002eee83a04de83a9cd752f928ced1 | 2024-11-11T00:42:25+05:00 | MaggotHATE | server : (web UI) Add back sampler settings (#10239) | |
| 409 | 76c6e7f10551960e4ec9e14e0535b72081f1c7ad | a71d81cf8c1afb26b166f897c94ee1581f9fac7d | 2024-11-07T18:44:38-04:00 | Xuan Son Nguyen | server : minor UI fix (#10207) | |
| 410 | a71d81cf8c1afb26b166f897c94ee1581f9fac7d | eec4d71737b32f312e0082b671629a0368e1a20d | 2024-11-07T17:31:10-04:00 | Xuan Son Nguyen | server : revamp chat UI with vuejs and daisyui (#10175) | |
| 411 | b11f9ba9b8ce319f04b88afe40d264e6b7f4ba46 | 94d8cb8be13b7c4d04eeca5a2b956b9148e6f222 | 2024-11-06T13:29:01+02:00 | Georgi Gerganov | server : remove hack for extra parallel slot (#10187) | |
| 412 | 9e0ecfb697d297355e43c20559d29bcc71beb0c3 | 6a066b9978533e2ab9890b7f4f8c0262d91798b3 | 2024-11-04T16:33:29+01:00 | Xuan Son Nguyen | server : clarify /slots endpoint, add is_processing (#10162) | |
| 413 | 42cadc74bda60afafb45b71b1a39d150ede0ed4d | 45950415ed985830c59bf42cf9c9216b20cf08ef | 2024-11-02T16:34:56Z | sasha0552 | server : fix slot selection by lru (#10126) | |
| 414 | 45950415ed985830c59bf42cf9c9216b20cf08ef | 1926d6e39d6f6358bc1a4c52316a560178be7233 | 2024-11-02T18:34:00+02:00 | Georgi Gerganov | server : fix endpoint checks (#10135) | |
| 415 | d865d1478cd4e403f82d793c2afcd0f943412f05 | 1804adb0cfee4811eaf633741503d683a46e4c77 | 2024-11-01T13:33:14Z | sasha0552 | server : fix smart selection of available slot (#10120) | |
| 416 | e597e50794f07ec8dc24b9efb18f94ec6386fda0 | 85679d37f34f66783cc04664a06c405b28e8e035 | 2024-11-01T11:09:59+08:00 | Zhenwei Jin | build: fix build error in Windows env with OneAPI setup (#10107) | |
| 417 | 0a683e8088d849626e7471f9e2ed381f7dbdf2e9 | dea5e86051aadcdf42f7db7a8855a78d8f5ff3d6 | 2024-10-31T06:02:35-07:00 | Kevin Gibbons | server : include scheme when printing URL (#10106) | |
| 418 | 8125e6cbfcf2b3b9066e4d923aca9295526730f5 | 8841ce3f439de6e770f70319b7e08b6613197ea7 | 2024-10-28T08:49:32+02:00 | Georgi Gerganov | server : don't overfill the batch during infill (#10018) | |
| 419 | bc5ba007b2c83ac95875e68724dabfc12159fc61 | 958367bf530d943a902afa1ce1c342476098576b | 2024-10-25T10:13:46+03:00 | Georgi Gerganov | server : check that the prompt fits in the slot's context (#10030) | |
| 420 | 958367bf530d943a902afa1ce1c342476098576b | 40f2555797f97314de749873cdc29dc102be66e2 | 2024-10-24T21:51:22+02:00 | Xuan Son Nguyen | server : refactor slot input data, move tokenizer to HTTP thread (#10023) | |
| 421 | 0a1c750c80147687df267114c81956757cc14382 | 190a37d7977eb5bd6a729299bd1e371208c87149 | 2024-10-23T13:27:51-06:00 | wwoodsTM | server : samplers accept the prompt correctly (#10019) | |
| 422 | 6b8447352df3d662b56280c8fc38d7f092885787 | 674804a99617b4f90292b4080ecab450ea3d30ba | 2024-10-22T16:16:01+08:00 | leo-pony | [CANN] Adapt to dynamically loadable backends mechanism (#9970) | |
| 423 | afd9909a6481402844aecefa8a8908afdd7f52f1 | 87421a23e8c60e00a7b227d501e8aab2a1aff7ce | 2024-10-18T14:33:58+03:00 | Radoslav Gerganov | rpc : backend refactoring (#9912) | |
| 424 | 87421a23e8c60e00a7b227d501e8aab2a1aff7ce | 60ce97c9d809f4b040e90b597468b839df5728d0 | 2024-10-18T06:46:16+01:00 | Ouadie EL FAROUKI | [SYCL] Add SYCL Backend registry, device and Event Interfaces (#9705) | |
| 425 | 60ce97c9d809f4b040e90b597468b839df5728d0 | 8901755ba328643c9ab071c20e1939ea52951a0e | 2024-10-18T13:34:36+08:00 | Ma Mingfei | add amx kernel for gemm (#8998) | |
| 426 | 8901755ba328643c9ab071c20e1939ea52951a0e | 6f55bccbb8835d42147add4ee48807450f5ff535 | 2024-10-18T07:32:19+03:00 | Georgi Gerganov | server : add n_indent parameter for line indentation requirement (#9929) | |
| 427 | 1f66b699c48cb5ab3265ed72c48e8549b1674291 | 0e41b300ed28f7fe185d938b2e3d56a0bf7411ed | 2024-10-16T08:35:53Z | Alexey Parfenov | server : fix the disappearance of the end of the text (#9867) | |
| 428 | 223c25a72fcc3f65cdfd7f5d57edd5b44b550e18 | fbc98b748e7b075e327bcf13237057f647678049 | 2024-10-15T16:28:55+03:00 | Georgi Gerganov | server : improve infill context reuse (#9894) | |
| 429 | fbc98b748e7b075e327bcf13237057f647678049 | dcdd535302fc9702a4709be25f56540d65163a44 | 2024-10-15T15:54:55+05:00 | MaggotHATE | sampling : add XTC sampler (#9742) | |
| 430 | dcdd535302fc9702a4709be25f56540d65163a44 | 4c42f93b22146c83b763d8cbee5fafc512746649 | 2024-10-15T12:48:44+03:00 | Georgi Gerganov | server : update preact (#9895) | |
| 431 | d4c19c0f5cdb1e512573e8c86c79e8d0238c73c4 | c7181bd294757dd80a7904e3dd0fea2d0be914e7 | 2024-10-13T21:31:35+03:00 | Georgi Gerganov | server : accept extra_context for the infill endpoint (#9874) | |
| 432 | c7181bd294757dd80a7904e3dd0fea2d0be914e7 | 92be9f12164f18ce845a5bab60cefa5f7fec6836 | 2024-10-13T18:52:48+03:00 | Georgi Gerganov | server : reuse cached context chunks (#9866) | |
| 433 | edc265661cd707327297b6ec4d83423c43cb50a5 | 1bde94dd024b632f98428f4bf2ce483295130779 | 2024-10-12T16:14:27+03:00 | Georgi Gerganov | server : add option to time limit the generation phase (#9865) | |
| 434 | 1bde94dd024b632f98428f4bf2ce483295130779 | 95c76e8e92ecc93f784b185eafae36a0e7ad2fa3 | 2024-10-12T16:06:31+03:00 | Georgi Gerganov | server : remove self-extend features (#9860) | |
| 435 | 95c76e8e92ecc93f784b185eafae36a0e7ad2fa3 | 11ac9800aff532715a5bc7991062c68ba3472e6e | 2024-10-12T14:51:54+03:00 | Georgi Gerganov | server : remove legacy system_prompt feature (#9857) | |
| 436 | 11ac9800aff532715a5bc7991062c68ba3472e6e | 943d20b4111c746bcd9dbc7e4771de313b08b50c | 2024-10-12T08:21:51+03:00 | Georgi Gerganov | llama : improve infill support and special token detection (#9798) | |
| 437 | 0e9f760eb12546704ef8fa72577bc1a3ffe1bc04 | cf8e0a3bb9c0e93e371773b282054cdbbb231038 | 2024-10-10T20:14:55+02:00 | Diego Devesa | rpc : add backend registry / device interfaces (#9812) | |
| 438 | 458367a90606448a9c0262b276947c9e536086e0 | fa42aa6d8902cc4eaf31866b3b3b7b61b69da930 | 2024-10-08T13:27:04+02:00 | Xuan Son Nguyen | server : better security control for public deployments (#9776) | |
| 439 | 7254cdf7e8d6312840509ca8d766358c687c6266 | cad341d88924788b940997c55e7bef000c99e784 | 2024-09-29T23:18:02+02:00 | Johannes Gäßler | ggml: fix gradient allocation logic (ggml/966) | |
| 440 | f4d2b8846a6b34419ff9e9491aee6cd95e444bfc | 1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 | 2024-09-28T17:42:03+03:00 | Georgi Gerganov | llama : add reranking support (#9510) | |
| 441 | 1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 | 739842703e32cd43443c45e0b4f6647cc4e6b3d6 | 2024-09-28T14:32:46+02:00 | slaren | test-backend-ops : use flops for some performance tests (#9657) | |
| 442 | 95bc82fbc0df6d48cf66c857a4dda3d044f45ca2 | 7691654c68aa5316108f881136c59f815ccb6809 | 2024-09-26T17:38:31+08:00 | Neo Zhang Jianyu | [SYCL] add missed dll file in package (#9577) | |
| 443 | afbbfaa537a96f562c34df4542930fa951b40d9e | 3d6bf6919f7b10726421779cd344f2da05421c68 | 2024-09-25T14:05:13+02:00 | Xuan Son Nguyen | server : add more env vars, improve gen-docs (#9635) | |
| 444 | 3d6bf6919f7b10726421779cd344f2da05421c68 | 904837e0cb2f5f01bf5d5901b7aa57a026860ae4 | 2024-09-25T01:06:52-06:00 | Gabe Goodhart | llama : add IBM Granite MoE architecture (#9438) | |
| 445 | 0aa15011e315659640504731d1d05663837130fa | b0f27361f3539a81d983a8b045f3c61e682d9fc0 | 2024-09-23T23:04:39-07:00 | StrangeBytesDev | server : add newline after chat example (#9616) | |
| 446 | 0b3bf966f47bf2ba88e5d4e3ed429602008c7e63 | f0c7b5edf82aa200656fd88c11ae3a805d7130bf | 2024-09-23T22:23:54+02:00 | Xuan Son Nguyen | server : add --no-context-shift option (#9607) | |
| 447 | f0c7b5edf82aa200656fd88c11ae3a805d7130bf | 1d48e98e4f3316bd2f6b187d288c7b6cb88d5cb3 | 2024-09-23T11:42:43-07:00 | Max Krasnyansky | threads: improve ggml_barrier scaling with large number of threads (#9598) | |
| 448 | 6026da52d6942b253df835070619775d849d0258 | eca0fab44eb449ed34e17a9b651ae7398b494117 | 2024-09-19T12:44:53+03:00 | Georgi Gerganov | server : clean-up completed tasks from waiting list (#9531) | |
| 449 | 8a308354f6520df6bea851b435bd8054ee5617b4 | f799155ab8279cfa668086ce584aa52ecc05f5e5 | 2024-09-18T01:50:34-05:00 | Vinesh Janarthanan | server : match OAI structured output response (#9527) | |
| 450 | f799155ab8279cfa668086ce584aa52ecc05f5e5 | faf67b3de4688f47c3b1019c89df255df2fd59b4 | 2024-09-18T14:28:20+08:00 | Eric Zhang | server : fix OpenSSL build (remove obsolete `LOG_INFO`) (#9529) | |
| 451 | 8b836ae731bbb2c5640bc47df5b0a78ffcb129cb | 8344ef58f8cdb8ebd6faf4463ca32ae91c374c81 | 2024-09-17T09:35:38-04:00 | Bert Wagner | arg : add env variable for parallel (#9513) | |
| 452 | 0226613853133c081b55bb892a41bb5eacc0bc94 | 503147a9f9d195d6a14e7c998df23b6eb61f2bae | 2024-09-17T01:19:46-07:00 | Max Krasnyansky | threadpool : skip polling for unused threads (#9461) | |
| 453 | 441b72b91f818fe69497e5816f87969e90c73c43 | c4965a64f72ac9434c21cf0e1c3421d13e889155 | 2024-09-16T01:20:01-05:00 | Vinesh Janarthanan | main : option to disable context shift (#9484) | |
| 454 | dcdcee3a744f39714503ee2b19c49b7c7b6209c9 | 1f4111e540bacec8d00ca9fd96417bf4c1339394 | 2024-09-14T17:36:44+08:00 | VoidIsVoid | server: add data: [DONE] to /chat/completions stream response (#9459) | |
| 455 | feff4aa8461da7c432d144c11da4802e41fef3cf | 0abc6a2c25272d5cf01384dda8ee8bfec4ba8745 | 2024-09-13T14:23:11+02:00 | Xuan Son Nguyen | server : add loading html page while model is loading (#9468) | |
| 456 | 0abc6a2c25272d5cf01384dda8ee8bfec4ba8745 | bd35cb0ae357185c173345f10dc89a4ff925fc25 | 2024-09-13T09:53:38+03:00 | Georgi Gerganov | llama : llama_perf + option to disable timings during decode (#9355) | |
| 457 | 78203641fee3b1f82abaff0c7f667e1b4a286390 | e6b7801bd189d102d901d3e72035611a25456ef1 | 2024-09-12T22:30:11+02:00 | Mathijs Henquet | server : Add option to return token pieces in /tokenize endpoint (#9108) | |
| 458 | 8d300bd35fbe23b35a4e1ece0cf0fe8f43331029 | 49006c67b4c6cc2e7c75a875b4d6e161ebae287c | 2024-09-10T22:40:59+02:00 | matteo | enable --special arg for llama-server (#9419) | |
| 459 | bfe76d4a17228bfd1565761f203123bc4914771b | 293bebe0773c907c0c866213856eeba41b035df1 | 2024-09-09T23:36:09+02:00 | Xuan Son Nguyen | common : move arg parser code to `arg.cpp` (#9388) | |
| 460 | 1b9ae5189cd279c6b45e36d43e4f9ccae628d02f | e32d0816edfd247784f6780b0bb9ae0bceef5e47 | 2024-09-07T20:43:51+02:00 | Xuan Son Nguyen | common : refactor arg parser (#9308) | |
| 461 | df270ef74596da8f1178f08991f4c51f18c9ee82 | 947538acb8617756a092042ff7e58db18dde05ec | 2024-09-07T15:16:19+03:00 | Georgi Gerganov | llama : refactor sampling v2 (#9294) | |
| 462 | 9b2c24c0993487d3b34a873980e292da571481f3 | 134bc38ecf3e2c5460581badce289a1ffa680453 | 2024-09-06T23:21:29+02:00 | Xuan Son Nguyen | server : simplify state machine for slot (#9283) | |
| 463 | 4a1411b4f17b6569dc0a067e5914dcc0f738b370 | 8ebe8ddebd68526757c631cd019de009697c63c2 | 2024-09-06T14:06:04+02:00 | Xuan Son Nguyen | server : fix missing lock (#9334) | |
| 464 | 9bc6db28d011d47a5f318dc4aebbe7927fac4629 | 32b2ec88bc44b086f3807c739daf28a1613abde1 | 2024-09-05T21:48:47-04:00 | compilade | ggml-quants : ternary packing for TriLMs and BitNet b1.58 (#8151) | |
| 465 | 32b2ec88bc44b086f3807c739daf28a1613abde1 | 1031771faaba28d07b4ec6a812cb21532efc8c31 | 2024-09-06T06:34:36+08:00 | awatuna | Update build.yml (#9184) | |
| 466 | 82e3b03c11826d20a24ab66d60f4de58f48ddcdb | 9379d3cc1718e9ec6ab5ffcb60a06bbe048a61ee | 2024-09-04T11:08:32+03:00 | Radoslav Gerganov | rpc : make RPC servers come first in the device list (#9296) | |
| 467 | b69a480af4db8ffd6cbb2efe7ed8132bc7d39073 | 48baa61eccdca9205daf8d620ba28055c2347b64 | 2024-09-03T10:00:36+03:00 | Georgi Gerganov | readme : refactor API section + remove old hot topics | |
| 468 | 48baa61eccdca9205daf8d620ba28055c2347b64 | f1485161e58d562099dd050f8ac3a9ea9f4cd765 | 2024-09-02T22:08:38+02:00 | Xuan Son Nguyen | server : test script : add timeout for all requests (#9282) | |
| 469 | 6e7d133a5f9409dd257fad90d7f320721b07a1b2 | b60074f1c26d8354053a952844ef3f7ebefd8803 | 2024-09-02T17:11:51+02:00 | Xuan Son Nguyen | server : refactor multitask handling (#9274) | |
| 470 | 8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c | a47667cff41f5a198eb791974e0afcc1cddd3229 | 2024-09-01T22:38:17+08:00 | Molly Sophia | llama : support RWKV v6 models (#8980) | |
| 471 | 42c76d1358021ccdbe8ba89109c143dd7ae166df | 9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b | 2024-08-29T19:20:53-04:00 | Faisal Zaghloul | Threadpool: take 2 (#8672) | |
| 472 | 9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b | 1d1ccce67613674c75c9c7e3fa4c1e24e428ba48 | 2024-08-27T18:28:06+08:00 | Jan Boon | server : fix crash when error handler dumps invalid utf-8 json (#9195) | |
| 473 | a77feb5d71831c61e455541e8a655b9f0337ea8c | 2e59d61c1b321431c597c1f12249273427d5640d | 2024-08-27T11:07:01+02:00 | Xuan Son Nguyen | server : add some missing env variables (#9116) | |
| 474 | e5edb210cd361689da41f032f1b36c45ff1bf9be | 0c41e03ceba1aafaf469476a56347419d5785376 | 2024-08-26T12:16:57+03:00 | Georgi Gerganov | server : update deps (#9183) | |
| 475 | a1631e53f6763e17da522ba219b030d8932900bd | fc54ef0d1c138133a01933296d50a36a1ab64735 | 2024-08-21T17:58:11-04:00 | compilade | llama : simplify Mamba with advanced batch splits (#8526) | |
| 476 | fc54ef0d1c138133a01933296d50a36a1ab64735 | b40eb84895bf723c7b327a1e3bf6e0e2c41877f8 | 2024-08-21T11:04:34+02:00 | Xuan Son Nguyen | server : support reading arguments from environment variables (#9105) | |
| 477 | 18eaf29f4c5f7c8e89412f3a9a0392a9e4e01d75 | 554b049068de24201d19dde2fa83e35389d4585d | 2024-08-19T10:10:21+03:00 | Radoslav Gerganov | rpc : prevent crashes on invalid input (#9040) | |
| 478 | 8b3befc0e2ed8fb18b903735831496b8b0c80949 | d565bb2fd5a2a58b9924a7a34e77a87c78c52137 | 2024-08-16T17:19:05+02:00 | Xuan Son Nguyen | server : refactor middleware and /health endpoint (#9056) | |
| 479 | d565bb2fd5a2a58b9924a7a34e77a87c78c52137 | ee2984bdaf10c14d440ad873a049bcc09b786d9b | 2024-08-16T21:34:41+08:00 | tc-mb | llava : support MiniCPM-V-2.6 (#8967) | |
| 480 | 37501d9c79ed5897db4b73ea7502211d25b3f763 | 4af8420afba39de4968adf2695ce12fd42422a13 | 2024-08-15T15:28:05+08:00 | Riceball LEE | server : fix duplicated n_predict key in the generation_settings (#8994) | |
| 481 | 234b30676a97ce227b604c38beb9dcaca406dea9 | 5fd89a70ead34d1a17015ddecad05aaa2490ca46 | 2024-08-15T08:21:57+02:00 | Jiří Podivín | server : init stop and error fields of the result struct (#9026) | |
| 482 | 98a532d474c73d3494a5353024cb6a4fbbabbb35 | 43bdd3ce188cd247bda7c1bd1ad01fa64e566690 | 2024-08-14T02:51:02-04:00 | compilade | server : fix segfault on long system prompt (#8987) | |
| 483 | 5ef07e25ac39e62297a67208c5bcced50835a2dd | 4134999e01f31256b15342b41c4de9e2477c4a6c | 2024-08-12T10:21:50+03:00 | Georgi Gerganov | server : handle models with missing EOS token (#8997) | |
| 484 | 7c3f55c10051c634546247387c5c359c9d499360 | 911b437f228e75aa3d235acec21bfddd23ecce2f | 2024-08-10T11:43:26+02:00 | fairydreaming | Add support for encoder-only T5 models (#8900) | |
| 485 | 3071c0a5f218f107dabd13b73f6090af683ef5ec | 4305b57c80eff4f0df5f6acb60b292f03b8f0dd0 | 2024-08-09T18:33:53+08:00 | tc-mb | llava : support MiniCPM-V-2.5 (#7599) | |
| 486 | daef3ab233fc02e4c53afd9b07366379876f00d1 | 345a686d8271a24db20d31789c0d4b9ed51dcb0c | 2024-08-09T08:32:02+02:00 | Mathieu Geli | server : add one level list nesting for embeddings (#8936) | |
| 487 | 1e6f6554aa11fa10160a5fda689e736c3c34169f | 641f5dd2a6422941faa9f32ab5cb50fc1b24c1f5 | 2024-08-06T17:33:39+02:00 | Xuan Son Nguyen | server : add lora hotswap endpoint (WIP) (#8857) | |
| 488 | a3738b2fa7c60ef2c4592435d1aa7fb8f1f69c3e | 655858ace0cf2720e56eb01f84ad05e0c94ada3c | 2024-08-04T17:28:08+02:00 | 0cc4m | vulkan : implement Stable Diffusion operators (ggml/904) | |
| 489 | 978ba3d83d17b10fdf9807006048432b5b3769fc | ecf6b7f23e664afd7ff856ec39034240ce438daa | 2024-08-04T18:16:23Z | ardfork | Server: Don't ignore llama.cpp params (#8754) | |
| 490 | ecf6b7f23e664afd7ff856ec39034240ce438daa | 01aae2b4975b57a265ce8194928fd87f2d71027e | 2024-08-04T03:55:03-07:00 | Brian Cunnie | batched-bench : handle empty `-npl` (#8839) | |
| 491 | afbbcf3c04e3c6420cad3d72571478cd62ac176c | ed9d2854c9de4ae1f448334294e61167b04bec2a | 2024-07-31T18:59:09-05:00 | Igor Okulist | server : update llama-server embedding flag documentation (#8779) | |
| 492 | 01aec4a6310ab0160483196db0e726d78d4c94b6 | 41cd47caab88c442edc50e90c8d8d0ac3e82768d | 2024-07-25T18:10:16-04:00 | Yaiko | server : add Speech Recognition & Synthesis to UI (#8679) | |
| 493 | 4b0eff3df58d8d86e47348fb73d54da3194d416d | 8a4bad50a8ed24ed1e9df003521468dcc37320e8 | 2024-07-25T13:43:27+05:30 | Ujjawal Panchal | docs : Quantum -> Quantized (#8666) | |
| 494 | b841d0740855c5af1344a81f261139a45a2b39ee | 64cf50a0ed62d41e4f6c13e08a9b6b0816f46c6e | 2024-07-23T17:37:42+03:00 | Vali Malinoiu | server : fix URL.parse in the UI (#8646) | |
| 495 | 938943cdbf4dd79005a394d732bc226f9e34e0ff | 751fcfc6c33ea5f43cadd4d976f8fb176871df5e | 2024-07-23T13:10:17+03:00 | Georgi Gerganov | llama : move vocab, grammar and sampling into separate files (#8508) | |
| 496 | 566daa5a5b38018b2727950bbd280239adb981b6 | 6f11a83e4e7700fdf353ed4a29599cb662c792f6 | 2024-07-22T15:44:53+02:00 | Jiří Podivín | *.py: Stylistic adjustments for python (#8233) | |
| 497 | 628154492a0b2dcc954a3af99e5c267097568eae | 04bab6b7da0ed2b0a57174a57784d602aabb6c10 | 2024-07-22T16:02:09+08:00 | Jan Boon | server : update doc to clarify n_keep when there is bos token (#8619) | |
| 498 | 69c487f4ed57bb4d4514a1b7ff12608d5a8e7ef0 | 07283b1a90e1320aae4762c7e03c879043910252 | 2024-07-20T22:25:26+02:00 | Johannes Gäßler | CUDA: MMQ code deduplication + iquant support (#8495) | |
| 499 | be0cfb41752551a4680ee7dfd29f2a05b50db442 | b57eb9ca4fb79f3163c6a69e154ff76157a4f716 | 2024-07-19T14:34:55+03:00 | Georgi Gerganov | readme : fix server badge | |
| 500 | 0d2c7321e9678e91b760ebe57f0d063856bb018b | 672a6f101839a150180fc28891ebed379c8f2353 | 2024-07-18T18:43:49+08:00 | Eric Zhang | server: use relative routes for static files in new UI (#8552) | |
| 501 | 3807c3de04cde853418033c95e96642876545f3e | e02b597be3702174e7b47b44cd03e1da1553284b | 2024-07-18T16:06:22+08:00 | RunningLeon | server : respect `--special` cli arg (#8553) | |
| 502 | f17f39ff9cb71fa7b0eda0c649bb0ce9b2d8a6b8 | 9104bc20edf47f74dc49379b7d61d0c6e85a4882 | 2024-07-15T08:04:56-04:00 | M-A | server: update README.md with llama-server --help output [no ci] (#8472) | |
| 503 | 4e24cffd8cccd653634e24ee461c252bd77b1426 | 6af51c0d96e6268769fc05c98d5b1a5e832c0017 | 2024-07-12T14:48:15+03:00 | Georgi Gerganov | server : handle content array in chat API (#8449) | |
| 504 | c3ebcfa148e867a68e78fd5c4f0c23e8f84c788b | 8a4441ea1a2564578134404f31158c318e9c0bf3 | 2024-07-12T03:14:12-05:00 | Douglas Hanley | server : ensure batches are either all embed or all completion (#8420) | |
| 505 | 278d0e18469aacf505be18ce790a63c7cc31be26 | dd07a123b79f9bd9e8a4ba0447427b3083e9347a | 2024-07-10T20:08:17-04:00 | Clint Herron | Initialize default slot sampling parameters from the global context. (#8418) | |
| 506 | dd07a123b79f9bd9e8a4ba0447427b3083e9347a | f4444d992c16b6b9442f4770c7c3a10b19a08343 | 2024-07-10T12:35:18-04:00 | Clint Herron | Name Migration: Build the deprecation-warning 'main' binary every time (#8404) | |
| 507 | 0f1a39f3439825acf7e3a1663566d410be152170 | 83321c6958acf20747d288031174cc1bf8816e33 | 2024-07-10T07:14:51-05:00 | Dibakar Gope | ggml : add AArch64 optimized GEMV and GEMM Q4 kernels (#5780) | |
| 508 | a59f8fdc85e1119d470d8766e29617962549d993 | fd560fe680c72fd0a0af2bc8881add20ad919071 | 2024-07-09T18:26:40-04:00 | Clint Herron | Server: Enable setting default sampling parameters via command-line (#8402) | |
| 509 | 3fd62a6b1c9ca7b7c0093e984cc9c133c6f2726d | a8db2a9ce64cd4417f6a312ab61858f17f0f8584 | 2024-07-07T15:04:39-04:00 | compilade | py : type-check all Python scripts with Pyright (#8341) | |
| 510 | cb4d86c4d723af87d3d7e3177e9485f200391384 | 86e7299ef5dff0f388922dc6fcbce009e99d8005 | 2024-07-07T11:10:38+02:00 | Bjarke Viksøe | server: Retrieve prompt template in /props (#8337) | |
| 511 | 807b0c49ff7071094f97ebc3a0a8e2b9e274f503 | f8c4c0738d72d2162736edd72dd5db8b269adca1 | 2024-07-04T15:46:11+02:00 | fairydreaming | Inference support for T5 and FLAN-T5 model families (#5763) | |
| 512 | a95631ee97bb24861af6bdeec380270459631e8e | f3f65429c44bb195a9195bfdc19a30a79709db7b | 2024-06-26T19:26:13+03:00 | Georgi Gerganov | readme : update API notes | |
| 513 | f3f65429c44bb195a9195bfdc19a30a79709db7b | 88540445615e77a0177fcca43aaa8e9d8eea6864 | 2024-06-26T18:33:02+03:00 | Georgi Gerganov | llama : reorganize source code + improve CMake (#8006) | |
| 514 | 6777c544bdd8c5d9de3220d6e2557957bbbf2a4f | 163d50adaf8897d8b734d701ff332de6be63d484 | 2024-06-26T01:45:58+01:00 | Olivier Chafik | `json`: fix additionalProperties, allow space after enum/const (#7840) | |
| 515 | dd047b476c8b904e0c25e5dbc5bee6ffde2f6e17 | 925c30956dd17723c3a25297bcd0a609aec60663 | 2024-06-25T19:20:06+02:00 | slaren | disable docker CI on pull requests (#8110) | |
| 516 | 925c30956dd17723c3a25297bcd0a609aec60663 | c8ad35955ad2c68db172dcd0e857423ab128518d | 2024-06-25T08:13:27-07:00 | joecryptotoo | Add healthchecks to llama-server containers (#8081) | |
| 517 | 48e6b92cc378c937e59719f2c0f482bf76c9ca81 | 3791ad219323389106dc3fd80814eb5bbb7b80de | 2024-06-25T13:56:49+02:00 | Xuan Son Nguyen | Add chat template support for llama-cli (#8068) | |
| 518 | 3791ad219323389106dc3fd80814eb5bbb7b80de | f702a90e245499283d6de0b287701c723cda2a87 | 2024-06-25T16:57:35+05:30 | HanishKVC | SimpleChat v3.1: Boolean chat request options in Settings UI, cache_prompt (#7950) | |
| 519 | 6a2f298bd784403c5c33eebb822217ec5d9b5590 | 11318d9aa1f668aa10407a5cb9614371af32f3ce | 2024-06-23T18:03:08+03:00 | Aarni Koskela | server : fix JSON-Scheme typo (#7975) | |
| 520 | b6b9a8e606da7764bd3649c2ea574979c85abd43 | 45c0e2e4c1268c2d7c8c45536f15e3c9a731ecdc | 2024-06-23T13:14:45+02:00 | slaren | fix CI failures (#8066) | |
| 521 | ba5899315283eb1df3902363daf79bdc5eefe426 | a7854743c5e6216a6178824a603aa9479728ddd5 | 2024-06-19T23:57:10Z | sasha0552 | server : fix smart slot selection (#8020) | |
| 522 | e6ecc2be470e3c5c6c5c9d8b90aa83a1f7725084 | a94e6ff8774b7c9f950d9545baf0ce35e8d1ed2f | 2024-06-18T09:37:20+03:00 | Georgi Gerganov | whisper : use ggml_backend_sched (whisper/2239) | |
| 523 | 1c641e6aac5c18b964e7b32d9dbbb4bf5301d0d7 | 963552903f51043ee947a8deeaaa7ec00bc3f1a4 | 2024-06-13T00:41:52+01:00 | Olivier Chafik | `build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809) | |
| 524 | 704a35b183748954013bd875bbbfdd9eaca14e62 | dcf752707d96eb305f546526c7bc5d01f0831130 | 2024-06-12T14:42:29+03:00 | Georgi Gerganov | server : restore numeric prompts (#7883) | |
| 525 | dcf752707d96eb305f546526c7bc5d01f0831130 | f2b5764beb35583295e2475479c18f249b139b58 | 2024-06-12T17:05:35+08:00 | Meng, Hengyu | update intel docker oneapi-basekit to 2024.1.1-devel-ubuntu22.04 (#7894) | |
| 526 | 14f83526cd27f638c856ea6eff08110b9860eb2a | 6fe42d073f0554eada93ac9d40574025aeedb703 | 2024-06-11T12:18:58-04:00 | Deven Mistry | fix broken link in pr template (#7880) [no ci] | |
| 527 | fd5ea0f897ecb3659d6c269ef6f3d833e865ead7 | c28a83902cf6ab6a9e085ad6d4cc2e95c4ccfe40 | 2024-06-10T14:18:41+02:00 | slaren | ci : try win-2019 on server windows test (#7854) | |
| 528 | 57bf62ce7cb75cca589943e2050d29bff4026e76 | 3e2ee443159724e2d3a0741f6b167e599ec088aa | 2024-06-09T11:24:29-04:00 | Nicolás Pérez | docs: Added initial PR template with directions for doc only changes and squash merges [no ci] (#7700) | |
| 529 | 3e2ee443159724e2d3a0741f6b167e599ec088aa | 42b53d192f4e3abf1b7c8e424628424504ea5dc5 | 2024-06-09T12:50:35+02:00 | mgroeber9110 | server: do not remove whitespace at the start of a completion chunk (#7830) | |
| 530 | 7a16ce7db2a74a223f0f3b9cee66d4539c5bce8f | da799b41891e34aac86ce4e173f9c4c0afd4fab3 | 2024-06-08T07:50:31Z | sasha0552 | server : smart slot selection using Longest Common Prefix (#7728) | |
| 531 | 7027b27d765db95d4ac6b569d976e387a8715881 | a5cabd76491f07494c5b8267f921c73f5e2bbfb4 | 2024-06-07T11:15:49+02:00 | Johannes Gäßler | server: update cache_prompt documentation [no ci] (#7745) | |
| 532 | a5cabd76491f07494c5b8267f921c73f5e2bbfb4 | d5c938cd7716b9a2ace49a43a469dfbffcff4d28 | 2024-06-07T15:09:45+08:00 | woodx | server : do not get prompt in infill mode (#7286) | |
| 533 | ee459f40f65810a810151b24eba5b8bd174ceffe | f83351f9a62a6262f1fc3d08f320033089cddfb5 | 2024-06-06T19:19:59+03:00 | Georgi Gerganov | server : fix --threads-http arg (#7801) | |
| 534 | 55b2d0849d3ec9e45e4a4d9e480f5fa7977872a6 | f5d7b268ec4bf8628aa6ccc9f6631d0230dde76f | 2024-06-06T10:07:06+01:00 | Olivier Chafik | grammars: x{min,max} repetition operator (#6640) | |
| 535 | 2d08b7fbb483c14bd2b173d4cd51ea3a4f862e8f | d67caea0d6e6c303d31b01d0a010973e6c908dff | 2024-06-06T07:19:49+02:00 | slaren | docker : build only main and server in their images (#7782) | |
| 536 | 1442677f92e45a475be7b4d056e3633d1d6f813b | 554c247caffed64465f372661f2826640cb10430 | 2024-06-04T21:23:39+03:00 | Georgi Gerganov | common : refactor cli arg parsing (#7675) | |
| 537 | 6d1616944d9efd342ed2a4fd318722adfc9febcd | bde7cd3cd949c1a85d3a199498ac98e78039d46f | 2024-06-04T10:01:09+03:00 | Georgi Gerganov | ggml : prevent builds with -ffinite-math-only (#7726) | |
| 538 | bde7cd3cd949c1a85d3a199498ac98e78039d46f | a5735e4426b19a3ebd0c653ad8ac01420458ee95 | 2024-06-03T20:03:26+03:00 | Radoslav Gerganov | llama : offload to RPC in addition to other backends (#7640) | |
| 539 | a5735e4426b19a3ebd0c653ad8ac01420458ee95 | 0b832d53ba0ffcc759c8d62ede3772dd62321f8e | 2024-06-04T00:14:15+09:00 | Masaya, Kato | ggml : use OpenMP as a thread pool (#7606) | |
| 540 | 7c4e5b7eae26581869e782015d9deca947c34997 | 9422c5e34bbd302493b77a8f6d546154a1f4fe82 | 2024-06-02T13:39:08-04:00 | Austin | chore : add ignore rule for generated server themes (#7689) | |
| 541 | 9422c5e34bbd302493b77a8f6d546154a1f4fe82 | e141ce624af57bdffbaf57014a044eb1d9689230 | 2024-06-02T19:13:54+10:00 | nickp27 | [SYCL] Update rpc-server.cpp to include SYCL backend (#7682) | |
| 542 | 2e666832e6ac78194edf030bd1c295e21bdb022c | 2ac95c9d5678d05e253691fb1f26471675bff5ad | 2024-06-01T21:31:48+02:00 | Yazan Agha-Schrader | server : new UI (#7633) | |
| 543 | 2ac95c9d5678d05e253691fb1f26471675bff5ad | 750f60c03e4d3f53fa51910551ce87a3d508d2d7 | 2024-06-01T21:50:18+05:30 | HanishKVC | SimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548) | |
| 544 | a323ec60af14a33d560df98f2cc41b4112cb4f80 | 0515ad93f48df63bbff204eddb0cac75e8585c65 | 2024-05-31T22:23:04+03:00 | Georgi Gerganov | server : update js (#7670) | |
| 545 | 972b555ab935705f3437abd5909a5c46852811f6 | 3854c9d07f67de7f8cd6d86117bfaef47549b05a | 2024-05-30T09:52:39+02:00 | Johannes Gäßler | README: explain parallel build [no ci] (#7618) | |
| 546 | 3854c9d07f67de7f8cd6d86117bfaef47549b05a | eb57fee51f7b4d78039f003249873c2eb46f12f6 | 2024-05-30T14:19:08+08:00 | Meng, Hengyu | [SYCL] fix intel docker (#7630) | |
| 547 | e2b065071c5fc8ac5697d12ca343551faee465cc | 0548a4187f2e53b8fc6d9ff0f4c71988f708ff42 | 2024-05-28T17:53:37+08:00 | Neo Zhang | [SYCL]fix ggml_sycl_mul_mat_id() to match the change of api (#7436) | |
| 548 | 9335b969e86a222e247adacedf814d8abfff8847 | c41767154eb82aa3fe7568fc816c3402b78eae94 | 2024-05-28T06:55:51+02:00 | mgroeber9110 | server: do not remove whitespace at the start of a completion chunk (#7524) | |
| 549 | b9adcbbf92fc7096bee23fe61496d25652ebf765 | 9588f196b1d7b21bdff013fcf958c249576b2619 | 2024-05-26T06:26:34+05:30 | HanishKVC | SimpleChat Completion Mode flexibility and cleanup, Settings gMe, Optional sliding window (#7480) | |
| 550 | 27891f6db03de6e3fd5941983838c29bef253352 | fbca2f27fc7fa9aa4a8ad0357478fdb908472908 | 2024-05-24T23:47:56+10:00 | Brian | docker.yml: disable light-intel and server-intel test (#7515) | |
| 551 | fbca2f27fc7fa9aa4a8ad0357478fdb908472908 | 0df0aa8e43c3378975269a51f9b876c8692e70da | 2024-05-24T14:31:13+02:00 | fairydreaming | Add support for ArcticForCausalLM (#7020) | |
| 552 | 3015851c5ac7334fb544a23a70a284c117b87044 | 55ac3b7aeaf52f19786ed96e885d89521fc0f6c8 | 2024-05-23T14:29:26+02:00 | Daniel Bevenius | llama : add getters for n_threads/n_threads_batch (#7464) | |
| 553 | 1e374365d170b7f692fd7753c145e21bc14486c8 | 197ff91462dd05bb9a3be03578114abf0c355536 | 2024-05-22T23:23:21+05:30 | HanishKVC | SimpleChat: a simple and dumb web front end for testing /chat/completions and /completions end points and try chat (#7350) | |
| 554 | 201cc11afa0a1950e1f632390b2ac6c937a0d8f0 | 6369bf04336ab60e5c892dd77a3246df91015147 | 2024-05-22T04:28:32+08:00 | liuwei-git | llama : add phi3 128K model support (#7225) | |
| 555 | d7e852c1bc8e85bf62a6f1aede08cd2de723404a | 917dc8cfa67a72fb7c8bf7392270da3bf4833af4 | 2024-05-21T14:39:48+02:00 | jaime-m-p | Tokenizer SPM fixes for phi-3 and llama-spm (bugfix) (#7425) | |
| 556 | 917dc8cfa67a72fb7c8bf7392270da3bf4833af4 | fabf30b4c4fca32e116009527180c252919ca922 | 2024-05-20T20:15:57+02:00 | jaime-m-p | Tokenizer SPM fixes for phi-3 and llama-spm (#7375) | |
| 557 | 3bc10cb485dd7efa4da6c64e73ad0c9e2bfe0821 | 6bf9b66fa3f263ca2175dcb5f6d0a658581e1dfb | 2024-05-20T15:10:03+03:00 | Georgi Gerganov | server : fix temperature + disable some tests (#7409) | |
| 558 | 1cc0155d04918cb3017afa472acea51b77483c4a | e932094d58f513d5996c3efc9f6fed8238894c57 | 2024-05-20T10:16:41+03:00 | Georgi Gerganov | server : tuning tests (#7388) | |
| 559 | e932094d58f513d5996c3efc9f6fed8238894c57 | 2789baf480ba7dc9281b65f601f0918e58920f54 | 2024-05-20T08:56:05+03:00 | Georgi Gerganov | server : return error on too large embedding input (#7389) | |
| 560 | 1b01f06db0cff5f5f600bb754fc39fde565ed56a | 41858392e17abead21735309bf17cb55183d8c31 | 2024-05-19T16:26:02+02:00 | Johannes Gäßler | server: add test for token probs (#7347) | |
| 561 | 41858392e17abead21735309bf17cb55183d8c31 | 6aade19ee74b896c59929676629340b36be3e22c | 2024-05-19T16:06:33+02:00 | Johannes Gäßler | server: fix seed being reported back (#7382) | |
| 562 | cb42c294279bc4a0a4e926a7b5a5568049f12fa7 | d233b507cd19fcc2d8d8963ecc6a3eb7a33f2ecc | 2024-05-18T11:10:47+02:00 | Johannes Gäßler | server: correct --threads documentation [no ci] (#7362) | |
| 563 | f4bd8b3d260bb09491ba63c77ab7012b744362ef | 51e9d02599336e62948d29f1d6c05addeb921ac2 | 2024-05-17T17:25:44+03:00 | Radoslav Gerganov | rpc : set SO_REUSEADDR for the server socket (#7320) | |
| 564 | d273c1402b25086fd91aef2467ac13f2e49fa0ea | 27b040691cbe45314147c2745e891a38e9c048d4 | 2024-05-17T15:11:45+03:00 | Aarni Koskela | py : convert-hf-to-gguf-update improvements (#7340) | |
| 565 | 27b040691cbe45314147c2745e891a38e9c048d4 | 29c60d8cddcfd14fa8a6bf023a6c4eb8692c76ba | 2024-05-17T13:24:38+02:00 | fairydreaming | llama : use n_embd_head_v when reshaping kqv (#7327) | |
| 566 | ee94172d33399d2e814ca05c8a3ff8c523ebb093 | 934266c0e0b2aa9781fdba2deb112c161ff038a9 | 2024-05-17T10:00:17+03:00 | Radoslav Gerganov | server : add support for the RPC backend (#7305) | |
| 567 | 9c4fdcbec8c7fcc428e723b0d8a1cf1f351ba642 | 24ecb58168dce81646c2ed425690a106591c8c6d | 2024-05-17T02:11:03+02:00 | Leon Knauer | [Server] Added --verbose option to README [no ci] (#7335) | |
| 568 | 583fd6b000ec9ad1b465b5c98524f4a0ae388077 | 9f773486ab78d65f5cca3f7e31c862b7043bf721 | 2024-05-15T08:44:16+02:00 | Johannes Gäßler | server bench: fix bench not waiting for model load (#7284) | |
| 569 | 4f0263633b40e94e8b69fd6e7e4395cfedfd5c12 | 1265c670fd8e41e1947352c96c5179adda97fb2c | 2024-05-14T10:11:24-04:00 | Steve Grubb | server: free sampling contexts on exit (#7264) | |
| 570 | 5e31828d3e35c76ecfee665bc23771a4bec1d130 | 541600201e6480f54ae09e58d16b154d4b4b331d | 2024-05-14T14:27:19+03:00 | Radoslav Gerganov | ggml : add RPC backend (#6829) | |
| 571 | 541600201e6480f54ae09e58d16b154d4b4b331d | efc8f767c8c8c749a245dd96ad4e2f37c164b54c | 2024-05-14T09:33:42+02:00 | slaren | llama : disable pipeline parallelism with nkvo (#7265) | |
| 572 | e586ee42595500c53938e937b6b6ad5353ad76dc | cbf75894d256f1861f6409565db599365de3d4b8 | 2024-05-12T19:40:08-07:00 | Benjamin Findley | change default temperature of OAI compat API from 0 to 1 (#7226) | |
| 573 | cbf75894d256f1861f6409565db599365de3d4b8 | 0d5cef78aeafae4d4e6d56e2d4bcda771af58cc9 | 2024-05-13T08:04:29+08:00 | Neo Zhang | [SYCL] Add oneapi runtime dll files to win release package (#7241) | |
| 574 | 0d5cef78aeafae4d4e6d56e2d4bcda771af58cc9 | dc685be46622a8fabfd57cfa804237c8f15679b8 | 2024-05-13T08:02:55+08:00 | Neo Zhang | [SYCL] update CI with oneapi 2024.1 (#7235) | |
| 575 | 988631335a20d06497f58be0b8ba13adb4323a22 | f99e1e456eaf69cc38c1982a2693ce41c0f897ef | 2024-05-11T04:13:02-04:00 | Steve Grubb | server : free llama_batch on exit (#7212) | |
| 576 | 5ae3426b0b64672991563d4c28b2018b9f961467 | b83cc3f5b303ff30c52874b2d5864dc6385ebf9f | 2024-05-11T10:11:28+02:00 | Johannes Gäßler | server: fix reported top tokens for temperature 0 (#7203) | |
| 577 | 4e3880978f8b1bf546dd4e6f3b524d6b8739c49c | f89fe2732c5709f6e86d5f4aee2e6d2a561f2eb2 | 2024-05-10T07:01:08-04:00 | Justine Tunney | Fix memory bug in grammar parser (#7194) | |
| 578 | d46dbc76f8770caec0175f1e57777173c70556a0 | 0961d866044143eefec5b525e991611f73fd4f6e | 2024-05-09T16:40:42+03:00 | Georgi Gerganov | readme : add scheduled server workflow status badge | |
| 579 | 47345248827f426038098d016ed11975021b4919 | 07cd41d0965829463eff73eda3348aedbfd3a444 | 2024-05-09T17:34:37+08:00 | Albert Jin | opencl : alignment size converted from bits to bytes (#7090) | |
| 580 | bd1871fa2b1bf8a081b43ba9bc85f8ffd46fac46 | 26458af1d63c85195cd96cd1673051e332d06d30 | 2024-05-08T20:12:06+01:00 | JohnnyB | server : add themes + favicon (#6848) | |
| 581 | 911b3900dded9a1cfe0f0e41b82c7a29baf3a217 | ad211edef5db1f1fb955874b7ca6a67bd0c88708 | 2024-05-08T14:27:58+02:00 | Johan | server : add_special option for tokenize endpoint (#7059) | |
| 582 | 1fd9c1741d864d01cd7ec6d67227b92d7bfabf22 | 4cd621c26de2095cd7c4464bdec5fe2e696ef3f3 | 2024-05-08T13:24:14+02:00 | Xuan Son Nguyen | clean up json_value & server_log (#7142) | |
| 583 | 3855416027cb25d9a708ffa5581cf503a87856a6 | c0e6fbf8c380718102bd25fcb8d2e55f8f9480d1 | 2024-05-08T02:30:09-04:00 | Justine Tunney | ggml : introduce bfloat16 support (#6412) | |
| 584 | af0a5b616359809ce886ea433acedebb39b12969 | b6aa6702030320a3d5fbc2508307af0d7c947e40 | 2024-05-07T23:07:58+02:00 | Johannes Gäßler | server: fix incorrectly reported token probabilities (#7125) | |
| 585 | 260b7c65296fba0568eeb1ff05244ea0be206b54 | 53d6c52e227dedef347b21e28febcfb9caeecdad | 2024-05-07T13:44:29-05:00 | Kyle Mistele | server : update readme with undocumented options (#7013) | |
| 586 | 8f8acc8683a00ce40fa5a81161a079d2167126e6 | ca3632602091e959ed2ad4c09c67a7c790b10d31 | 2024-05-05T13:38:55+02:00 | Sigbjørn Skjæret | Disable benchmark on forked repo (#7034) | |
| 587 | cf768b7e71cbcc9886c753ae963c2b68893d02e4 | fcd84a0f5a584ab5271745d7ffef21c8a6bc7b0c | 2024-05-04T13:10:15-03:00 | Jeximo | Tidy Android Instructions README.md (#7016) | |
| 588 | 03fb8a002df2e96104f9e06de9c78d2a8ed91e92 | 92139b90af4841d7fd060b526bdd443b621770ff | 2024-05-04T12:06:40+03:00 | maor-ps | If first token generated from the server is the stop word the server will crash (#7038) | |
| 589 | 3ea0d36000e2314baba7e9fc6a97f08670a6f7e4 | 1613ef8d8eb2479ba55c4d598e08c8f3f18a0fed | 2024-05-01T17:52:55+02:00 | Johannes Gäßler | Server: add tests for batch size, different seeds (#6950) | |
| 590 | 9c67c2773d4b706cf71d70ecf4aa180b62501960 | 952d03dbead16e4dbdd1d3458486340673cc2465 | 2024-04-30T12:16:08+03:00 | Georgi Gerganov | ggml : add Flash Attention (#5021) | |
| 591 | 8843a98c2ba97a25e93319a104f9ddfaf83ce4c4 | b8c1476e44cc1f3a1811613f65251cf779067636 | 2024-04-30T00:52:50+01:00 | Olivier Chafik | Improve usability of --model-url & related flags (#6930) | |
| 592 | b7368332e24c5b2c8038bf8267f43632783fcc35 | 928e0b7013c862cf10701957b3d654aa70f11bd8 | 2024-04-27T17:50:48+02:00 | Pierrick Hymbert | ci: server: tests python env on github container ubuntu latest / fix n_predict (#6935) | |
| 593 | 928e0b7013c862cf10701957b3d654aa70f11bd8 | 0c4d489e29e53589bf13a801fe7c94b7b546d8f6 | 2024-04-26T19:08:30+01:00 | agray3 | Reset schedule earlier to allow overlap with ggml graph computation on device (#6933) | |
| 594 | 0c4d489e29e53589bf13a801fe7c94b7b546d8f6 | 017e6999b5184234370b22a2f868e1be911e8d88 | 2024-04-26T20:06:33+02:00 | Pierrick Hymbert | quantize: add imatrix and dataset metadata in GGUF (#6658) | |
| 595 | bbe3c6e76157a5d806fdc155451f0ca8936248ee | 7f5ff558eed0f732af8f25c2ab0645610bdec80c | 2024-04-26T12:27:25+02:00 | Pierrick Hymbert | ci: server: fix python installation (#6925) | |
| 596 | 7f5ff558eed0f732af8f25c2ab0645610bdec80c | 9e4e077ec50fde6049b128662c72d37a3c28e34b | 2024-04-26T12:15:30+02:00 | Pierrick Hymbert | server: stop generation at `n_ctx_train` if `n_predict` is not set (#6638) | |
| 597 | 9e4e077ec50fde6049b128662c72d37a3c28e34b | 83b72cb086ce46a33dececc86bfe4648b6120aa8 | 2024-04-26T11:11:51+02:00 | Pierrick Hymbert | ci: server: fix python installation (#6922) | |
| 598 | 83b72cb086ce46a33dececc86bfe4648b6120aa8 | d4a9afc1009f0da88d04b2c5f672d81d5ae94675 | 2024-04-26T10:41:53+03:00 | Georgi Gerganov | Merge pull request from GHSA-p5mv-gjc5-mwqv | |
| 599 | d4a9afc1009f0da88d04b2c5f672d81d5ae94675 | 7d641c26ac73956a54b204cabefe85c764823678 | 2024-04-26T09:27:49+02:00 | Pierrick Hymbert | ci: server: fix python installation (#6918) | |
| 600 | 7d641c26ac73956a54b204cabefe85c764823678 | 5790c8dac1a4f0aa80b4efee3b962d8c04c829e8 | 2024-04-26T09:26:59+02:00 | Pierrick Hymbert | ci: fix concurrency for pull_request_target (#6917) | |
| 601 | 5790c8dac1a4f0aa80b4efee3b962d8c04c829e8 | 46e12c4692a37bdd31a0432fc5153d7d22bc7f72 | 2024-04-26T09:26:16+02:00 | Pierrick Hymbert | bench: server add stop word for PHI-2 (#6916) | |
| 602 | 3fe847b5747676ee1bf90371c46ed0bc66b57240 | 37246b1031b1680c0dcaf20aef736d6b446203fa | 2024-04-24T12:54:24+02:00 | mgroeber9110 | server : do not apply Markdown formatting in code sections (#6850) | |
| 603 | 37246b1031b1680c0dcaf20aef736d6b446203fa | 28103f4832e301a9c84d44ff0df9d75d46ab6c76 | 2024-04-24T05:15:29-05:00 | Kyle Mistele | common : revert showing control tokens by default for server (#6860) | |
| 604 | 28103f4832e301a9c84d44ff0df9d75d46ab6c76 | c0d1b3e03e27634ac2871761f5033cf9324d472d | 2024-04-24T11:08:36+02:00 | Johannes Gäßler | Server: fix seed for multiple slots (#6835) | |
| 605 | 5cf5e7d490dfdd2e70bface2d35dfd14aa44b4fb | 40f74e4d739e9250431cf339ae7588b28d8d0663 | 2024-04-21T18:48:53+01:00 | Olivier Chafik | `build`: generate hex dump of server assets during build (#6661) | |
| 606 | 40f74e4d739e9250431cf339ae7588b28d8d0663 | b9cc76d87e3d7ae5900f19d4fe8f8976d0a35888 | 2024-04-21T18:36:45+03:00 | Georgi Gerganov | llama : add option to render special/control tokens (#6807) | |
| 607 | b8109bc0139f15a5b321909f47510b89dca47ffc | aed82f6837a3ea515f4d50201cfc77effc7d41b4 | 2024-04-21T00:29:50+08:00 | Jan Boon | doc : server tests require llama to be built with curl enabled (#6788) | |
| 608 | 637e9a86c220718d008b54842dfd294aa96d3b7a | 9958c81b798a5872087b30b360e4674871f2479e | 2024-04-19T13:19:01+02:00 | Pierrick Hymbert | server: static: upstream upgrade (#6765) | |
| 609 | ab9a3240a9da941fdef5cd4a25f2b97c2f5a67aa | fbbc030ba93561fac842af994c5c6c4c1147f13b | 2024-04-12T19:43:38+01:00 | Olivier Chafik | JSON schema conversion: ⚡️ faster repetitions, min/maxLength for strings, cap number length (#6555) | |
| 610 | 24ee66ed0d908d156bd0d1747b63a636a495cd7a | 91c736015b66ba1d0b82cbae6313b6d5eaa61b68 | 2024-04-12T13:49:21+02:00 | Pierrick Hymbert | server : coherent log output for KV cache full (#6637) | |
| 611 | cbaadc92942c50aab599a9e4c163afc1f44f7c26 | 1bbdaf6ecda6f0a360dfb307b256fcb6838c560b | 2024-04-11T19:47:34+01:00 | Olivier Chafik | grammars: 1.5x faster inference w/ complex grammars (vector reserves / reuses) (#6609) | |
| 612 | 400d5d722d7edf7de0cf24a18c42b183c65047d2 | 5dc9dd7152dedc6046b646855585bd070c91e8c8 | 2024-04-09T01:31:47-07:00 | Ed Lee | server : detect search query to start webchat (#6554) | |
| 613 | e3c337d87ca650972105a51c6ce302dd236c07ad | beea6e1b16e783a0886e78dec01002a8c00db24d | 2024-04-08T06:02:30-07:00 | Rick G | llama : support negative ith in llama_get_ API (#6519) | |
| 614 | beea6e1b16e783a0886e78dec01002a8c00db24d | 87fb5b4234d4b9c56ac94cf7aa229c8fd7defdb0 | 2024-04-08T20:43:30+08:00 | Jan Boon | llama : save and restore kv cache for single seq id (#6341) | |
| 615 | b66aec675c1571a06b3570b858ae711246f96f84 | 57dd02c44b2a0eb79e28f6c5eb8242a5d2d3174d | 2024-04-03T22:57:20+02:00 | Daniel Bevenius | backend : fix typo in scheduler documentation (ggml/781) | |
| 616 | 57dd02c44b2a0eb79e28f6c5eb8242a5d2d3174d | 75cd4c77292034ecec587ecb401366f57338f7c0 | 2024-04-06T10:31:33-04:00 | Clint Herron | Tests: Added integration tests for GBNF parser (#6472) | |
| 617 | 75cd4c77292034ecec587ecb401366f57338f7c0 | a8bd14d55717754a1f48313a846a2b16fa998ad2 | 2024-04-06T05:40:47+02:00 | Pierrick Hymbert | ci: bench: support sse and fix prompt processing time / server: add tokens usage in stream OAI response (#6495) | |
| 618 | 0a1d889e27d6aaa3293dd2c692b849a9bcf4b474 | 7dda1b727ef1730783a6077136d28b83e70dd397 | 2024-04-04T17:31:22+01:00 | Ed Lepedus | server: add cURL support to server Dockerfiles (#6474) | |
| 619 | 2e66913e5f56209f4c949f98e431925b78e7e84d | 8120efee1d9931b514aeb5a047209d576f23286c | 2024-04-04T11:03:00-04:00 | Shakhar Dasgupta | server: allow penalizing repetition of newlines on server webpage (#6431) | |
| 620 | 7a2c92637ae265654a68f62e6a7610b358255d3f | 4bcd6b959ca3991084ad1d8464caf2a734e29b1d | 2024-04-04T11:57:58+02:00 | Pierrick Hymbert | ci: bench: add more ftype, fix triggers and bot comment (#6466) | |
| 621 | 4399f13fb9462cd06f3f154d0aee738425000fea | 1a43c7254ed5de91d09274b853db843c518f1b64 | 2024-04-04T09:34:58+03:00 | Georgi Gerganov | server : remove obsolete --memory-f32 option | |
| 622 | 1a43c7254ed5de91d09274b853db843c518f1b64 | 72d73af65132792a52433952ca4729b01c36cde2 | 2024-04-04T01:33:48-05:00 | Xiao-Yong Jin | server : add option to disable KV offload (#6468) | |
| 623 | 5fb1574c8112c757fc202fdae279da883f34e610 | 60cdf40cc32f0ad4cb11e0ca8fd38f3b93d8d640 | 2024-04-03T13:22:57-07:00 | Fattire | A few small fixes to server's README docs (#6428) | |
| 624 | 60cdf40cc32f0ad4cb11e0ca8fd38f3b93d8d640 | bb43cf7e9d86d69ffd9c7f008f75db890a35b45a | 2024-04-03T20:09:52+02:00 | JH23X | server : handle exception on wrong type in request (#6452) | |
| 625 | 5d4f12e4624bf4435ba26753814bedd4e9b62803 | 154d4ee39c38e231fb5c3910df14d2fc920fdf1b | 2024-04-03T18:56:37+01:00 | Ed Lepedus | server: add cURL support to `server.Dockerfile` (#6461) | |
| 626 | 226e819371eec0f298d9075198394a07b23ecfa9 | c50a82ce0f71558cbb8e555146ba124251504b38 | 2024-04-01T12:36:40+02:00 | Pierrick Hymbert | ci: server: verify deps are coherent with the commit (#6409) | |
| 627 | 057400a3fd457f4f214684eeb171444663b47a23 | b75c38166cf0c66793a32d5c3d6cb69929dd083d | 2024-03-29T08:23:22+01:00 | Daniel Bevenius | llama : remove redundant reshape in build_kv_store (#6369) | |
| 628 | 28cb9a09c4d10a489be1238abe7a858dcd4d65f2 | cfc4d75df6399b36153ef739f2c1abee4c114bb8 | 2024-03-28T11:27:56+01:00 | Pierrick Hymbert | ci: bench: fix master not schedule, fix commit status failed on external repo (#6365) | |
| 629 | 6902cb7f2e3479f364ee177118200fb7e4e9fc92 | d2d8f389960a106b66313ff1621bdb1aaaaaa285 | 2024-03-28T16:50:48+08:00 | Eric Zhang | server : stop gracefully on SIGTERM (#6348) | |
| 630 | a016026a3ac16d8c9b993a3573f19b9556d67de4 | 53c7ec53d5eca26b2c0c648605543a5fa6c12817 | 2024-03-27T20:26:49+01:00 | Pierrick Hymbert | server: continuous performance monitoring and PR comment (#6283) | |
| 631 | 1740d6dd4e00dedda87d6820b0e0d8e70dade340 | 0642b22cd12af278d6e7e459b73411947c169381 | 2024-03-27T08:08:59+01:00 | Mateusz Charytoniuk | readme : add php api bindings (#6326) | |
| 632 | 0642b22cd12af278d6e7e459b73411947c169381 | a4f569e8a316cbd33d2b4de94b694d111507475a | 2024-03-27T13:55:29+08:00 | Eric Zhang | server: public: use relative routes for static files (#6325) | |
| 633 | 557410b8f06380560155ac7fcb8316d71ddc9837 | 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 | 2024-03-26T10:46:41-04:00 | compilade | llama : greatly reduce output buffer memory usage (#6122) | |
| 634 | 3d032ece8e6973441273601ca2981130608e287d | e190f1fca6f60d80944f9e8709d343a025c4d245 | 2024-03-26T16:47:43+08:00 | Jan Boon | server : add `n_discard` parameter (#6300) | |
| 635 | ad3a0505e3b6cd777259ee35e61d428357ffc565 | 95ad616cddda50273e955bfe192328acd9aa4896 | 2024-03-25T09:42:17+01:00 | Xuan Son Nguyen | Server: clean up OAI params parsing function (#6284) | |
| 636 | ddf65685105a39a57b1e7f80c3aa502a6313af24 | d03224ac9840351023ff8abcf4aa0542258a53df | 2024-03-24T12:04:25+08:00 | Meng, Hengyu | [SYCL] offload op (#6217) | |
| 637 | f482bb2e4920e544651fb832f2e0bcb4d2ff69ab | 1997577d5e121568ae39f538021733ccd4278c23 | 2024-03-23T18:07:00+01:00 | Pierrick Hymbert | common: llama_load_model_from_url split support (#6192) | |
| 638 | 1997577d5e121568ae39f538021733ccd4278c23 | 476b0251b27fb64c575507024a671e639d675594 | 2024-03-23T18:00:38+01:00 | Pierrick Hymbert | server: docs: `--threads` and `--threads`, `--ubatch-size`, `--log-disable` (#6254) | |
| 639 | 1b26aebe4de4f048ac99996efd8a2c9af150904d | 50ccaf5eacb50a2ca378a4ef0dc7aeb45fead652 | 2024-03-23T13:18:45+01:00 | Pierrick Hymbert | server: flush stdout after logging in both text and json layout (#6253) | |
| 640 | 72114edf068a9b2f54d3b09e9a198f611be397e8 | 2f0e81e053b41ca28e73a841e7bdbf9820baaa57 | 2024-03-22T13:07:44Z | Olivier Chafik | json-schema-to-grammar : fix order of props + non-str const/enum (#6232) | |
| 641 | 6b8bb3a31d260a01020497c5f01025c34222fcb9 | 68e210b3543e0cc71268bee0920441747679ee13 | 2024-03-22T19:12:05+08:00 | Jan Boon | server : fix n_keep always showing as 0 in response (#6211) | |
| 642 | 68e210b3543e0cc71268bee0920441747679ee13 | b3e94f26bab8e3b5338b5902e5af5bb01894cb4a | 2024-03-22T13:08:28+02:00 | Georgi Gerganov | server : enable continuous batching by default (#6231) | |
| 643 | be07a03217376c53b1d95e5f658adbbbb2831555 | d0a71233fbf8ade8ef06ad8e6b81d1d7b254895f | 2024-03-22T06:41:24+08:00 | Jan Boon | server : update readme doc from `slot_id` to `id_slot` (#6213) | |
| 644 | f372c49ccdc561ab96fb3c7d2b7cbc0f89a4b359 | 924ce1dce7fdf54894b462d03e7b608a6e574c32 | 2024-03-21T11:52:35-06:00 | semidark | Corrected typo to wrong file (#6199) | |
| 645 | 5b7b0ac8dfdd800c0fd0dc69b69991e8cb19fb46 | 1943c0198125a0da1a200390e82cf461f9080d99 | 2024-03-21T11:50:43Z | Olivier Chafik | json-schema-to-grammar improvements (+ added to server) (#5978) | |
| 646 | 91f8ad167dcd24b54615b468d9dd764ebe1d37ad | 6b7e76d28cdf4361740054140708c71828453522 | 2024-03-20T13:30:36+01:00 | Xuan Son Nguyen | Server: version bump for httplib and json (#6169) | |
| 647 | bc0baab2ea8f806961dd3fb9f534cfeb59a2e1fc | d795988d9e09f75412efe2134512914c42780ad5 | 2024-03-20T14:14:32+02:00 | Georgi Gerganov | server : allow to override -ngl in tests (#6170) | |
| 648 | 47cc7a7bf9793f81a6dfe7c2096c499403f64dd6 | bd60d82d0cc8b6852ec535495a5042dbdf05de24 | 2024-03-20T16:32:34+05:30 | Karthick | Server: Handle n_keep parameter in the request (#6174) | |
| 649 | bd60d82d0cc8b6852ec535495a5042dbdf05de24 | 6c0b287748327741b113d7d6018b68c63039b1c5 | 2024-03-20T01:33:49-04:00 | Jared Van Bortel | server tests : more pythonic process management; fix bare `except:` (#6146) | |
| 650 | a56d09a4407f29c21e149b44fd5308f83aa1cb09 | d84c48505f60bcd358b82a751d40418c4d235643 | 2024-03-16T13:20:53+01:00 | Pierrick Hymbert | ci : close inactive issue with workflow (#6053) | |
| 651 | 877b4d0c628cc70dddb5df72ed8fc14d126ca7e8 | 12247f4c69a173b9482f68aaa174ec37fc909ccf | 2024-03-15T13:43:02-07:00 | Theia Vogel | llama : add support for control vectors (#5970) | |
| 652 | 12247f4c69a173b9482f68aaa174ec37fc909ccf | 4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc | 2024-03-15T16:41:22-04:00 | Andrew Canis | llama : add Command-R support (#6033) | |
| 653 | 4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc | 3020327f6cd6d2ce50528dd65f4b199d2ea8b1ae | 2024-03-15T22:31:05+08:00 | Ting Lou | llava : change API to pure C style for Rust FFI bindgen (#6079) | |
| 654 | 43241adf22e8231ffaf3827d2c9310cc0ffd5ac5 | a44bc969e4cd62ca9f4332e17fe3c51f2093e7c6 | 2024-03-14T12:15:39+01:00 | Pierrick Hymbert | server: disable debug release type sanitizer, simplify trigger (#6047) | |
| 655 | 76a936c8939c249a7c3e8e66dfefbab13eae194f | 463628372d5fe3a0c1e5864aa5fc57deb7387039 | 2024-03-13T20:33:56+02:00 | Georgi Gerganov | readme : update API changes and hot topics | |
| 656 | f30ea47a87ed4446ad55adb265755dc9102956a2 | d8fd0ccf6ac8b07791ffd1575eed436930854ae3 | 2024-03-13T18:54:21+01:00 | slaren | llama : add pipeline parallelism support (#6017) | |
| 657 | 99b71c068f624521ad977e08e41589e2971fa1c7 | 306d34be7ad19e768975409fc80791a274ea0230 | 2024-03-13T11:39:11+01:00 | Xuan Son Nguyen | Server: Use multi-task for embeddings endpoint (#6001) | |
| 658 | 05b06210c954491cf0f12034b0a62bd4d69ce78b | 83796e62bc9f6caae6228168e359890f51e60fee | 2024-03-11T17:49:47+02:00 | Georgi Gerganov | llama : more consistent names of count variables (#5994) | |
| 659 | 83796e62bc9f6caae6228168e359890f51e60fee | 828defefb66fc8a25404f5de845897145bf34061 | 2024-03-11T17:47:47+02:00 | Georgi Gerganov | llama : refactor unicode stuff (#5992) | |
| 660 | 828defefb66fc8a25404f5de845897145bf34061 | caa106d4e05a0ab94225c220b81f9e2cd522339b | 2024-03-11T14:40:42+01:00 | Jakub N | Update server docker image URLs (#5997) | |
| 661 | caa106d4e05a0ab94225c220b81f9e2cd522339b | 3202361c5b1ba15e695b31209567ef42c22c5c32 | 2024-03-11T10:56:41+01:00 | Xuan Son Nguyen | Server: format error to json (#5961) | |
| 662 | 332bdfd7980718abf664bfa5460f2288a3314984 | ecab1c75de68de7c41c254e2ae170d3b07bee6d4 | 2024-03-11T17:09:32+09:00 | Minsoo Cheong | server : maintain chat completion id for streaming responses (#5988) | |
| 663 | fa8a809a9119411bc9c3f00026550d0343f4d9b7 | bcebd7dbf62fd7b293d5ed089023e4e733269c71 | 2024-03-10T18:17:47+01:00 | Pierrick Hymbert | server: ci: windows build and tests (#5968) | |
| 664 | 621e86b331f8b0e71f79fd82a4ae1cd54c3e4396 | 77d1ac7e00bf049b9f2bba1b5a310a78318c49c4 | 2024-03-09T23:41:49+01:00 | Pierrick Hymbert | server: benchmark: chat/completions scenario and other llm servers comparison (#5941) | |
| 665 | 77d1ac7e00bf049b9f2bba1b5a310a78318c49c4 | d894f352bf433157232dc8dc54eacd50014e898e | 2024-03-09T22:04:00+02:00 | Georgi Gerganov | server : print chat template info | |
| 666 | d894f352bf433157232dc8dc54eacd50014e898e | 098dbaab449f5309a54871ba7e5acef72ae696de | 2024-03-09T19:55:54+01:00 | slaren | perplexity : support using multiple sequences to allow larger batch sizes (#5946) | |
| 667 | 58308a0ecce7cc261b802f4803c38d420063db21 | 5b09797321430f08caf0473143a962916ab2ea89 | 2024-03-09T17:34:15+02:00 | Georgi Gerganov | server : fix metrics init (#5964) | |
| 668 | 5b09797321430f08caf0473143a962916ab2ea89 | 97c09585d65a95864773b4d25d66d0f708baf38d | 2024-03-09T15:53:59+02:00 | Georgi Gerganov | ggml : remove old quantization functions (#5942) | |
| 669 | 97c09585d65a95864773b4d25d66d0f708baf38d | fb215c3832236fec7380c4fb618bd7154cb196ef | 2024-03-09T15:47:47+02:00 | Georgi Gerganov | server : clarify some items in the readme (#5957) | |
| 670 | fb215c3832236fec7380c4fb618bd7154cb196ef | 2c4f566c88322ebf2f9bd11b01b5ebdaa0130b89 | 2024-03-09T21:27:58+09:00 | SeungWon Jeong | server : normalize embeddings (#5956) | |
| 671 | 0db32beaf09d90b8959d3d0cc493ed1e45685353 | 8a3012a4ad08112bb3dc3f1399afec4e93780c44 | 2024-03-09T11:16:53Z | Alexey Parfenov | server : fix passing prompt as tokens (#5955) | |
| 672 | 9674aaf35cb81478eb38c3f3ebde713ec72fbb79 | 950ba1ab84db199f0bbdecdb2bb911f35261b321 | 2024-03-09T12:34:18+02:00 | Georgi Gerganov | server : simplify logic for empty prompts (#5953) | |
| 673 | 950ba1ab84db199f0bbdecdb2bb911f35261b321 | e1fa9569ba8ce276bc7801a3cebdcf8b1aa116ea | 2024-03-09T11:27:53+01:00 | Xuan Son Nguyen | Server: reorganize some http logic (#5939) | |
| 674 | e1fa9569ba8ce276bc7801a3cebdcf8b1aa116ea | fd72d2d2a5e79d61ccef6af3d15f16e5e5cbc352 | 2024-03-09T02:57:09-07:00 | Gabe Goodhart | server : add SSL support (#5926) | |
| 675 | fd72d2d2a5e79d61ccef6af3d15f16e5e5cbc352 | c2101a2e909ac7c08976d414e64e96c90ee5fa9e | 2024-03-09T10:30:04+01:00 | Pierrick Hymbert | server: tests: add truncated prompt tests, better kv cache size (#5933) | |
| 676 | c2101a2e909ac7c08976d414e64e96c90ee5fa9e | 515f7d0d4fce41c752fc253acf30707c3be2531e | 2024-03-08T17:31:00-05:00 | compilade | llama : support Mamba Selective State Space Models (#5328) | |
| 677 | 76e868821a94072fbc87cb1fcca291694319eae8 | e457fb3540e0aaec47cfde0abf784c213f9216ee | 2024-03-08T12:25:04+01:00 | Pierrick Hymbert | server: metrics: add llamacpp:prompt_seconds_total and llamacpp:tokens_predicted_seconds_total, reset bucket only on /metrics. Fix values cast to int. Add Process-Start-Time-Unix header. (#5937) | |
| 678 | af37fd8b30e37ccbffdd82e6f48559e2fb7ce7dd | 581ed5c4fe3a8909aaa8313633ac443f471ba755 | 2024-03-08T12:40:02+02:00 | Georgi Gerganov | server : fix EOS token detection with disabled cache (#5938) | |
| 679 | 55a2a900ff4a02fc33708ac7858d595d289a3f2a | 2002bc96bf2cbf5ab981a17d7e994d817c9801f5 | 2024-03-07T19:42:39+09:00 | Minsoo Cheong | server : add `/v1/completions` endpoint (#5914) | |
| 680 | 2002bc96bf2cbf5ab981a17d7e994d817c9801f5 | ceca1aef0738b57951cd12c603c3477e75312dec | 2024-03-07T11:41:53+02:00 | Georgi Gerganov | server : refactor (#5882) | |
| 681 | 21b08674331e1ea1b599f17c5ca91f0ed173be31 | 6a87ac3a52668e117d97bcea07b529c93188b303 | 2024-03-05T16:08:35+08:00 | Neo Zhang Jianyu | [SYCL] fix mul_mat fault in CI/unit-test (#5862) | |
| 682 | 29ae62d2ae163e2b68aa0ad3bf2ab4636de0c957 | e0843afe1b37890b631bc7d3d2da2ed36c862b91 | 2024-03-04T22:31:20+02:00 | Georgi Gerganov | llama : fix embeddings (#5796) | |
| 683 | 231ae28f078c3148d097b301f2145f1e3e816cc1 | 475df1d6cf817060028d3ff763cb8097d4ec40d6 | 2024-03-03T12:44:03+02:00 | Georgi Gerganov | readme : add API changes section | |
| 684 | e6029348e86c3810d4435faee54ba822cb43e2ef | 8ef969afcec1645d2d9c3ab1fc82263bba968989 | 2024-03-03T09:35:23+01:00 | Pierrick Hymbert | ci : schedule slow server tests only on Release or on demand (#5839) | |
| 685 | 8ef969afcec1645d2d9c3ab1fc82263bba968989 | fa974646e1a2024fc7dc9e6f27cf1f2f5d4a3763 | 2024-03-03T08:48:36+01:00 | Pierrick Hymbert | server : init http requests thread pool with --parallel if set (#5836) | |
| 686 | 9731134296af3a6839cd682e51d9c2109a871de5 | 4a6e2d6142ab815c964924896891e9ab3e050632 | 2024-03-02T22:00:14+01:00 | Pierrick Hymbert | server: tests: passkey challenge / self-extend with context shift demo (#5832) | |
| 687 | 38d16b142624bdd7c41d9955752b7f7b59c5e048 | c2224f003bf9cf558b1a3c57033563e11a4de9a5 | 2024-03-01T20:00:58+02:00 | Georgi Gerganov | server : remove api_like_OAI.py proxy script (#5808) | |
| 688 | 5cb02b4a012bb16c6c699c0c62c05ffa653eee0f | 6ea0f010ff6967034528d9e0b8330b9b0f0b7c13 | 2024-03-01T10:08:08+01:00 | Pierrick Hymbert | server: allow to override threads server pool with --threads-http (#5794) | |
| 689 | f105471ef6aa4727afac8240da398590d7277f45 | 38d152160898b0173ffe4dc7df5daadcbd2eceb0 | 2024-03-01T09:59:43+02:00 | Georgi Gerganov | server : fix newlines in help (#5785) | |
| 690 | 052051d8ae4639a1c3c61e7da3237bcc572469d4 | d5ab29757ebc59a30f03e408294ec20628a6374e | 2024-02-29T21:42:11+01:00 | Xuan Son Nguyen | Server: normalize naming (#5779) | |
| 691 | 08c5ee87e4cceb603ecceac90734fcdade57311b | 78aacf36344df724cdca9f1e1af849b2d2519cb8 | 2024-02-28T18:43:38+02:00 | Georgi Gerganov | llama : remove deprecated API (#5770) | |
| 692 | a693bea1e6762a17b78b6ddf4611e54136941ea2 | adcb12a9bad87bc96f2f158c95892b3d04aa7ffb | 2024-02-28T09:55:37+01:00 | Xuan Son Nguyen | server : hit Ctrl+C twice to exit (#5734) | |
| 693 | b11a93df41921846a10628a7c306d5c82a549939 | a33e6a0d2a66104ea9a906bdbf8a94d050189d91 | 2024-02-26T23:15:48+01:00 | Xuan Son Nguyen | fix server hangs on empty prompt (#5733) | |
| 694 | 4804215cb833841ffb15a710a16b77ca0a29eb4b | 8a533f0d9078396ebaee9ba213038a1322976dee | 2024-02-26T11:41:34+01:00 | Pierrick Hymbert | server: CI fix trailing space (#5728) | |
| 695 | 8a533f0d9078396ebaee9ba213038a1322976dee | 269de86ba073b5dc9ce687c11a3bc4d7d873b962 | 2024-02-26T09:56:10+01:00 | Pierrick Hymbert | server: CI tests reduce build matrix (#5725) | |
| 696 | e3965cf35aac00d4e24998c8a3d0093ae1d98bd3 | 8b350356b28f782deab63d8b0e9ae103ceb25fcd | 2024-02-25T22:48:33+01:00 | Pierrick Hymbert | server: tests - slow inference causes timeout on the CI (#5715) | |
| 697 | 8b350356b28f782deab63d8b0e9ae103ceb25fcd | bf08e00643fd529f748f0a858fd79f3061e3fa18 | 2024-02-25T21:46:29+01:00 | Pierrick Hymbert | server: docs - refresh and tease a little bit more the http server (#5718) | |
| 698 | f7625019c51ca437a5840576d92362cfa710e4a2 | abbabc5e51d0d4656b438aec10b7fae9479ef37d | 2024-02-25T13:43:50-05:00 | compilade | server : fix crash when system prompt is bigger than batch size (#5714) | |
| 699 | 930b1780269a69948d106e2d1b838ab7661f679a | d52d7819b8ced70c642a88a59da8c78208dc58ec | 2024-02-25T13:50:32+01:00 | Pierrick Hymbert | server: logs - unified format and --log-format option (#5700) | |
| 700 | d52d7819b8ced70c642a88a59da8c78208dc58ec | 12894088170f62e4cad4f8d6a3043c185b414bab | 2024-02-25T13:49:43+01:00 | Pierrick Hymbert | server: concurrency fix + monitoring - add /metrics prometheus compatible endpoint (#5708) | |
| 701 | 9e359a4f47c1b2dceb99e29706c9f7403d32ab5e | 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 | 2024-02-24T19:16:04+01:00 | Pierrick Hymbert | server: continue to update other slots on embedding concurrent request (#5699) | |
| 702 | 525213d2f5da1eaf4b922b6b792cb52b2c613368 | fd43d66f46ee3b5345fb8a74a252d86ccd34a409 | 2024-02-24T12:28:55+01:00 | Pierrick Hymbert | server: init functional tests (#5566) | |
| 703 | fd43d66f46ee3b5345fb8a74a252d86ccd34a409 | 54fbcd2ce6c48c9e22eca6fbf9e53fb68c3e72ea | 2024-02-23T19:31:54Z | AlpinDale | server : add KV cache quantization options (#5684) | |
| 704 | a46f50747b2028f7f9c9883b26bfba12bf92556e | c5688c6250430d2b8e0259efcf26c16dfa4c1f46 | 2024-02-22T09:33:24+01:00 | Xuan Son Nguyen | server : fallback to chatml, add AlphaMonarch chat template (#5628) | |
| 705 | c5688c6250430d2b8e0259efcf26c16dfa4c1f46 | 4ef245a92a968ba0f18a5adfd41e51980ce4fdf5 | 2024-02-22T08:27:32Z | Alexey Parfenov | server : clarify some params in the docs (#5640) | |
| 706 | 1ecea255ebb70750b52688393f37a63606b90e3f | a00a35cef93e057eace8351a667d14d152a91ebc | 2024-02-21T15:47:48+01:00 | Pierrick Hymbert | server: health: fix race condition on slots data using tasks queue (#5634) | |
| 707 | 6560bed3f066c876682464762cad90f1e28e3f1b | 06bf2cf8c406e6b70dbf9b431a02fa0ad845b9df | 2024-02-20T11:07:22-08:00 | CJ Pais | server : support llava 1.6 (#5553) | |
| 708 | 9c405c9f9a7cfd23511fd6b2de05dc72481119b4 | 5207b3fbc500f89dfe528693e96540956dbaed96 | 2024-02-20T15:58:27+01:00 | Xuan Son Nguyen | Server: use llama_chat_apply_template (#5593) | |
| 709 | c0a8c6db371cb3e4379900867b948879f5842201 | b9111bd209c7b11b0592450a6ed2e0ca545b2c84 | 2024-02-20T08:48:19+01:00 | Pierrick Hymbert | server : health endpoint configurable failure on no slot (#5594) | |
| 710 | 5ee99c32f5e47c8d32634eff9a47fb32a24c276b | c145f8a132b2fe1d1e65987faddbd9a40bef7a12 | 2024-02-18T11:11:16-08:00 | Robey Holderith | common, server : surface min_keep as its own parameter (#5567) | |
| 711 | c145f8a132b2fe1d1e65987faddbd9a40bef7a12 | 689a091bbe0537ee9abff3e15a1d74f5f3561165 | 2024-02-18T18:39:57+01:00 | Pierrick Hymbert | server : slots monitoring endpoint (#5550) | |
| 712 | e75c6279d1c8e7abb82a331f5de7124eed402de2 | 36376abe05a12a8cb3af548a4af9b8d0e2e69597 | 2024-02-18T17:31:28+01:00 | Pierrick Hymbert | server : enhanced health endpoint (#5548) | |
| 713 | 36376abe05a12a8cb3af548a4af9b8d0e2e69597 | 66c1968f7a2e895675425e875b6589f1233a1b52 | 2024-02-18T17:30:09+01:00 | Pierrick Hymbert | server : --n-predict option document and cap to max value (#5549) | |
| 714 | 66c1968f7a2e895675425e875b6589f1233a1b52 | 1dcc3fde004787e6fc4d84c9de0bb34cd2901a3e | 2024-02-18T08:23:16-08:00 | Daniel Hiltgen | server : graceful server shutdown (#5244) | |
| 715 | 5f5808ca7b7f23a1fa7a77241842bb84a0e55108 | f486f6e1e5e9d01603d9325ab3e05f1edb362a95 | 2024-02-16T11:00:56+01:00 | Rőczey Barnabás | server : fix system prompt cli (#5516) | |
| 716 | f486f6e1e5e9d01603d9325ab3e05f1edb362a95 | 60ed04cf82dc91ade725dd7ad53f0ee81f76eccf | 2024-02-16T01:31:07-08:00 | bmwl | ggml : add numa options (#5377) | |
| 717 | 0d4177126b0556e202efb85bf3f768be81076400 | 7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f | 2024-02-15T09:01:57+01:00 | Elbios | llava : fix memory management bug (#5491) | |
| 718 | aa2341298924ac89778252015efcb792f2df1e20 | f5ca054855dea83f424003162f26de376e5643f6 | 2024-02-14T08:38:35+01:00 | John | llava : support v1.6 (#5267) | |
| 719 | 684780141a08200ec98eba3e982dbafd1d0b5000 | 85910c5b30f6e268321be8df044f5528a6efac52 | 2024-02-11T13:38:14Z | Alexey Parfenov | server : allow to specify tokens as strings in logit_bias (#5003) | |
| 720 | 907e08c1109f498b01036367804cff3082c44524 | f026f8120f97090d34a52b3dc023c82e0ede3f7d | 2024-02-11T11:16:22+01:00 | Xuan Son Nguyen | server : add llama2 chat template (#5425) | |
| 721 | 7c777fcd5dd4af7079e33390cf6a19c328a2666f | e5ca3937c685d6e012ac4db40555d6ec100ff03c | 2024-02-09T02:49:49-08:00 | Riley Stewart | server : fix prompt caching for repeated prompts (#5420) | |
| 722 | 0ef46da632c32faa1a538e5dc180994e8bbb46e1 | ee1628bdfea8b0079fed0140ac2f00ef1b465b57 | 2024-02-07T02:17:25-06:00 | Xiao-Yong Jin | llava-cli : always tokenize special tokens (#5382) | |
| 723 | 213d1439fadefe182f69c5f7e8dd3b4b6572ebcb | 17c97fb0620448b37516a3f53fea6c482b0a30a4 | 2024-02-06T18:08:38Z | Alexey Parfenov | server : remove model.json endpoint (#5371) | |
| 724 | 31e790322133a4b1d0684527ea446e765e8a96cf | 4ffc7a17d4e80c5f3f905139cb570ed9b6934fcb | 2024-02-06T04:20:00-05:00 | Michael Coppola | server : add `dynatemp_range` and `dynatemp_exponent` (#5352) | |
| 725 | 4ffc7a17d4e80c5f3f905139cb570ed9b6934fcb | 906cff55c2848fda091d888a1585915ec0c9ea9e | 2024-02-06T08:16:23Z | Niall Coates | server : various fixes for the prompt field in /completion (#5300) | |
| 726 | a2d60c9158435ae9a6f14632f07f1acf7a3becef | e6f81775323f6f4e4a30abf022a6028fa86b79ac | 2024-02-05T08:10:22Z | Alexey Parfenov | server : allow to get default generation settings for completion (#5307) | |
| 727 | 4be04c8965578edc09194fab769b4b922b8444f5 | 5d55b0cd827bb0fcfedfa329a82bd5d6ef2c93ca | 2024-02-05T10:43:57+03:00 | Нияз Гарифзянов | scripts : add non-interactive server-llm.sh (#5303) | |
| 728 | e437b37fd0b2b97e6c6ff1045ec7f901faa6498a | 2d40085c26794e29c434480b9e06738e89e5686f | 2024-02-02T14:23:40+02:00 | Georgi Gerganov | scripts : parse wtype in server-llm.sh (#5167) | |
| 729 | 6b91b1e0a92ac2e4e269eec6361ca53a61ced6c6 | e805f0fa9951081ce0a86378a7aa52b6f636b82d | 2024-02-02T08:56:31+01:00 | Xuan Son Nguyen | docker : add build for SYCL, Vulkan + update readme (#5228) | |
| 730 | 5cb04dbc16d1da38c8fdcc0111b40e67d00dd1c3 | efb7bdbbd061d087c788598b97992c653f992ddd | 2024-01-31T17:30:17+02:00 | Georgi Gerganov | llama : remove LLAMA_MAX_DEVICES and LLAMA_SUPPORTS_GPU_OFFLOAD (#5240) | |
| 731 | e6f291d15844398f8326940fe5ad7f2e02b5aa56 | 4003be0e5feef320f3707786f22722b73cff9356 | 2024-01-30T20:17:30+02:00 | Georgi Gerganov | server : fix context shift (#5195) | |
| 732 | 4003be0e5feef320f3707786f22722b73cff9356 | fea4fd4ba7f6b754ac795387b275e1a014a77bde | 2024-01-30T12:15:05-06:00 | JohnnyB | server : change deps.sh xxd files to string literals (#5221) | |
| 733 | 813416991ab0d1caa0d12f93ac4e8a24a2add0a3 | 5589921ef84a4fb1c6d1c9c34d626a5a83033db6 | 2024-01-30T10:18:02+01:00 | divinity76 | main : allow empty --prompt-cache file (#5176) | |
| 734 | 6685cc41c237544623b4b5651eceb9c4280728cc | ceebbb5b21b971941b2533210b74bf359981006c | 2024-01-30T17:11:46+08:00 | Wu Jian Ping | server : improve README (#5209) | |
| 735 | c82d18e863fcde91b4b1109b1d0c73ea4470c405 | 14fef85e2d5361e6b4dd7a9ecf22bb817362997d | 2024-01-29T21:48:10+08:00 | Wu Jian Ping | server : embeddings compatibility for OpenAI (#5190) | |
| 736 | 2307523d322af762ae06648b29ec5a9eb1c73032 | 0f648573dde61c510560f68244f70ece7e60d8c1 | 2024-01-28T18:03:59+01:00 | 0cc4m | ggml : add Vulkan backend (#2059) | |
| 737 | 39baaf55a160909bb9428bd981014218761a20cb | 6db2b41a76ee78d5efdd5c3cddd5d7ad3f646855 | 2024-01-28T01:55:31-06:00 | Kyle Mistele | docker : add server-first container images (#5157) | |
| 738 | ec903c034131848da9222536ff18da07ec0882a0 | a1d6df129bcd3d42cda38c09217d8d4ec4ea3bdd | 2024-01-27T14:38:05+01:00 | Maximilian Winter | server : add self-extend support (#5104) | |
| 739 | 48c857aa10aea73210a4a72da3f1a6f99269e75d | 413e7b0559f922bd4de5e9eec548829d111651b1 | 2024-01-26T13:42:20+01:00 | Xuan Son Nguyen | server : refactored the task processing logic (#5065) | |
| 740 | 2bed4aa3f37cb4e39e16e9ec7b595a7738fd5faf | 125d03a5036a02a983c8e98c2cdc126e061afb8e | 2024-01-23T08:11:39+01:00 | Xuan Son Nguyen | devops : add intel oneapi dockerfile (#5068) | |
| 741 | 125d03a5036a02a983c8e98c2cdc126e061afb8e | 011e8ec577fd135cbc02993d3ea9840c516d6a1c | 2024-01-23T01:51:27-05:00 | Michael Coppola | llama.vim : added api key support (#5090) | |
| 742 | 780e24a22eb595b705cbe8284771e9ceff1c4dd2 | 3ce7e8f8e7ccfce07e5947ac5f1f3f4628cf68ea | 2024-01-22T21:15:08+08:00 | Reinforce-II | ggml : parallelize FP32 conversion when using BLAS (#5045) | |
| 743 | 7dcbe39d36b76389f6c5cd3b151928472b7e22ff | 726c0fa9a2da976e9c5d5c51e185d9dd453fc9e5 | 2024-01-21T14:42:44+02:00 | Kawrakow | Add ability to evauate multiple choice tasks (#5047) | |
| 744 | 7051aacfac0057fa5fac9ea46c55bffc3892d810 | 2b3b999cacc7ad1207c32fbdf3479a19c06e1a34 | 2024-01-19T11:39:11+02:00 | Kawrakow | winogrande: evaluate log-probs in parallel (#5036) | |
| 745 | 3e945cc1e9c06d2001031360e4e303e9548fb02c | ad19812cda4062c9f154ef16315df41fbe6a770a | 2024-01-18T19:18:21+02:00 | Kawrakow | HellaSwag: speed up by parallelizing log-prob evaluation (#5020) | |
| 746 | ad19812cda4062c9f154ef16315df41fbe6a770a | 682986a08eb5cb04865d2e713449f17304d266d8 | 2024-01-18T15:33:01+02:00 | Georgi Gerganov | perplexity : faster HellaSwag via batching (#5017) | |
| 747 | 4feb4b33eeb1756e46084a4db9230b279af1a480 | 959ef0c0df725c013c7f712eaa7790b8e38a8e20 | 2024-01-16T18:41:42+01:00 | Maximilian Winter | examples : add complete parallel function calling example (#4974) | |
| 748 | 4be5ef556de830c5c4f6e45c05ef4427823fe607 | 0ea069b87bd296c556824e57455433b6c0357340 | 2024-01-13T20:45:45+02:00 | Georgi Gerganov | metal : remove old API (#4919) | |
| 749 | 0ea069b87bd296c556824e57455433b6c0357340 | f172de03f11465dc6c5a0fc3a22f8ec254c6832c | 2024-01-13T19:31:26+02:00 | Georgi Gerganov | server : fix prompt caching with system prompt (#4914) | |
| 750 | 356327feb3f66980ab687040495d722696d98970 | ee8243adaa9a9f51ff449213383874e49efe368f | 2024-01-13T09:20:46-05:00 | Ziad Ben Hadj-Alouane | server : fix deadlock that occurs in multi-prompt scenarios (#4905) | |
| 751 | ee8243adaa9a9f51ff449213383874e49efe368f | 15ebe59210e7fd9817ff67f51fa1a5ee2d004294 | 2024-01-13T14:16:11Z | makomk | server : fix crash with multimodal models without BOS token (#4904) | |
| 752 | e7e4df031b9e29d4b55a4e0b0295187f6b213db1 | 584d674be622fbf1578694ada6e62eebedbfd377 | 2024-01-12T20:07:38+01:00 | slaren | llama : ggml-backend integration (#4766) | |
| 753 | 1d118386fea031f01550f8cd47a5c86296e5333f | 7edefbd79cc6dea96640edc54c6b94b2b2496d8b | 2024-01-11T23:23:49+02:00 | Georgi Gerganov | server : fix infill when prompt is empty (#4833) | |
| 754 | 4330bd83feb39683de4bd7a34cfcf672ff8ac3e4 | 27379455c38cb13f24de92dbd6fcdd04eeb1b9d9 | 2024-01-11T19:02:48+01:00 | Laura | server : implement credentialed CORS (#4514) | |
| 755 | 27379455c38cb13f24de92dbd6fcdd04eeb1b9d9 | eab67950068e4b125007d027232c47d2a5831cd0 | 2024-01-11T12:51:17-05:00 | Michael Coppola | server : support for multiple api keys (#4864) | |
| 756 | eab67950068e4b125007d027232c47d2a5831cd0 | d8d90aa343c22fe01429d3540e47ded87e9dcb9d | 2024-01-11T12:41:39-05:00 | Behnam M | server : add `LOG_INFO` when model is successfully loaded (#4881) | |
| 757 | 43f76bf1c362c067fce46bb8dcda0b64af8a9533 | 2f043328e3116724d15b915b5c6078e2df860a69 | 2024-01-11T16:14:52Z | pudepiedj | main : print total token count and tokens consumed so far (#4874) | |
| 758 | 2f043328e3116724d15b915b5c6078e2df860a69 | 2a7c94db5fb67b2f8882d2d16a11bf5d8d12d397 | 2024-01-11T09:33:26-05:00 | Isaac McFadyen | server : fix typo in model name (#4876) | |
| 759 | 7a9f75c38b5e62fe27b8a5a3ed823b4a3714024b | 5c1980d8d4c4e0c0af77359f81cc44d90b3f250b | 2024-01-11T02:12:05-05:00 | Behnam M | server : update readme to document the new `/health` endpoint (#4866) | |
| 760 | 5c1980d8d4c4e0c0af77359f81cc44d90b3f250b | cd108e641dbdedd8c5641c4cec1762f751f38136 | 2024-01-11T09:10:34+02:00 | Georgi Gerganov | server : fix build + rename enums (#4870) | |
| 761 | cd108e641dbdedd8c5641c4cec1762f751f38136 | 57d016ba2d46a6e22517a31a75cebb48f9e234b6 | 2024-01-10T14:56:05-05:00 | Behnam M | server : add a `/health` endpoint (#4860) | |
| 762 | 128de3585b0f58b1e562733448fc00109f23a95d | 8c5833031857c9e9ada61948bae894ab9c785f86 | 2024-01-09T05:02:05-05:00 | Behnam M | server : update readme about token probs (#4777) | |
| 763 | 8c5833031857c9e9ada61948bae894ab9c785f86 | 18c2e1752c3b387689e9e73d7d8a1a3b1511ce23 | 2024-01-09T10:12:43+01:00 | Zsapi | server : add api-key flag to documentation (#4832) | |
| 764 | 67984921a70a7e680a24494aeb7575a66e90685d | c75ca5d96f902564cbbbdd7f5cade80d53c288bb | 2024-01-07T08:45:26+02:00 | Georgi Gerganov | server : fix n_predict check (#4798) | |
| 765 | e5804313a1edaf00726ed0b96ecced07accbf50c | dc891b7f7a23158d54f9383790b92c79cc5906c1 | 2024-01-04T03:17:09-05:00 | Michael Coppola | server : fix options in README.md (#4765) | |
| 766 | f2eb19bd8bc9f5730d6e05d7a52a9e19bf5ac099 | f3f62f0d835d559e80714bbeb05d03125574e3dd | 2024-01-03T03:43:19-05:00 | Justin Parker | server : throw an error when `slot unavailable` (#4741) | |
| 767 | f3f62f0d835d559e80714bbeb05d03125574e3dd | 0ef3ca2ac62016c0c545de1c89dc2e3e130f4a99 | 2024-01-02T21:07:47+02:00 | Georgi Gerganov | metal : optimize ggml_mul_mat_id (faster Mixtral PP) (#4725) | |
| 768 | 0ef3ca2ac62016c0c545de1c89dc2e3e130f4a99 | 540938f8904707dd74cb3be18495f853b312e72f | 2024-01-02T15:48:49Z | Phil H | server : add token counts to html footer (#4738) | |
| 769 | 0040d42eeb237197054cc7790df5776eacfa608e | 83e633c27efdf0eb0ba54249e784b0ea760b1007 | 2024-01-02T06:15:16-08:00 | Marcus Dunn | llama : replace all API facing `int`'s with `int32_t` (#4577) | |
| 770 | 5d7002d4372ebf107cfaf46fcd90df27b204f330 | 26f3071d714f0b27ad7f021a46a66a1085480258 | 2024-01-02T04:38:15-06:00 | minarchist | server : add --override-kv parameter (#4710) | |
| 771 | 58ba655af054715c0516ee270ad028ad9e74f357 | edd1ab7bc34c10a780ee7f9a4499f7689cdad36d | 2024-01-02T10:57:44+02:00 | Georgi Gerganov | metal : enable shader debugging (cmake option) (#4705) | |
| 772 | 9fbda719de18a9400a064c28759c39d55d687d3e | 39d8bc71edcb8b6f99d46fa4216af7a15232e218 | 2023-12-30T23:24:42+02:00 | Georgi Gerganov | clip : refactor + bug fixes (#4696) | |
| 773 | 24a447e20af425fa44cf10feaa632b6bb596c80f | a20f3c7465d6d1b33767757c2760643b799a81bf | 2023-12-30T15:07:48+07:00 | automaticcat | ggml : add ggml_cpu_has_avx_vnni() (#4589) | |
| 774 | db49ff8ed7f0bb201176703441cc02911b08ef2a | 60f55e888c29cbd87c4238dd19e85d0eef87245d | 2023-12-29T06:24:12-08:00 | Justine Tunney | server : replace sleep with condition variables (#4673) | |
| 775 | 60f55e888c29cbd87c4238dd19e85d0eef87245d | b93edd22f55d3e5268263c3edcdae1818505c078 | 2023-12-29T22:22:44+08:00 | SakuraUmi | server : fix OpenAI server sampling w.r.t. penalty. (#4675) | |
| 776 | b93edd22f55d3e5268263c3edcdae1818505c078 | 82d6eab224862a7044069fb9211dc4b29124264b | 2023-12-29T06:22:10-08:00 | Karthik Sethuraman | server : allow to generate multimodal embeddings (#4681) | |
| 777 | 441f51dca004debf8b275f1bdc08e0f1af7fd8f8 | 38b3de4658292582a8941a2be5c77b40ce6ac0f2 | 2023-12-29T19:23:27+09:00 | Tamotsu Takahashi | ci : build with CLBlast + ggml-opencl use GGML_API (whisper/1576) | |
| 778 | 65e5f6dadbba4b496bba27f573e473c66b446496 | ea5497df5d138c83b2b0ca70aefdc4b1175c1001 | 2023-12-28T11:20:00-08:00 | Justine Tunney | Fix OpenAI server sampling w.r.t. temp and seed (#4668) | |
| 779 | 6123979952385847d8348e295d77d6e01da8aa84 | b9ec82d262cb20d7f0a8a1157bfa9aace40e2625 | 2023-12-23T09:31:49Z | Alexey Parfenov | server : allow to specify custom prompt for penalty calculation (#3727) | |
| 780 | 31f27758faf4a4bd08101a57c7ec3a473f771f86 | 56fa50819f7a3ca2128f63b81c17c08a4454479e | 2023-12-21T11:57:48-08:00 | Marcus Dunn | llama : allow getting n_batch from llama_context in c api (#4540) | |
| 781 | 2994f0c5a2e8c96955b422dedc93ec2595d16b82 | b1306c439490c7fa4ec33594500d980d1e9e15e6 | 2023-12-17T19:39:02-05:00 | Jared Van Bortel | decode : fix logits_valid for legacy API (#4516) | |
| 782 | 0ffc92d2d23a789625f018840469af045be1e3c0 | 8edd2b40fdbcafbf630f2cf29306b29d5cb48c42 | 2023-12-17T17:02:16+02:00 | olexiyb | server : disable llm logs if SERVER_VERBOSE is off (#3792) | |
| 783 | 8edd2b40fdbcafbf630f2cf29306b29d5cb48c42 | eb16dae7e70ca97396190698b29c0f9ee3388e88 | 2023-12-17T15:57:56+01:00 | AdithyanI | server : fix grammar being ignored (#4494) | |
| 784 | eb16dae7e70ca97396190698b29c0f9ee3388e88 | 62bd52b7bf90819e75f427a95a484cd5eee0b3c7 | 2023-12-17T14:56:09Z | Alexey Parfenov | server : fix possible ambiguity in content type charset (#4501) | |
| 785 | 62bd52b7bf90819e75f427a95a484cd5eee0b3c7 | 5daa5f54fdcd2b5228add1a4c43a1897b2168f35 | 2023-12-17T15:54:37+01:00 | mzcu | server : allow requests larger than 8K (#4500) | |
| 786 | 88ae8952b65cbf32eb1f5703681ea592e510e570 | ee4725a686643669a8587142fa068cbf29de3ce2 | 2023-12-15T13:49:01+02:00 | ShadovvBeast | server : add optional API Key Authentication example (#4441) | |
| 787 | 948ff137ec37f1ec74c02905917fa0afc9b97514 | 4d98d9a65665eee3838cef936641f640e3f5b649 | 2023-12-13T23:57:15+04:00 | shibe2 | server : fix handling of characters that span multiple tokens when streaming (#4446) | |
| 788 | fecac45658a99eddc4d6e36ba0310ca8f87a77f0 | 9494d7c4774ab745490b5a19570ff7747a194143 | 2023-12-12T04:12:35-06:00 | kalomaze | server : tweak default sampling parameters (#4367) | |
| 789 | d9d4cfef64ea416dd66632173787d03ffb180cc7 | 41a11aaf99feff4901e4c8dc48ad00766c5da4e9 | 2023-12-12T11:25:29+02:00 | Vladimir Zorin | server : fix local model name in server (#4420) | |
| 790 | bcc0eb4591bec5ec02fad3f2bdcb1b265052ea56 | 81bc9214a389362010f7a57f4cbc30e5f83a2d28 | 2023-12-07T13:03:17+02:00 | Georgi Gerganov | llama : per-layer KV cache + quantum K cache (#4309) | |
| 791 | 05cd6e5036d72d0930de4d8f6be7bce09e8dda24 | caa9249217c5fd524b900add5ddcbeaa20cbcb12 | 2023-12-06T20:21:59+02:00 | Georgi Gerganov | server : recognize cache_prompt parameter in OAI API (#4347) | |
| 792 | 23b5e12eb5a76489b4c3ee22213a081da68b1809 | d208995c6da66f252d4054c1c5a90eb8ccb7a2f7 | 2023-12-04T17:04:21+01:00 | Daniel Bevenius | simple : update error message for KV cache check (#4324) | |
| 793 | 33e171d1e9fc4903f9314b490d77fb8d58331b63 | 6949b50df56ee58a2d76d45487942cb211c08629 | 2023-12-03T01:10:43-08:00 | Ed Lee | server : fix OpenAI API `stop` field to be optional (#4299) | |
| 794 | 6949b50df56ee58a2d76d45487942cb211c08629 | d7b800b8bc490a221acbd83c575206a907f2f6e2 | 2023-12-03T10:03:25+01:00 | Rickard Edén | py : add grammar to oai like api (#4294) | |
| 795 | 1d144112c0fbbb4ecc07dbcf4f05a380148bd6de | f43f09366dfd018e4568e23a232aaa8c4f7cfc78 | 2023-11-30T17:25:49-05:00 | Ziad Ben Hadj-Alouane | server : add --log-disable to disable logging to file (#4260) | |
| 796 | f43f09366dfd018e4568e23a232aaa8c4f7cfc78 | d2809a3ba2780e00fce5a6149a7eda09f1c0e906 | 2023-11-30T17:25:04-05:00 | Ziad Ben Hadj-Alouane | server : add single-client multi-prompt support (#4232) | |
| 797 | e2bd725f4b39bc5c6234858d158e01248f5ab5bd | 1f5cd83275fabb43f2ae92c30033b384a3eb37b4 | 2023-11-30T20:50:40Z | rhjdvsgsgks | py : fix oai proxy (#3972) | |
| 798 | af19d3573481d409b3c4e55494810eb1f65a9aae | e9c13ff78114af6fc6a4f27cc8dcdda0f3d389fb | 2023-11-25T11:29:06+02:00 | Georgi Gerganov | server : OAI API compatibility (#4198) | |
| 799 | 6b0a7420d03b9d13cb0e9439a01ce8476d8bf093 | d103d935c0e75769a6a597f7a64cab72c6cc3e79 | 2023-11-23T19:07:56+02:00 | Georgi Gerganov | llama : KV cache view API + better KV cache management (#4170) | |
| 800 | 9d5949f04b1f8b76184818abbd99938c2020803f | ff8238f71d56245f4a6dbea693f4ebd81263464d | 2023-11-23T12:34:20+01:00 | Daniel Bevenius | examples : fix typo in parallel example doc comment (#4181) | |
| 801 | 936c79b2275a8f15f3512e63de615c676904d650 | 262005ad9ded375e9c544a02c18ef6254fe185a2 | 2023-11-19T11:54:10-05:00 | SoftwareRenderer | server : relay error messages (#4131) | |
| 802 | 9e87ef60e18d69338c5efea314aa7e718bf2040a | c7cce1246e248124117ae5bc058923e3ade95f11 | 2023-11-17T16:24:07+01:00 | Jannis Schönleber | common : improve yaml log escaping (#4080) | |
| 803 | 4760e7cc0b68570d58f55e8dda469805d1759d0d | bb50a792ec2a49944470c82694fa364345e95170 | 2023-11-13T14:16:23+02:00 | Georgi Gerganov | sync : ggml (backend v2) (#3912) | |
| 804 | 532dd74e38c29e16ea1cfc4e7eedb4f2fab3f3cd | e86fc56f7521ca4b18d1d9939e82abd40c2f1c01 | 2023-11-11T22:04:58-08:00 | Richard Kiss | Fix some documentation typos/grammar mistakes (#4032) | |
| 805 | d96ca7ded77df764db797b68b4a29e34c5b56285 | 34b0a082074b073eb14c2bd93c0c070e20ddcd16 | 2023-11-11T05:48:21Z | Alexey Parfenov | server : fix crash when prompt exceeds context size (#3996) | |
| 806 | 4a4fd3eefad5bd17ab6bcd8e2181b4f62eae76cf | df9d1293defe783f42bc83af732d3c670552c541 | 2023-11-11T06:49:33+08:00 | Jhen-Jie Hong | server : allow continue edit on completion mode (#3950) | |
| 807 | 57ad015dc3011b046ed5a23186c86ea55f987c54 | 875fb42871a0f5a88fbe31a0b5edd697b84038e4 | 2023-11-09T04:00:34+02:00 | Mihai | server : add min_p param (#3877) | |
| 808 | 381efbf480959bb6d1e247a8b0c2328f22e350f8 | 2833a6f63c1b87c7f4ac574bcf7a15a2f3bf3ede | 2023-11-06T22:36:23+01:00 | Damian Stewart | llava : expose as a shared library for downstream projects (#3613) | |
| 809 | bb60fd0bf6bb270744d86dd45b3a95af01b7de45 | 132d25b8a62ea084447e0014a0112c1b371fb3f8 | 2023-11-05T23:15:27+07:00 | Thái Hoàng Tâm | server : fix typo for --alias shortcut from -m to -a (#3958) | |
| 810 | 50337961a678fce4081554b24e56e86b67660163 | 0e40806c1cb3bdf9955ed807ffbe212be85b4c67 | 2023-11-01T20:11:02+02:00 | Georgi Gerganov | llm : add llm_build_context (#3881) | |
| 811 | f0e209324a7f663225791897877bf610f1af152d | ca190bca8e844d171020d6147687e71472d71734 | 2023-11-01T11:29:07+02:00 | Georgi Gerganov | scripts : add server-llm.sh (#3868) | |
| 812 | ca190bca8e844d171020d6147687e71472d71734 | 71e3718abdb2771b50c9606d3a7569623a0b0afe | 2023-11-01T09:28:28Z | Adrian Hesketh | server : re-enable completion and embedded at the same time (#3876) | |
| 813 | 82a6646e0221216c41edcdf99f5a44bb051391f5 | ba231e8a6dd8ad82acfe0e4d492ff7cef6b3f0a1 | 2023-10-28T15:43:01+03:00 | Aarni Koskela | metal : try cwd for ggml-metal.metal if bundle lookup fails (#3793) | |
| 814 | 34b2a5e1ee4fe6295fb4420eb91131d743694c65 | 6961c4bd0b5176e10ab03b35394f1e9eab761792 | 2023-10-26T22:53:37+03:00 | Georgi Gerganov | server : do not release slot on image input (#3798) | |
| 815 | ad939626577cd25b462e8026cc543efb71528472 | 1717521cdb976a2219888b0e5cba36e210eee9df | 2023-10-24T16:10:43-04:00 | cebtenzzre | server : add parameter -tb N, --threads-batch N (#3584) (#3768) | |
| 816 | 1717521cdb976a2219888b0e5cba36e210eee9df | b2f7e04bd312eaf97eee0523aa09d950d585626b | 2023-10-24T23:08:20+03:00 | Georgi Gerganov | server : do not block system prompt update (#3767) | |
| 817 | 5be6c803fa5378f62a1590f3ad8c6b64c7c0c2ce | 6336701c9378c23c85d1c0e464b663ca2bbb8e60 | 2023-10-23T12:40:03-07:00 | Marcus Dunn | llama : remove token functions with `context` args in favor of `model` (#3720) | |
| 818 | 438c2ca83045a00ef244093d27e9ed41a8cb4ea9 | 9e70cc03229df19ca2d28ce23cc817198f897278 | 2023-10-22T22:53:08+03:00 | Georgi Gerganov | server : parallel decoding and multimodal (#3677) | |
| 819 | d3956aea53369455008159cc405ed4c496976692 | 22c69a27945e7acf9690dd3210d316f22182751c | 2023-10-22T20:09:51+02:00 | vvhg1 | main : escape prompt for cfg_negative_prompt and consecutive inputs in main with interactive (#3623) | |
| 820 | d1031cf49c3b958b915fd558e23453471c29ac33 | 8cf19d60dc93809db8e51fedc811595eed9134c5 | 2023-10-20T21:07:23+03:00 | Georgi Gerganov | sampling : refactor init to use llama_sampling_params (#3696) | |
| 821 | a0edf73bda31c7c4e649e6f07c6fd30a729929cd | f439e506e8ae8b01df2ae2156380f8156d7553e3 | 2023-10-20T13:06:10+03:00 | Georgi Gerganov | server : fix uninitialized sampling context (close #3685) | |
| 822 | 0e89203b517c95ec6675eda75d200a60d1e8921d | c67fe68e417f766970fb1feaf2e66458aa24116a | 2023-10-18T16:21:57+03:00 | Georgi Gerganov | speculative : add tree-based sampling example (#3624) | |
| 823 | 3ad1e3f1a10c1f66b4f1cd7510e0977fadbc0dfd | 1142013da40e98946a109b141dd858f0ed996051 | 2023-10-17T18:51:02+02:00 | coezbek | server : documentation of JSON return value of /completion endpoint (#3632) | |
| 824 | b016596d903641f8825cd94bb6742e1de0c21017 | 6b3ae4da92485f979a0f45774fcf68597634db0b | 2023-10-12T15:51:53+09:00 | Aarni Koskela | server : add completion mode (no chat) (#3582) | |
| 825 | 57dd55e2c742bfc50e0f5c6fb95c14118cff44f6 | b8fe4b5cc9cb237ca98e5bc51b5d189e3c446d13 | 2023-10-12T09:29:04+03:00 | Georgi Gerganov | server : fix kv cache management (#3588) | |
| 826 | a8bdd65525ae86dea905e9866ad369b53e30ac14 | 70c29da118cdb02bfcbd0376c32b5b2236e48e48 | 2023-10-11T15:42:22-04:00 | Michael Coppola | server : add parameter -tb N, --threads-batch N (#3584) | |
| 827 | 11ea5c7d96f2c28e1c99659e08ec0a44574056e2 | 95bd60a0a69f57e9a2ff1269667ea484a1a9bb40 | 2023-10-10T09:31:21+02:00 | vvhg1 | infill. : fix tokenization (#3508) | |
| 828 | 8e6716a102e390e930594d51302730184dac83cc | 9c38d181d40b9d27f8f42152c18e7c70bfffcf37 | 2023-10-08T03:55:58-07:00 | Ryder Wishart | api_like_OAI.py : compat with Microsoft Guidance (#2746) | |
| 829 | 9c38d181d40b9d27f8f42152c18e7c70bfffcf37 | a1202a31ed8c35705bd09fe91c3e7410c619bd70 | 2023-10-08T06:52:57-04:00 | arcrank | api_like_OAI.py : simplify function (#2796) | |
| 830 | cb13d73a720c42d1958bff79b6869d77b26b8cea | 9ca79d5cbbc8d43f2bff951404b6a40ff1ee3788 | 2023-10-06T21:39:33+03:00 | Mihai | server : docs fix default values and add n_probs (#3506) | |
| 831 | 9ca79d5cbbc8d43f2bff951404b6a40ff1ee3788 | 0c731ca4039ccff86ffab90eaae4ca98037c4496 | 2023-10-06T10:10:13-06:00 | Kerfuffle | kv cache slot search improvements (#3493) | |
| 832 | a8777ad84e00cda0399e827cdf971e2c3fab1da2 | 97af49fa395df77e4c18af0e1655b2fee67c9686 | 2023-10-06T14:16:38+01:00 | pudepiedj | parallel : add option to load external prompt file (#3416) | |
| 833 | 97af49fa395df77e4c18af0e1655b2fee67c9686 | 16820a5a0d885113f21021ce934f0b0027b9d69a | 2023-10-06T07:44:24-05:00 | Jhen-Jie Hong | server : reuse llama_sample_token common util (#3494) | |
| 834 | e8b8d32e8663ffc55a02c9721af3a5190382cbb0 | 8f3a642ec1d878b2d0a0d15e3a4277f522790d4c | 2023-10-05T09:02:55-05:00 | Jhen-Jie Hong | server : fix incorrect num_tokens_predicted (#3480) | |
| 835 | ac2219fef34eb5b713c286c34c6e4162c39c8f3b | 48be797ffbd80b062f55778e09e97180eb25d2ab | 2023-10-03T21:04:01+03:00 | Georgi Gerganov | llama : fix session saving/loading (#3400) | |
| 836 | 48be797ffbd80b062f55778e09e97180eb25d2ab | f56e1baec361b5381e32ee6b6e56e4f00e002dfe | 2023-10-03T10:09:28-07:00 | Alex Klinkhamer | llama : expose model's rope_freq_scale in the API (#3418) | |
| 837 | c97f01c362ac102c6994edb80008f8608539553a | f5ef5cfb18148131fcf45bdd2331f0db5ab7c3d0 | 2023-10-02T09:42:02+02:00 | vvhg1 | infill : add new example + extend server API (#3296) | |
| 838 | 7f1a0fe709ea1a861da2f3759f58a28bf8953c12 | 16bc66d9479edd5ee12ec734973554d4493c5dfa | 2023-09-29T03:51:52+08:00 | Qu Zongfu | ggml : release the requested thread pool resource (#3292) | |
| 839 | 0e76a8992c8200237bbc6471a53fb8796b3872f7 | 2db94d98eda56982d80238840b0652b4137a2a84 | 2023-09-28T20:40:11+02:00 | xaedes | train : finetune LORA (#2632) | |
| 840 | ec893798b7a2a803466cc8f063051499ec3d96f7 | 45855b3f1c7bdd0320aa632334d0b3e8965c26c4 | 2023-09-28T19:04:36+03:00 | Georgi Gerganov | llama : custom attention mask + parallel decoding + no context swaps (#3228) | |
| 841 | dc6897404e141c74cbbf8030ecfebd74e1815411 | 527e57cfd8a9a26bf622c0510c21c2508a24be26 | 2023-09-27T17:48:33+02:00 | Rickard Hallerbäck | metal : reusing llama.cpp logging (#3152) | |
| 842 | be8c9c245bd129ebabb80e0a7a8dd7daeb4d30af | be6beeb8d75294552c4918fce06d7b84eebf3d79 | 2023-09-07T15:45:01+02:00 | Kawrakow | metal : parallel RoPE on Metal (#3024) | |
| 843 | e4386f417faf894f6706eec005e24d142b577fcb | 35195689cd835464779c247b1c22ab9247418fd1 | 2023-09-04T10:28:55+02:00 | Aarni Koskela | server : add a subtle loading animation to the edit box (#2466) | |
| 844 | 571083f508266c4eb5cb5457d836df5dd3c173ce | f04d0028444bc9b3d4225fba47e19d4c3aeb3741 | 2023-09-02T08:31:46+08:00 | Jhen-Jie Hong | server : avoid aniprompt in probabilities of final response (#2849) | |
| 845 | 44c117f41ee01c5ac8fb86bba041f08d8b87b46d | 43033b7bb4858da4f591715b3babdf906c9b7cbc | 2023-08-28T21:51:47+02:00 | xaedes | train : mem usage and other improvements (#2439) | |
| 846 | c1ac54b77aaba10d029084d152be786102010eb2 | 730d9c681e339b76407659344e5a2cd50af7d7d5 | 2023-08-26T16:11:45-07:00 | Bruce MacDonald | server : add `/detokenize` endpoint (#2802) | |
| 847 | 730d9c681e339b76407659344e5a2cd50af7d7d5 | c7d92e6dfec3f54849f3a0ba373054d29f321ea2 | 2023-08-26T14:13:36-06:00 | Kerfuffle | convert.py : advanced option (#2753) | |
| 848 | 2ba83c8685177faea3399db9564f9c52df75c366 | bae5c5f679e043371bc2b4dffff8d4964d6cb953 | 2023-08-26T13:45:53+02:00 | klosax | Fix spm whitespaces (#2806) | |
| 849 | bae5c5f679e043371bc2b4dffff8d4964d6cb953 | 232caf3c1581a6cb023571780ff41dc2d66d1ca0 | 2023-08-26T10:07:43+02:00 | lon | examples : skip unnecessary external lib in server README.md how-to (#2804) | |
| 850 | 29674ab4e847fcaba60cc6558f0d46d5f74ae279 | 5439a0ab57c16b556ffa91a0953df5e46b1e7fb4 | 2023-08-25T18:32:45+08:00 | Jhen-Jie Hong | server : display token probabilities in the UI (#2489) | |
| 851 | cf658adc832badaaa2ca119fe86070e5a830f8f6 | a192860cfec89a38d59a943623bf595b1fe4495b | 2023-08-23T23:08:04+03:00 | Georgi Gerganov | llm : add Falcon support (#2717) | |
| 852 | b8ad1b66b23f9b2e6e4531e9a62753323036a556 | f5fe98d11bdf9e7797bcfb05c0c3601ffc4b9d26 | 2023-08-23T02:12:12-05:00 | Xiao-Yong Jin | server : allow json array in prompt or content for direct token input (#2306) | |
| 853 | 46ef5b5fcf4c366e1fb27726b6394adbbf8fd0ea | c63bb1d16a70c03440671b76954bb767513cead8 | 2023-08-22T23:10:42+02:00 | goerch | llama : fix whitespace escaping in tokenizer (#2724) | |
| 854 | 226255b44ef2c2794bfac48d101d35a9c2dbb965 | 930523c8e1cbbee5449c055daa894917fac6805e | 2023-08-22T08:32:00+08:00 | Jhen-Jie Hong | server : fallback to default if client param is null (#2688) | |
| 855 | 6381d4e110bd0ec02843a60bbeb8b6fc37a9ace9 | dadbed99e65252d79f81101a392d0d6497b86caa | 2023-08-21T23:07:43+03:00 | Georgi Gerganov | gguf : new file format with flexible meta data (beta) (#2398) | |
| 856 | 1f0bccb27929e261744c979bc75114955da49e98 | f63564adfaa157ca387071d6b9a06cfaef0ef576 | 2023-08-19T00:45:36+03:00 | Georgi Gerganov | server : better default prompt (#2646) | |
| 857 | f63564adfaa157ca387071d6b9a06cfaef0ef576 | 2d8b76a110d76ff6b5728ff0af8477531e4db60e | 2023-08-19T05:41:32+08:00 | Jhen-Jie Hong | server : update xxd usage for older versions compatibility (#2649) | |
| 858 | 10151bee2e38b5711335c4a38f6ca93b50223acf | 0992a7b8b18a89e29a205efb48ceb559c9a08203 | 2023-08-17T23:34:01Z | staviq | server : support for saving templates in browser LocalStorage (#2486) | |
| 859 | 3ebb00935f3f0522b75df49c2769ab1774b91380 | d783f7982e0e823a2626a9956359c0d36c1a7e21 | 2023-08-15T06:14:14+08:00 | Jhen-Jie Hong | server : add missing /json-schema-to-grammar.mjs (#2616) | |
| 860 | d75561df207d22790609ee0ad924302f66ac2599 | 348acf188c9fbe66396990f2dc83229df367969b | 2023-08-14T15:36:42+02:00 | Cheng Shao | server : add --numa support (#2524) | |
| 861 | 2feb8934eb75ca63f3c42724229cce1df9579c8e | 5517d6e69214cdead000a76983b9fe175c3f8329 | 2023-08-14T16:20:17+08:00 | Jhen-Jie Hong | server : fix default grammar by use empty string in the UI (#2604) | |
| 862 | 5517d6e69214cdead000a76983b9fe175c3f8329 | f31b5397143009d682db90fd2a6cde83f1ef00eb | 2023-08-14T15:16:54+08:00 | Jhen-Jie Hong | server : implement json-schema-to-grammar.mjs & add grammar param in the UI (#2588) | |
| 863 | 53dc399472d5bd35ee739b865e843b1996bd3814 | 9ca4abed893685692f90413e4d43153af12342d9 | 2023-08-12T06:35:14+08:00 | Equim | server: fixed wrong variable name in timing json (#2579) | |
| 864 | 1638757767072a4957f52b9e3594f0b67610631b | 916a9acdd0a411426690400ebe2bb7ce840a6bba | 2023-08-10T12:16:38+02:00 | Martin Krasser | Fix grammar-based sampling issue in server (#2566) | |
| 865 | 182af739c4ce237f7579facfe8f94dc53a1f573f | 4329d1acb01c353803a54733b8eef9d93d0b84b2 | 2023-08-04T15:00:57-04:00 | Cebtenzzre | server: regenerate completion.js.hpp (#2515) | |
| 866 | 5f631c26794b6371fcf2660e8d0c53494a5575f7 | 415e99fec27be5a2e4283f1937afd17eb33fbd66 | 2023-08-04T06:37:24-05:00 | Stephen Nichols | Fixing race condition in server and partial stream handling in frontend. (#2391) | |
| 867 | 415e99fec27be5a2e4283f1937afd17eb33fbd66 | ff966e7ca6af127c9405523cdb07ef8fa01bf6d6 | 2023-08-04T19:29:52+08:00 | l3utterfly | Stream save llama context data to file instead of allocating entire buffer upfront (#2488) | |
| 868 | c574bddb368424b5996cbee2ec45ec050967d404 | 86aeb27734481751592abd85590020b40d9224c8 | 2023-08-01T20:54:28+08:00 | Bono Lv | fix a typo in examples/server/README.md (#2478) | |
| 869 | 86aeb27734481751592abd85590020b40d9224c8 | 1873ff586bd8499a18f763632711bf15d253585e | 2023-08-01T01:56:23-07:00 | ebraminio | server : Support dark mode (#2414) | |
| 870 | 34ae1caf7fdea4c4c09087002e15e6230102e6a9 | d91f3f0c55663719ea03b76311e8c36ed55eb0e2 | 2023-07-29T03:02:10+09:00 | nhamanasu | examples : server chat mode with llama2 (#2400) | |
| 871 | d5512b782b27ff698007dcd175da18959d5f163f | c798308e3a425eae050a1f249a576fa8c6433327 | 2023-07-25T11:36:17+02:00 | slaren | server: add rms_norm_eps parameter (#2380) | |
| 872 | c798308e3a425eae050a1f249a576fa8c6433327 | 41c674161fb2459bdf7806d1eebead15bc5d046e | 2023-07-25T10:27:34+03:00 | Henri Vasserman | [Server] Escape HTML in webchat (#2368) | |
| 873 | b3f138d05849ccbce67303ac17b50ebbc268128a | 5b2b2dc6ae8086bff7c9b3c17fb435cf319b7185 | 2023-07-24T17:54:22+03:00 | Aarni Koskela | Chat UI extras (#2366) | |
| 874 | 4f06592cc6b83979e4b442e8cb97b3948c857188 | 70d26ac3883009946e737525506fa88f52727132 | 2023-07-23T17:31:17-03:00 | IgnacioFDM | Add gqa parameter support to the server (#2351) | |
| 875 | 355c80f49e32b0b15c0a457f3bad380e57f5b9ac | 83a00ce69bef9124c0702424a012ea799128b77d | 2023-07-23T06:16:48-05:00 | AustinMroz | examples : simplify vim plugin (#2327) | |
| 876 | 24baa54ac1ff3d4156a2360deb1473af04a9b1a2 | dd6c67d3cbb7b360747f776412bf01976aa32f4b | 2023-07-22T12:34:51+02:00 | whoreson | examples : basic VIM plugin | |
| 877 | 9cf022a1889e50113fd348dc96b4557fc75a6296 | e782c9e735f93ab4767ffc37462c523b73a17ddc | 2023-07-21T09:42:21+02:00 | Przemysław Pawełczyk | make : fix embdinput library and server examples building on MSYS2 (#2235) | |
| 878 | 294f424554c1599784ac9962462fc39ace92d8a5 | 45a1b07e9b20c33d71d8c849ff27d693a75a0269 | 2023-07-19T15:06:40+08:00 | Rinne | llama : extend API to get max devices at runtime (#2253) | |
| 879 | 6e7cca404748dd4b1a3affd0d1296e37f4ac0a6f | a6803cab946c817fb7aaf2a40b317f5d3e373bd1 | 2023-07-15T06:34:16-04:00 | Xiao-Yong Jin | llama : add custom RoPE (#2054) | |
| 880 | 3ec7e596b2ba3f43c22f441254ca2bcfa91102ba | 917831c63a4138814d23da1917bf2b5d5b9faa6c | 2023-07-12T01:12:35+09:00 | Jinwoo Jeong | docker : add '--server' option (#2174) | |
| 881 | 5656d10599bd756dc0f17284e418e704200b43f3 | 1d1630996920f889cdc08de26cebf2415958540e | 2023-07-10T11:49:56-04:00 | Evan Miller | mpi : add support for distributed inference via MPI (#2099) | |
| 882 | 1d656d6360359cfdaaf5d64ed9690047b600dbcb | 72421402834141df6cbdcf595fe46dbd11874dce | 2023-07-08T00:24:01+08:00 | Qingyou Meng | ggml : change ggml_graph_compute() API to not require context (#1999) | |
| 883 | 31cfbb1013a482e89c72146e2063ac4362becae7 | 983b555e9ddb36703cee4d22642afe958de093b7 | 2023-07-05T16:51:13-04:00 | Tobias Lütke | Expose generation timings from server & update completions.js (#2116) | |
| 884 | 983b555e9ddb36703cee4d22642afe958de093b7 | ec326d350c72afd23709a409944728a607188cc0 | 2023-07-05T18:03:19Z | Jesse Jojo Johnson | Update Server Instructions (#2113) | |
| 885 | 8567c76b5326e862be0755a8dc1dd988223fcae3 | 924dd22fd3ba93e097f8d19ba5cda919ca2fe2fb | 2023-07-05T15:13:35Z | Jesse Jojo Johnson | Update server instructions for web front end (#2103) | |
| 886 | f257fd255044decffad93dee2502875ce66ad80c | 7ee76e45afae7f9a7a53e93393accfb5b36684e1 | 2023-07-05T03:06:12+09:00 | jwj7140 | Add an API example using server.cpp similar to OAI. (#2009) | |
| 887 | 7ee76e45afae7f9a7a53e93393accfb5b36684e1 | acc111caf93fc6681450924df9f99679c384c59e | 2023-07-04T10:05:27-04:00 | Tobias Lütke | Simple webchat for server (#1998) | |
| 888 | acc111caf93fc6681450924df9f99679c384c59e | 23c7c6fc9182b041f006b86ea1e7f99911ecf344 | 2023-07-04T15:38:04+03:00 | Henri Vasserman | Allow old Make to build server. (#2098) | |
| 889 | 1cf14ccef12e19c5a5b0b17ab456242d1f8c7fdd | cc45a7feb8412e84ff292207621412fffc0d3d51 | 2023-07-04T00:05:23+03:00 | Henri Vasserman | fix server crashes (#2076) | |
| 890 | d7d2e6a0f0c74f7a570dae384dfff371ac744d2a | 46088f72318981341a2d646f12f6eee6aec06d65 | 2023-07-03T05:38:44+08:00 | WangHaoranRobin | server: add option to output probabilities for completion (#1962) | |
| 891 | b1ca8f36a9cdbcee5f5c425df717611a1040a897 | b8c8dda75fdf5fdea49c80af36818e7c30fe0ddf | 2023-07-01T23:42:43+08:00 | Qingyou Meng | ggml : disable GGML_TASK_INIT and GGML_TASK_FINALIZE by default (#1995) | |
| 892 | b853d456018b10820686362af41b2f2f75f1eec6 | 9225baef71407d799a6f7f563b77fd7f82791416 | 2023-06-26T13:57:59-04:00 | zrm | ggml : add NUMA support (#1556) | |
| 893 | c2a08f87b8d180115d04b8688f383d1b2761b16d | 66a2555ba6cab954c56d653b29c27bfbbacfbfb1 | 2023-06-25T08:48:36Z | anon998 | fix server sampling: top k sampler first (#1977) | |
| 894 | 527b6fba1d237befb324fd846bda7418c0fa394d | d7b7484f74d486f77feb4c0b7af7e1718ed91651 | 2023-06-24T11:47:58+03:00 | Didzis Gosko | llama : make model stateless and context stateful (llama_state) (#1797) | |
| 895 | 20568fe60f00155fa25e92eb3a7f6b911d557967 | 18b35625c3c19c64b7818a12460ba5ddb006dfdc | 2023-06-20T01:12:39+03:00 | Henri Vasserman | [Fix] Reenable server embedding endpoint (#1937) | |
| 896 | fc45a81bc642b9ef33d9004f2b363d558438a6c9 | 794db3e7b982fee37e3995db9c3a216a57ff65e3 | 2023-06-17T17:13:05+05:00 | Faez Shakil | exposed modules so that they can be invoked by nix run github:ggerganov/llama.cpp#server etc (#1863) | |
| 897 | 794db3e7b982fee37e3995db9c3a216a57ff65e3 | 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 | 2023-06-17T07:53:04-04:00 | Randall Fitzgerald | Server Example Refactor and Improvements (#1570) | |
| 898 | 9dda13e5e1f70bdfc25fbc0f0378f27c8b67e983 | 37e257c48e350cf03c353c10d31e777f8d00123d | 2023-06-15T18:36:38+01:00 | Srinivas Billa | readme : server compile flag (#1874) | |
| 899 | 4bfcc855abdb2c9fcc3c5a84747974521909fa41 | 6b8312e7979b852f6b6ac9d29cd51fda16c17948 | 2023-06-15T20:29:48+03:00 | Georgi Gerganov | metal : parallel command buffer encoding (#1860) | |
| 900 | e32089b2c20b1b87b22912f4a8b93fe01647d5b9 | 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 | 2023-06-13T21:04:40+02:00 | xaedes | train : improved training-from-scratch example (#1652) | |
| 901 | 17366df842e358768c0df7024484fffecfc7865b | 44f906e8537fcec965e312d621c80556d6aa9bec | 2023-06-06T21:33:23+02:00 | Johannes Gäßler | Multi GPU support, CUDA refactor, CUDA scratch buffer (#1703) | |
| 902 | 7552ac586380f202b75b18aa216ecfefbd438d94 | 5d1830b99dfd85bb6279adb4dd94aa444afd5b5e | 2023-05-29T19:31:44+03:00 | Georgi Gerganov | ggml : sync cgraph import / export API | |
| 903 | 1b78ed20818b72306edc7208b9bfb69a1a0d3297 | 337aea11390221bc925e4acb1f603f1649af2735 | 2023-05-28T11:48:57-06:00 | Kerfuffle | Only show -ngl option when relevant + other doc/arg handling updates (#1625) | |
| 904 | 0df7d63e5ba0ab8856476e121a03b985d6f15c9d | 97c9b77c4fc5e2283755c4418759cfc5fc73ad05 | 2023-05-27T11:04:14-06:00 | Kerfuffle | Include server in releases + other build system cleanups (#1610) | |
| 905 | 7e4ea5beff567f53be92f75f9089e6f11fa5dabd | 7780e4f479dc5af106287c164b8e186cd9b6215c | 2023-05-21T11:51:18-06:00 | Steward Garcia | examples : add server example with REST API (#1443) | |
| 906 | affc76edfdefa7b326f526e463cc65ff13fcfb92 | ea600071cb005267e9e8f2629c1e406dd5fde083 | 2023-05-20T14:19:28+02:00 | Johannes Gäßler | cuda : loading models directly into VRAM, norm calculation on GPU, broadcasting for ggml_mul (#1483) | |
| 907 | ec2e10c4443209da56b431b24dd0845b60e757fb | d2c59b8ba498ab01e65203dde6fe95236d20f6e7 | 2023-05-20T11:06:11+03:00 | Georgi Gerganov | llama : add llama_init_backend() API (close #1527) | |
| 908 | 7694b52b9a206b93d59139c3c7c9b55da0f5aa59 | 79e3efb0e97b65b6cc72cd9ee970fa8189ad79a4 | 2023-05-19T10:24:59-07:00 | Jason McCartney | main : make reverse prompt option act as a stop token in non-interactive mode (#1032) | |
| 909 | 5ea43392731040b454c293123839b90e159cbb99 | ee9654138ab0ae5f138f4abddf56ca234ea3c352 | 2023-05-18T19:31:01+02:00 | Erik Scholz | make kv_f16 the default for api users (#1517) | |
| 910 | f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b | f048af0230ad5381bb20b9e3c1467ec6fc7debdf | 2023-05-13T14:56:40+02:00 | xaedes | ggml : implement backward pass for llama + small training-llama-from-scratch example (#1360) | |
| 911 | dd7eff57d8491792010b1002b8de6a4b54912e5c | 7fc50c051ae8a78e9643fdf172d12e20f2dd9b6c | 2023-04-29T08:34:41+03:00 | Ivan Stepanov | llama : new sampling algorithms (#1126) | |
| 912 | c4fe84fb0d28851a5c10e5a633f82ae2ba3b7fae | 1d78fecdab4087028a38517e86ed129f077174d8 | 2023-04-24T07:40:02+03:00 | Georgi Gerganov | llama : refactor get / set state + remove redundant kv cache API (#1143) | |
| 913 | b6e7f9b09e9c340ec97a2fae61c1eb8db861f2f9 | 50cb666b8a2e35a49b08c0f6bc81138c8f6f2ac1 | 2023-04-22T08:21:32+02:00 | xaedes | llama : add api for getting/setting the complete state: rng, logits, embedding and kv_cache (#1105) | |
| 914 | a32f7acc9f54dba1c728cb1e596bd00bf3b4eb5f | 43ffdefb7424f79a3d510c199e2ea86684b4f824 | 2023-04-14T15:37:11+02:00 | Pavol Rusnak | py : cleanup dependencies (#962) | |
| 915 | 95ea26f6e92d620a5437f576b80868aee7f808d6 | 82d146df9b43cf677e0dbce20b03cf864958a0cc | 2023-04-13T14:46:23+02:00 | SebastianApel | benchmark : add tool for timing q4_0 matrix multiplication (#653) | |
| 916 | f963b63afa0e057cfb9eba4d88407c6a0850a0d8 | aaf3b23debc1fe1a06733c8c6468fb84233cc44f | 2023-04-08T12:24:37-07:00 | comex | Rewrite loading code to try to satisfy everyone: | |
| 917 | e986f94829bae0b9e66b326acbbba179931c84f1 | c0bb1d3ce21005ab21d686626ba87261a6e3a660 | 2023-04-02T12:23:04+02:00 | Christian Falch | Added api for getting/setting the kv_cache (#685) | |
| 918 | f4f5362edb01b05c383b23f36d7b3489c77061b5 | 863f65e2e32dc1e6d23c96a4811bf382d6b2a548 | 2023-03-24T15:23:09Z | Gary Mulder | Update README.md (#444) | |
| 919 | 56e659a0b271436e24813a801640d015e7b05328 | 40ea807a972ec7b5a426f034ebfa593b5e7a06ed | 2023-03-22T17:09:38+01:00 | Erik Scholz | fix perplexity after c-api refactor (#390) | |
| 920 | f5a77a629bd0f37ae1696747633ab42a5530ec15 | da0e9fe90ccf6e73597eb19dd0cfc0a28363fb3b | 2023-03-22T07:32:36+02:00 | Georgi Gerganov | Introduce C-style API (#370) | |
| 921 | 5cb63e2493c49bc2c3b9b355696e8dc26cdd0380 | da5303c1ea68aa19db829c634f1e10d08d409680 | 2023-03-20T08:24:11Z | Stephan Walter | Add tqdm to Python requirements (#293) | |
| 922 | 7392f1cd2cef4dfed41f4db7c4160ab86c0dfcd9 | ad5fd5b60cfdfbfb22b0f2bc9e9f6c9692768f8d | 2023-03-19T12:38:44-06:00 | Suaj Carrot | Improved quantize script (#222) |